{"as_of":"2026-08-17T04:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:177043bbfed1c34fd9b3b064b6aa14fa5abbd9edaafb87cbf1d43978d2eae757","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:18:41.264812Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T10:05:31.211127Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T09:36:27.709505Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.24768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24768","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xinyin Ma, Gongfan Fang, and Xinchao Wang","venue":null,"work_id":"e5f5639b-40bc-45f1-ac14-1170ee56a384","year":null},"citing_paper":{"arxiv_id":"2604.27115","last_updated":"2026-04-29T19:08:15Z","snapshot_observed_at":"2026-08-11T03:10:29.503671Z","submitted_at":"2026-04-29T19:08:15Z","title":"Exploring the Limits of Pruning: Task-Specific Neurons, Model Collapse, and Recovery in Task-Specific Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T10:05:31.211127Z"},"links":{"cited_paper":"/paper/2505.24768","citing_paper":"/paper/2604.27115"},"observation_digest":"sha256:029f5d1a2ccafa0351d6f9a95b6d03f68010b3d7ceeed3688039e2fca0616546","observation_id":"28b993e3-6aa7-4e55-8b6b-1b90158b002c","resolution":{"observed_at":"2026-05-12T09:36:27.711589Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24768/citation-record","integrity":"/paper/2505.24768/integrity","json":"/paper/2505.24768/citation-record.json","paper":"/paper/2505.24768"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:51.122919Z","title":"Abusamra","venue":null,"work_id":"53078097-6c39-4f94-a08c-cb56da3dce8d","year":2013},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.021687Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:8395b8be08513cca32712e0da0d7f18af73df23375e13de6f788e4964e823980","observation_id":"955e7c36-1f92-434c-b016-3492a0a3b8f5","resolution":{"observed_at":"2026-08-07T12:18:51.192083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T03:30:12.735656Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:18:34.113359Z","title":"Achiam, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.113359Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:74bf9831de414d7cc0cdcf28da77ca5054435e33e5b369c8b8a77ae48f117111","observation_id":"717ce4d7-b95c-43bd-a5e4-0f062df5338f","resolution":{"observed_at":"2026-08-07T12:18:34.113359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:50.955944Z","title":"Arora, Y","venue":null,"work_id":"b1df9291-15a6-4ddc-87d4-e325874f9bea","year":2017},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.249856Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:566cd39a327dfdcdc9e3e886b2fb833319f61384835a8938fe1465e5d2f5637b","observation_id":"f8bc84c6-97f7-411c-9214-2e9475965232","resolution":{"observed_at":"2026-08-07T12:18:51.019565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:50.788694Z","title":null,"venue":null,"work_id":"0f77f82b-5d39-46f6-bac0-555a270b0ff2","year":1996},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.353973Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:77b09188ba19ae74f127d2544f782b2005e07368c51c239caa49bd56d242e7e9","observation_id":"f5945726-1847-4a80-b354-2e34692a2ce4","resolution":{"observed_at":"2026-08-07T12:18:50.860242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:34.419589Z","title":"Brown, B","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.419589Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:89d842ef887832155d28d1af2751d35b4fbffdbb8f3657c2d09fc7da761c88f1","observation_id":"551459cd-a9dc-4435-b4c4-6a126aeaf627","resolution":{"observed_at":"2026-08-07T12:18:34.419589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-07T12:18:34.512980Z","title":"Bubeck, V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.512980Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:9216ec3af1da05a4ff3e504ac8e9c7737d10bee776e87a5d61cc0ddf63dc7472","observation_id":"c846e394-5355-499e-9802-aadefe349fff","resolution":{"observed_at":"2026-08-07T12:18:34.512980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:50.596719Z","title":"Bukharin, S","venue":null,"work_id":"b941ffea-0ecc-4f02-bb8d-1cf06187e9b2","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.570337Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:237216237d000201a62f92c9387ec2d60aa97d2ee060ae1c7728121e1ec1cdb4","observation_id":"737f79c6-27f5-43e0-8df3-2bb219aa9dd0","resolution":{"observed_at":"2026-08-07T12:18:50.674414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-08-16T13:07:44.720730Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-07T12:18:34.656149Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.656149Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:2de51d3be3981125df47805b905a1e7128b9fd4c73ec964d06b01e9c029935b2","observation_id":"554c546f-1901-4c8e-a9e3-7f8222d36398","resolution":{"observed_at":"2026-08-07T12:18:34.656149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:34.756335Z","title":"Conover, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.756335Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:60744cd6aa9c97046801d5c2632c7efee6a2fc15db811b762381dea9ae14da4f","observation_id":"06de077b-a1dd-4497-9fa4-ebe572e04f41","resolution":{"observed_at":"2026-08-07T12:18:34.756335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:50.336794Z","title":"Dettmers, A","venue":null,"work_id":"5b4d8d6f-c61c-4561-b899-99fb2179aee5","year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.836156Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:88774c1789df740c5c04720434d8de56b3405a9cde80a7fb9cdf2b0a131a2769","observation_id":"0d13f6ae-b164-49f1-add5-9f7478dc0d63","resolution":{"observed_at":"2026-08-07T12:18:50.456617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:50.070640Z","title":"Devlin, M.-W","venue":null,"work_id":"0b0aea59-74ec-48cf-8eb6-088f46f5b3d5","year":2019},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.929730Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:fef313aec93aaabf7e4e8ca0fca42c210d82755b0bbe9a17f22315d5aae7d46b","observation_id":"aa72cacd-b7dd-45aa-aa25-611cbe73cc14","resolution":{"observed_at":"2026-08-07T12:18:50.154427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15653","last_updated":"2023-11-27T09:33:13Z","snapshot_observed_at":"2026-08-16T14:40:09.197913Z","submitted_at":"2023-11-27T09:33:13Z","title":"MoDS: Model-oriented Data Selection for Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15653","snapshot_observed_at":"2026-08-07T12:18:35.076667Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:35.076667Z"},"links":{"cited_paper":"/paper/2311.15653","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:4dbde684b561d363e49bff1b1da06901a4ffc5a3d9b7886f7719fb4621d85527","observation_id":"710484db-8632-42f5-8d21-7c052288458a","resolution":{"observed_at":"2026-08-07T12:18:35.076667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:18:35.201938Z","title":"Dubey, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:35.201938Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:fdeb6561103432c917ef8888ab12ea014ab348a34d9df8efd4e33ded3f28b929","observation_id":"f9fabff6-de4d-4af1-beaa-399baeee24a5","resolution":{"observed_at":"2026-08-07T12:18:35.201938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:49.940077Z","title":"Ester, H.-P","venue":null,"work_id":"69451ce2-4b45-442b-817b-0d5ef9710841","year":1996},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:35.323158Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:3d0ceb14075a8d9aed8f79b7c70e3893afaca9ec60115667aa1b5d2dd8e95a69","observation_id":"60effee0-1ce6-4d18-bbf5-10eacd063fa9","resolution":{"observed_at":"2026-08-07T12:18:49.994603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20094","last_updated":"2025-05-08T00:24:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-28T17:59:01Z","title":"Scaling Synthetic Data Creation with 1,000,000,000 Personas","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20094","snapshot_observed_at":"2026-08-07T12:18:35.482012Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:35.482012Z"},"links":{"cited_paper":"/paper/2406.20094","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:0f64b20660b343238af81fd582ee0b2bb47854e8b624e2bd4e81bef5f858f0c0","observation_id":"080b08cf-a195-4481-865f-e4d11a981fd5","resolution":{"observed_at":"2026-08-07T12:18:35.482012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:49.726109Z","title":null,"venue":null,"work_id":"e018f531-489f-4557-aa9b-76a93d7d6f11","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:35.663000Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:d5dfb3a06333048e4e69d6c78df9890a9ae500d037c32e234f2b0f2d3644c408","observation_id":"4e5443b1-dead-4a1e-988e-e9bdb97244e9","resolution":{"observed_at":"2026-08-07T12:18:49.850917Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05794","last_updated":"2022-03-11T08:35:15Z","snapshot_observed_at":"2026-07-06T12:46:41.057346Z","submitted_at":"2022-03-11T08:35:15Z","title":"BERTopic: Neural topic modeling with a class-based TF-IDF procedure","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05794","snapshot_observed_at":"2026-08-07T12:18:35.800342Z","title":"Grootendorst","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:35.800342Z"},"links":{"cited_paper":"/paper/2203.05794","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:1887c32c270befcfe6777a5f704c814d2309f99054cb0e2dfe324dbb4f9027f0","observation_id":"be3f877c-a946-435b-84e6-2224f489edac","resolution":{"observed_at":"2026-08-07T12:18:35.800342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:49.552023Z","title":"Hendrycks, C","venue":null,"work_id":"90fa4298-a208-402b-b7e7-2db3f7811f11","year":2021},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:35.949556Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:645366c9a7f58d3ba6bb04378ee53006522ecd3153e4f232a62c59ee6e4796bd","observation_id":"7996592b-5a05-4399-9716-6fbd8d183a04","resolution":{"observed_at":"2026-08-07T12:18:49.627835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:49.326436Z","title":null,"venue":null,"work_id":"c2736ebf-b331-41f6-b416-3bf92f02117d","year":2022},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:36.057962Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:5acef30c1ee5e3359a8e8dcefb44642b2a467bc0491776a6c05a4277cddafd14","observation_id":"ad6252ba-edf8-4ef7-bb8a-daeb38ef0755","resolution":{"observed_at":"2026-08-07T12:18:49.439901Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T12:18:36.169502Z","title":"Kaplan, S","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:36.169502Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:06633cfa58ac8ee2bd43a78e8232d7697e7e213e7ffef511159d4b600034ff04","observation_id":"ca96da29-fcef-4402-92b2-77947166f424","resolution":{"observed_at":"2026-08-07T12:18:36.169502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:49.057026Z","title":"Land and M","venue":null,"work_id":"09b156ce-f34e-4b0a-9351-6900e9384ea4","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:36.289952Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:96a47a607ffa4dad58d883328c9b7bfc7cba5becee6536c9721db4233609c9fa","observation_id":"3d6a9142-d21c-4809-ad2d-40f6d0786b82","resolution":{"observed_at":"2026-08-07T12:18:49.164629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:48.902563Z","title":null,"venue":null,"work_id":"3077f6ea-9e63-4d27-95e5-eccf7ac84801","year":2016},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:36.439983Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:a48076e49fd4e3a0e97f65be2d1efed89f5a2045229f8621548101af4f0b300b","observation_id":"a06dec65-040f-405c-b28c-1684acf703e1","resolution":{"observed_at":"2026-08-07T12:18:48.966854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-07T12:18:36.565098Z","title":"Li, W.-L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:36.565098Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:d8ae4a4151e84ea94270aa8fa7a320ffb0818cff10c3084d19402ac064fc1c4e","observation_id":"7abcd1b7-659a-40d8-a6c8-ee4a52fcda08","resolution":{"observed_at":"2026-08-07T12:18:36.565098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:48.697641Z","title":null,"venue":null,"work_id":"105c2896-bb96-4994-9a81-cdc3ec44e03f","year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:36.682751Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:99b2f9ae0d026ff4dd93301dffe2b730c795bb8e7f07bbc681671365563038c2","observation_id":"a4452475-b262-4556-afe4-20cd8f055f1d","resolution":{"observed_at":"2026-08-07T12:18:48.796672Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:48.546520Z","title":null,"venue":null,"work_id":"04e1e142-51b3-4cea-a17d-821797d4e916","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:36.844907Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:fa66ed0a43ca016500320a396ba8a865ed441e10785a50859ea0d451f90206ff","observation_id":"ba91417e-8fd3-4316-b1c0-49f97c5cfdc5","resolution":{"observed_at":"2026-08-07T12:18:48.613355Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:48.280831Z","title":null,"venue":null,"work_id":"bf9ca499-fef6-4585-9c6e-fc4b5273203f","year":2004},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:37.003655Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:7085a34fffb97dcd43d16f1d44a7f691f9d1da50d3c1091c84f808d618962517","observation_id":"f47b8f2a-da25-4b55-a873-f5e3fbc9c293","resolution":{"observed_at":"2026-08-07T12:18:48.430581Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:47.988114Z","title":null,"venue":null,"work_id":"df0f2e83-1c77-4cd3-aac3-1b8694fdb54c","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:37.143731Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:b8ac7155d7e0125b0945a7c1c35cddb2733edfc2b205a081e3ab4fc7f82b68d2","observation_id":"634648bb-e76a-48fa-b471-89b76272a90f","resolution":{"observed_at":"2026-08-07T12:18:48.100495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:47.741356Z","title":null,"venue":null,"work_id":"1567f8d8-03f0-49fa-8f45-53bb0d3e37aa","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:37.282654Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:8ad46195c04d30d30e7d59304a161e553cd613d82d37de2dbf7cb0f06d2d394a","observation_id":"72b4bc12-a1c6-40c5-95a1-42a3ab23baf1","resolution":{"observed_at":"2026-08-07T12:18:47.864115Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:47.582615Z","title":null,"venue":null,"work_id":"2896ed71-d711-41bb-8c3c-6039b3af68a7","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:37.416374Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:f8a456f523bda6ff26854a1eb20c62b0a1c016cb3e63a81960c05f085a7d946a","observation_id":"a0acb435-2cfd-456a-a10e-1cec52faee56","resolution":{"observed_at":"2026-08-07T12:18:47.651649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:47.262759Z","title":null,"venue":null,"work_id":"e27aca68-0b7c-40d3-903b-dccabb2d9a49","year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:37.528974Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:9b138a7f1dd463217f84a0a69e2327372aa4e21f7d9a6d6e57c94ae18305ef36","observation_id":"534e35b9-5480-4e5f-8889-627309e79337","resolution":{"observed_at":"2026-08-07T12:18:47.399593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:46.960004Z","title":"Madsen, N","venue":null,"work_id":"8be19f01-bf55-4311-8054-42d91384d661","year":2022},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:37.685609Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:827bc6adcecf05aea0ce8040c679de9787fbca63d1965cdd63f31a28f2ced53f","observation_id":"823e59dd-5d86-45e6-b463-3e8f7e42f74c","resolution":{"observed_at":"2026-08-07T12:18:47.096845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:46.755631Z","title":"McInnes, J","venue":null,"work_id":"3aec71cb-0dda-4c8a-b8db-cb42c0564d15","year":2017},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:37.847883Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:51c61b4b185d58d467058b6d62d8eb80d4cfc4d49cd5a51990418596dc2d6f02","observation_id":"a84192bb-e9d0-4578-9dce-be2cfa803a73","resolution":{"observed_at":"2026-08-07T12:18:46.838817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:37.980820Z","title":"McInnes, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:37.980820Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:fd61d9a7feb4a19405e6c514f064460ce946d2f76dc347de05eba9a2b8a7686c","observation_id":"beb33b9f-c489-4ccf-bd0f-2e0a93c75d6c","resolution":{"observed_at":"2026-08-07T12:18:37.980820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:46.414483Z","title":"Mikolov, I","venue":null,"work_id":"4b73eed0-a072-46ac-b81e-f96960d105e2","year":2013},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:38.104984Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:320e67efffa273c97b8c8dd3a42aaf87ede56c1d0165197cf2e04420b1f58402","observation_id":"c5c0fcc7-ff05-4a0e-9cda-deab31ffa940","resolution":{"observed_at":"2026-08-07T12:18:46.580853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:46.125792Z","title":"Ouyang, J","venue":null,"work_id":"d11f935c-ccfd-40f0-970c-e75e710bca6e","year":2022},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:38.229914Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:8d6f697796680fc0c3cbf899f3f72ec386cc1b3c7b177884db7fc4fa12f1f7f1","observation_id":"07056bf5-431e-4eaa-87bf-b8785428d642","resolution":{"observed_at":"2026-08-07T12:18:46.252330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:45.822204Z","title":"Padmakumar and H","venue":null,"work_id":"612c685d-2230-4b84-8e42-632e6fd3a3f9","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:38.346730Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:d2c57cf0ac8fc88b79608d91a539f7066e7ccbd7f18246f186182d522e228336","observation_id":"fd688051-1303-4683-8999-7b79873e5281","resolution":{"observed_at":"2026-08-07T12:18:45.942175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:38.465739Z","title":"Shaib, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:38.465739Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:d1d034f261ff49f669a8a655bc4329cc51b91b19d5cbce2280c505d12aff7cb2","observation_id":"1db9efa1-332a-4989-b442-4a13a1101edc","resolution":{"observed_at":"2026-08-07T12:18:38.465739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:45.572291Z","title":null,"venue":null,"work_id":"cf81a7a1-bbbc-42fa-8c01-40b7ee17f8ce","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:38.654230Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:11206d517d12a4a22c2e4fcd82119c8701af99fae9a00eb17637bd1c217b87ac","observation_id":"3497c890-2ac6-4274-b492-64fe1255d435","resolution":{"observed_at":"2026-08-07T12:18:45.668676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:18:38.774435Z","title":"Touvron, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:38.774435Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:5b55a50185270d98227c5e3bd2061fb2218b9e3604b3befeb400d714f930ee80","observation_id":"106218ef-91bc-425e-93ee-813da3a1fdbc","resolution":{"observed_at":"2026-08-07T12:18:38.774435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:45.293662Z","title":"Vaswani, N","venue":null,"work_id":"a5934128-d749-40bc-a9ba-bd4c6750bd18","year":2017},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:38.885518Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:d244bedd4aee1674c6a2bea5befd335f29a4f631ca1703541138d6798cdc3b9c","observation_id":"d483f112-799c-4a99-a9f6-ac75ee7edfd1","resolution":{"observed_at":"2026-08-07T12:18:45.437292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02318","last_updated":"2024-02-04T02:09:43Z","snapshot_observed_at":"2026-08-17T04:12:23.348318Z","submitted_at":"2024-02-04T02:09:43Z","title":"Diversity Measurement and Subset Selection for Instruction Tuning Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02318","snapshot_observed_at":"2026-08-07T12:18:38.961826Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:38.961826Z"},"links":{"cited_paper":"/paper/2402.02318","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:c44760e21ba34c5db2a581958adc01b3f3b6ee42695d8e177893638689e1fbf1","observation_id":"1754211a-5a7a-4b60-9ec2-197ae4a9fcae","resolution":{"observed_at":"2026-08-07T12:18:38.961826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:44.982127Z","title":null,"venue":null,"work_id":"5d613bf7-e052-4f7f-957b-03039e10eb7a","year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:39.071679Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:003e984595d250196f499ff7b74e419ac08d670f85dc193f7d4f949fe71244a5","observation_id":"ffcba2e2-e2d3-4bae-8d67-0d2a4c9f3f62","resolution":{"observed_at":"2026-08-07T12:18:45.113485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01257","last_updated":"2025-03-06T12:13:14Z","snapshot_observed_at":"2026-08-16T13:13:30.091783Z","submitted_at":"2024-10-02T06:05:52Z","title":"HelpSteer2-Preference: Complementing Ratings with Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01257","snapshot_observed_at":"2026-08-07T12:18:39.220697Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:39.220697Z"},"links":{"cited_paper":"/paper/2410.01257","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:9e3583bfc6ee356baa8a96f4a65708cd9b7966264614685e3e3706abba80dddc","observation_id":"42666668-3a53-487f-97a0-02efe5af086b","resolution":{"observed_at":"2026-08-07T12:18:39.220697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:44.698781Z","title":null,"venue":null,"work_id":"e08c7c89-e615-4f8f-9f01-ad37ebf460e9","year":2022},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:39.348003Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:4a54942e74e8d82a72333c5b5bbfde97932b14d7614d5cea0869489a8fe020d4","observation_id":"82776c4b-0e63-4f41-a97c-be8e174dee1e","resolution":{"observed_at":"2026-08-07T12:18:44.863180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:44.434911Z","title":"White, S","venue":null,"work_id":"af0cdc5e-56ea-4036-b2b9-5933a684afa9","year":2025},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:39.484874Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:bebc0899834a79c8a590166ee04239ba0a382e2caeb182ed3c7142e054025579","observation_id":"eebeced9-6c32-4984-a22a-b7e7dcdb9346","resolution":{"observed_at":"2026-08-07T12:18:44.540924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:44.147339Z","title":null,"venue":null,"work_id":"27605b06-afd5-4af2-9813-01b8c4fed369","year":2022},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:39.605411Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:e45121020380db83b5a19b63cb190ce363acdd2a836a9dec4bb1daf905d3c377","observation_id":"c2391c85-a538-4fc1-9d09-794d533bb8e4","resolution":{"observed_at":"2026-08-07T12:18:44.254301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:18:39.764845Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:39.764845Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:d491f3c040d8860a7937483f391ea92161978ca62a0a4bffe1c5f1f9e9c8721d","observation_id":"29db87e5-708c-497e-b70f-d39cd8849ac3","resolution":{"observed_at":"2026-08-07T12:18:39.764845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:43.909724Z","title":"Zhang, S","venue":null,"work_id":"0ef1b85a-f796-4d7d-bcc7-2c0e3b90dcb9","year":2020},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:39.892103Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:fac2ae87d77ffce4447d86cd83c759c66caba48d014a56e65fcfc66622f164eb","observation_id":"d40d78b2-934f-4b42-b491-87a1fd17bd57","resolution":{"observed_at":"2026-08-07T12:18:44.025611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:43.717650Z","title":null,"venue":null,"work_id":"c5395c92-65d0-4b34-bf70-e9105ad69ac5","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:39.966787Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:ec76851f98860b262419d477e8a84596fdfe796f1839a4235e82927327acc8a3","observation_id":"dabb8945-a7a8-45b2-b9ab-a40e295dbdf2","resolution":{"observed_at":"2026-08-07T12:18:43.796761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:43.399102Z","title":null,"venue":null,"work_id":"73123933-0284-4050-8e78-601eb8c7d1b5","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:40.130686Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:4a681f27c77a559432d11adc97cc69d739304f4b8b796bff1dd7413206465e69","observation_id":"0532fc73-02b4-4ea6-9d68-b87d946a76f3","resolution":{"observed_at":"2026-08-07T12:18:43.555753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:43.124135Z","title":"Zheng, R","venue":null,"work_id":"4f76d4f5-69f0-4830-9a3a-0d02170d2a64","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:40.248596Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:24e6a4c0d78a8c6f983cc08db2c2af3949096ba66a44b7021d3397630869f110","observation_id":"a4e0a418-08c7-4b63-88ec-4280baa1e1db","resolution":{"observed_at":"2026-08-07T12:18:43.267479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:42.863829Z","title":"Zhong, L","venue":null,"work_id":"60c60a80-98f7-4943-a6b7-50628d8bb2dc","year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:40.372496Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:942f7e7f02359eebc1bf5b03e427725a77157303d692ac239d192b9814afba4e","observation_id":"58a3e2d1-c745-4420-897c-50b415c90178","resolution":{"observed_at":"2026-08-07T12:18:42.996020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:42.583682Z","title":null,"venue":null,"work_id":"3d9c93c0-9c70-44d4-b206-a12472375748","year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:40.487494Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:eaf639ee5b0b4d8950ccd8cacbf79623217c65d00e58d952bcbd7feade58fa03","observation_id":"da7f78fc-11fc-443f-920b-ab369b102c8f","resolution":{"observed_at":"2026-08-07T12:18:42.735529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:42.263520Z","title":"important tokens","venue":null,"work_id":"93f0e22b-6186-4510-9000-a5944c7f5052","year":2018},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:40.606154Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:eb4c1a70f1dc173502cdd1cb76f60adae29ac5b5a74429696d24a55cc660cfe1","observation_id":"aeeb8243-7b0b-40f7-8557-9443b7fc360e","resolution":{"observed_at":"2026-08-07T12:18:42.401530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:40.726509Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:40.726509Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:6f1c11857bc16e624d19cb8bd51ecc6b421da988f500d7c6a02171d23d1230ce","observation_id":"13cfecf6-16af-404a-a6f1-a4eab20edecb","resolution":{"observed_at":"2026-08-07T12:18:40.726509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:40.837519Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:40.837519Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:913034a51c39e6eba8eb399d44148d033831fec3869d65997cf6a843c2bc5ffd","observation_id":"72983e3a-96ed-4085-94ef-69e07dc82984","resolution":{"observed_at":"2026-08-07T12:18:40.837519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:40.965271Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:40.965271Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:209760b89c44cd60f1b6c723e03ff98ed6a75afebb7828dddc10f02456124bb6","observation_id":"7cfeac98-459f-4bcf-9cde-244c57e9b178","resolution":{"observed_at":"2026-08-07T12:18:40.965271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:41.124019Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:41.124019Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:bf141921e2b5321583ef994174fb5e661c2eeebf8c62f59a81e366302a2e910f","observation_id":"ba3d3b17-164b-498e-98b2-0a9e0830c276","resolution":{"observed_at":"2026-08-07T12:18:41.124019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:41.989923Z","title":"Spelling and Grammar Check","venue":null,"work_id":"dd324bec-33af-4333-ab3c-f84aec85b23d","year":null},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:41.264812Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:c5e7b39e43281a4b3794d1f6b3532d4442282da4372720e88cb3fe9d169f1fa2","observation_id":"44889bba-3a7e-4a1d-bab2-7fec148fe107","resolution":{"observed_at":"2026-08-07T12:18:42.062444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T11:50:57.002773Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 1 inbound Pith citation observation for arXiv:2505.24768."}