{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:2KUDSJAXLDLSGCEX3YWSAO4BYU","short_pith_number":"pith:2KUDSJAX","schema_version":"1.0","canonical_sha256":"d2a839241758d7230897de2d203b81c539b2982dd08b609cee26a87212eedb06","source":{"kind":"arxiv","id":"2503.11441","version":2},"attestation_state":"computed","paper":{"title":"D3: Diversity, Difficulty, and Dependability-Aware Data Selection for Sample-Efficient LLM Instruction Tuning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Bo Zheng, Chen-Xi Zhang, Jia Zhang, Lan-Zhe Guo, Xiao-Wen Yang, Yao Liu, Yi Liu, Yi-Xuan Jin","submitted_at":"2025-03-14T14:28:19Z","abstract_excerpt":"Recent advancements in instruction tuning for large language models (LLMs) suggest that a small, high-quality dataset can significantly equip LLMs with instruction-following capabilities, outperforming large datasets often burdened by quality and redundancy issues. However, the challenge lies in automatically identifying valuable subsets from large datasets to boost both the effectiveness and efficiency of instruction tuning. In this paper, we first establish data selection criteria based on three distinct aspects of data value: diversity, difficulty, and dependability, and then propose the D3"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2503.11441","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-03-14T14:28:19Z","cross_cats_sorted":[],"title_canon_sha256":"cccaa87e9c56607ce2fa452ed7af9d738835430992b2fa5cbec50f5001cdcc00","abstract_canon_sha256":"54eee982fccb6f6d200426d44b8efe143114d2b50e045475833a4006c9073cbd"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:04:47.286296Z","signature_b64":"/rVKmRyXvYfGvJAQ005F4oTZlIoUL+jgNGjvyI2HTyH0USaLxV01QD0xSP77M+4HgaIqhPNrF70L8tsmCTrUDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d2a839241758d7230897de2d203b81c539b2982dd08b609cee26a87212eedb06","last_reissued_at":"2026-07-05T11:04:47.285745Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:04:47.285745Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"D3: Diversity, Difficulty, and Dependability-Aware Data Selection for Sample-Efficient LLM Instruction Tuning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Bo Zheng, Chen-Xi Zhang, Jia Zhang, Lan-Zhe Guo, Xiao-Wen Yang, Yao Liu, Yi Liu, Yi-Xuan Jin","submitted_at":"2025-03-14T14:28:19Z","abstract_excerpt":"Recent advancements in instruction tuning for large language models (LLMs) suggest that a small, high-quality dataset can significantly equip LLMs with instruction-following capabilities, outperforming large datasets often burdened by quality and redundancy issues. However, the challenge lies in automatically identifying valuable subsets from large datasets to boost both the effectiveness and efficiency of instruction tuning. In this paper, we first establish data selection criteria based on three distinct aspects of data value: diversity, difficulty, and dependability, and then propose the D3"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2503.11441","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2503.11441/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2503.11441","created_at":"2026-07-05T11:04:47.285808+00:00"},{"alias_kind":"arxiv_version","alias_value":"2503.11441v2","created_at":"2026-07-05T11:04:47.285808+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2503.11441","created_at":"2026-07-05T11:04:47.285808+00:00"},{"alias_kind":"pith_short_12","alias_value":"2KUDSJAXLDLS","created_at":"2026-07-05T11:04:47.285808+00:00"},{"alias_kind":"pith_short_16","alias_value":"2KUDSJAXLDLSGCEX","created_at":"2026-07-05T11:04:47.285808+00:00"},{"alias_kind":"pith_short_8","alias_value":"2KUDSJAX","created_at":"2026-07-05T11:04:47.285808+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.18307","citing_title":"DRIFT: Refining Instruction Data via On-Policy Data Attribution","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26924","citing_title":"Learning to Adapt SFT Data for Better Reasoning Generalization","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2512.11470","citing_title":"Rethinking Expert Trajectory Utilization in LLM Post-training for Mathematical Reasoning","ref_index":50,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/2KUDSJAXLDLSGCEX3YWSAO4BYU","json":"https://pith.science/pith/2KUDSJAXLDLSGCEX3YWSAO4BYU.json","graph_json":"https://pith.science/api/pith-number/2KUDSJAXLDLSGCEX3YWSAO4BYU/graph.json","events_json":"https://pith.science/api/pith-number/2KUDSJAXLDLSGCEX3YWSAO4BYU/events.json","paper":"https://pith.science/paper/2KUDSJAX"},"agent_actions":{"view_html":"https://pith.science/pith/2KUDSJAXLDLSGCEX3YWSAO4BYU","download_json":"https://pith.science/pith/2KUDSJAXLDLSGCEX3YWSAO4BYU.json","view_paper":"https://pith.science/paper/2KUDSJAX","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2503.11441&json=true","fetch_graph":"https://pith.science/api/pith-number/2KUDSJAXLDLSGCEX3YWSAO4BYU/graph.json","fetch_events":"https://pith.science/api/pith-number/2KUDSJAXLDLSGCEX3YWSAO4BYU/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/2KUDSJAXLDLSGCEX3YWSAO4BYU/action/timestamp_anchor","attest_storage":"https://pith.science/pith/2KUDSJAXLDLSGCEX3YWSAO4BYU/action/storage_attestation","attest_author":"https://pith.science/pith/2KUDSJAXLDLSGCEX3YWSAO4BYU/action/author_attestation","sign_citation":"https://pith.science/pith/2KUDSJAXLDLSGCEX3YWSAO4BYU/action/citation_signature","submit_replication":"https://pith.science/pith/2KUDSJAXLDLSGCEX3YWSAO4BYU/action/replication_record"}},"created_at":"2026-07-05T11:04:47.285808+00:00","updated_at":"2026-07-05T11:04:47.285808+00:00"}