{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:7TBNPJSZ3WJVA76PPWFAJ663AJ","short_pith_number":"pith:7TBNPJSZ","schema_version":"1.0","canonical_sha256":"fcc2d7a659dd93507fcf7d8a04fbdb0274970aefc97b44ab2fb149734fe533dd","source":{"kind":"arxiv","id":"2305.11779","version":1},"attestation_state":"computed","paper":{"title":"DMDD: A Large-Scale Dataset for Dataset Mentions Detection","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Cornelia Caragea, Eduard Dragut, Huitong Pan, Longin Jan Latecki, Qi Zhang","submitted_at":"2023-05-19T16:18:00Z","abstract_excerpt":"The recognition of dataset names is a critical task for automatic information extraction in scientific literature, enabling researchers to understand and identify research opportunities. However, existing corpora for dataset mention detection are limited in size and naming diversity. In this paper, we introduce the Dataset Mentions Detection Dataset (DMDD), the largest publicly available corpus for this task. DMDD consists of the DMDD main corpus, comprising 31,219 scientific articles with over 449,000 dataset mentions weakly annotated in the format of in-text spans, and an evaluation set, whi"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2305.11779","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2023-05-19T16:18:00Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"3ac89ddf090691d2bad53a17c018612ee943ed13bff4273c74274d8b220d8881","abstract_canon_sha256":"197cdebca62222ff23701a6fa686218dc13181697ef95c90a58577b0653c67a0"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:57:23.091667Z","signature_b64":"DJnCxqURmNbLVhtx/CkbQq7xu0qO356Wlny5eCyu/BIXfMCgXyuvUhXlHfGYtZVWTetciEfU+Jv18ZI7jo+HDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"fcc2d7a659dd93507fcf7d8a04fbdb0274970aefc97b44ab2fb149734fe533dd","last_reissued_at":"2026-07-05T06:57:23.091028Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:57:23.091028Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"DMDD: A Large-Scale Dataset for Dataset Mentions Detection","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Cornelia Caragea, Eduard Dragut, Huitong Pan, Longin Jan Latecki, Qi Zhang","submitted_at":"2023-05-19T16:18:00Z","abstract_excerpt":"The recognition of dataset names is a critical task for automatic information extraction in scientific literature, enabling researchers to understand and identify research opportunities. However, existing corpora for dataset mention detection are limited in size and naming diversity. In this paper, we introduce the Dataset Mentions Detection Dataset (DMDD), the largest publicly available corpus for this task. DMDD consists of the DMDD main corpus, comprising 31,219 scientific articles with over 449,000 dataset mentions weakly annotated in the format of in-text spans, and an evaluation set, whi"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2305.11779","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2305.11779/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2305.11779","created_at":"2026-07-05T06:57:23.091092+00:00"},{"alias_kind":"arxiv_version","alias_value":"2305.11779v1","created_at":"2026-07-05T06:57:23.091092+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2305.11779","created_at":"2026-07-05T06:57:23.091092+00:00"},{"alias_kind":"pith_short_12","alias_value":"7TBNPJSZ3WJV","created_at":"2026-07-05T06:57:23.091092+00:00"},{"alias_kind":"pith_short_16","alias_value":"7TBNPJSZ3WJVA76P","created_at":"2026-07-05T06:57:23.091092+00:00"},{"alias_kind":"pith_short_8","alias_value":"7TBNPJSZ","created_at":"2026-07-05T06:57:23.091092+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2504.16041","citing_title":"Muon Optimizer Accelerates Grokking","ref_index":12,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/7TBNPJSZ3WJVA76PPWFAJ663AJ","json":"https://pith.science/pith/7TBNPJSZ3WJVA76PPWFAJ663AJ.json","graph_json":"https://pith.science/api/pith-number/7TBNPJSZ3WJVA76PPWFAJ663AJ/graph.json","events_json":"https://pith.science/api/pith-number/7TBNPJSZ3WJVA76PPWFAJ663AJ/events.json","paper":"https://pith.science/paper/7TBNPJSZ"},"agent_actions":{"view_html":"https://pith.science/pith/7TBNPJSZ3WJVA76PPWFAJ663AJ","download_json":"https://pith.science/pith/7TBNPJSZ3WJVA76PPWFAJ663AJ.json","view_paper":"https://pith.science/paper/7TBNPJSZ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2305.11779&json=true","fetch_graph":"https://pith.science/api/pith-number/7TBNPJSZ3WJVA76PPWFAJ663AJ/graph.json","fetch_events":"https://pith.science/api/pith-number/7TBNPJSZ3WJVA76PPWFAJ663AJ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/7TBNPJSZ3WJVA76PPWFAJ663AJ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/7TBNPJSZ3WJVA76PPWFAJ663AJ/action/storage_attestation","attest_author":"https://pith.science/pith/7TBNPJSZ3WJVA76PPWFAJ663AJ/action/author_attestation","sign_citation":"https://pith.science/pith/7TBNPJSZ3WJVA76PPWFAJ663AJ/action/citation_signature","submit_replication":"https://pith.science/pith/7TBNPJSZ3WJVA76PPWFAJ663AJ/action/replication_record"}},"created_at":"2026-07-05T06:57:23.091092+00:00","updated_at":"2026-07-05T06:57:23.091092+00:00"}