{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:2F356QTWRSPFR6CTXABYHJDZOW","short_pith_number":"pith:2F356QTW","schema_version":"1.0","canonical_sha256":"d177df42768c9e58f853b80383a479759fa61dd9a6e96527ff04299f91efc442","source":{"kind":"arxiv","id":"2407.06947","version":2},"attestation_state":"computed","paper":{"title":"Audio-Language Datasets of Scenes and Events: A Survey","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["eess.AS"],"primary_cat":"cs.SD","authors_text":"Elia Formisano, Gijs Wijngaard, Michel Dumontier, Michele Esposito","submitted_at":"2024-07-09T15:23:35Z","abstract_excerpt":"Audio-language models (ALMs) generate linguistic descriptions of sound-producing events and scenes. Advances in dataset creation and computational power have led to significant progress in this domain. This paper surveys 69 datasets used to train ALMs, covering research up to September 2024 (https://github.com/GLJS/audio-datasets). It provides a comprehensive analysis of datasets origins, audio and linguistic characteristics, and use cases. Key sources include YouTube-based datasets like AudioSet with over two million samples, and community platforms like Freesound with over 1 million samples."},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.06947","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.SD","submitted_at":"2024-07-09T15:23:35Z","cross_cats_sorted":["eess.AS"],"title_canon_sha256":"d159a24e8f22d6e2b9f597caa36e4570e6b841d9f6fd6ada083db257d4d97b91","abstract_canon_sha256":"fbdd04b8671c96e3c8976d71ecb3352b2a7dc3ce401167732aa70407c9d69e63"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:10:41.840032Z","signature_b64":"ai0FIuVJrh3DSTEiDAmGxvdTgBYTsHV+eMVof3WP1SS5nY8KGL696bNysY9V6B75eKYqgk8pso35jAw1wX+gAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d177df42768c9e58f853b80383a479759fa61dd9a6e96527ff04299f91efc442","last_reissued_at":"2026-07-05T10:10:41.839560Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:10:41.839560Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Audio-Language Datasets of Scenes and Events: A Survey","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["eess.AS"],"primary_cat":"cs.SD","authors_text":"Elia Formisano, Gijs Wijngaard, Michel Dumontier, Michele Esposito","submitted_at":"2024-07-09T15:23:35Z","abstract_excerpt":"Audio-language models (ALMs) generate linguistic descriptions of sound-producing events and scenes. Advances in dataset creation and computational power have led to significant progress in this domain. This paper surveys 69 datasets used to train ALMs, covering research up to September 2024 (https://github.com/GLJS/audio-datasets). It provides a comprehensive analysis of datasets origins, audio and linguistic characteristics, and use cases. Key sources include YouTube-based datasets like AudioSet with over two million samples, and community platforms like Freesound with over 1 million samples."},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.06947","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.06947/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.06947","created_at":"2026-07-05T10:10:41.839614+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.06947v2","created_at":"2026-07-05T10:10:41.839614+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.06947","created_at":"2026-07-05T10:10:41.839614+00:00"},{"alias_kind":"pith_short_12","alias_value":"2F356QTWRSPF","created_at":"2026-07-05T10:10:41.839614+00:00"},{"alias_kind":"pith_short_16","alias_value":"2F356QTWRSPFR6CT","created_at":"2026-07-05T10:10:41.839614+00:00"},{"alias_kind":"pith_short_8","alias_value":"2F356QTW","created_at":"2026-07-05T10:10:41.839614+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2509.05786","citing_title":"Effectively obtaining acoustic, visual and textual data from videos","ref_index":117,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/2F356QTWRSPFR6CTXABYHJDZOW","json":"https://pith.science/pith/2F356QTWRSPFR6CTXABYHJDZOW.json","graph_json":"https://pith.science/api/pith-number/2F356QTWRSPFR6CTXABYHJDZOW/graph.json","events_json":"https://pith.science/api/pith-number/2F356QTWRSPFR6CTXABYHJDZOW/events.json","paper":"https://pith.science/paper/2F356QTW"},"agent_actions":{"view_html":"https://pith.science/pith/2F356QTWRSPFR6CTXABYHJDZOW","download_json":"https://pith.science/pith/2F356QTWRSPFR6CTXABYHJDZOW.json","view_paper":"https://pith.science/paper/2F356QTW","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.06947&json=true","fetch_graph":"https://pith.science/api/pith-number/2F356QTWRSPFR6CTXABYHJDZOW/graph.json","fetch_events":"https://pith.science/api/pith-number/2F356QTWRSPFR6CTXABYHJDZOW/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/2F356QTWRSPFR6CTXABYHJDZOW/action/timestamp_anchor","attest_storage":"https://pith.science/pith/2F356QTWRSPFR6CTXABYHJDZOW/action/storage_attestation","attest_author":"https://pith.science/pith/2F356QTWRSPFR6CTXABYHJDZOW/action/author_attestation","sign_citation":"https://pith.science/pith/2F356QTWRSPFR6CTXABYHJDZOW/action/citation_signature","submit_replication":"https://pith.science/pith/2F356QTWRSPFR6CTXABYHJDZOW/action/replication_record"}},"created_at":"2026-07-05T10:10:41.839614+00:00","updated_at":"2026-07-05T10:10:41.839614+00:00"}