{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:VEG4GUCR34QTP5H7DVXOU7SLFX","short_pith_number":"pith:VEG4GUCR","schema_version":"1.0","canonical_sha256":"a90dc35051df2137f4ff1d6eea7e4b2ddcd29e96bba108719c9d444f3ce17673","source":{"kind":"arxiv","id":"2308.04729","version":2},"attestation_state":"computed","paper":{"title":"JEN-1: Text-Guided Universal Music Generation with Omnidirectional Diffusion Models","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.AI","cs.LG","cs.MM","eess.AS"],"primary_cat":"cs.SD","authors_text":"Alex Wang, Allen Wang, Boyu Chen, Peike Li, Yao Yao, Yikai Wang","submitted_at":"2023-08-09T06:27:24Z","abstract_excerpt":"Music generation has attracted growing interest with the advancement of deep generative models. However, generating music conditioned on textual descriptions, known as text-to-music, remains challenging due to the complexity of musical structures and high sampling rate requirements. Despite the task's significance, prevailing generative models exhibit limitations in music quality, computational efficiency, and generalization. This paper introduces JEN-1, a universal high-fidelity model for text-to-music generation. JEN-1 is a diffusion model incorporating both autoregressive and non-autoregres"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2308.04729","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","primary_cat":"cs.SD","submitted_at":"2023-08-09T06:27:24Z","cross_cats_sorted":["cs.AI","cs.LG","cs.MM","eess.AS"],"title_canon_sha256":"1fb935c58ba1f38af6e31f8975022aaab4b6ce9bd080fcbbd42cc58afa920eef","abstract_canon_sha256":"65755c767da6af1ea81c9a0929616c01afc376bf016e10a5567ddea22661ce77"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:59:22.466692Z","signature_b64":"2v9ocPMXHAH6oI+QE+wlITlI2cvBJ6oaLwHzYPoCIYQiKQXQEFfYnScD9wWRGEgJPc8RoW0x5GYC6wcAkCxODg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a90dc35051df2137f4ff1d6eea7e4b2ddcd29e96bba108719c9d444f3ce17673","last_reissued_at":"2026-07-05T10:59:22.466147Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:59:22.466147Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"JEN-1: Text-Guided Universal Music Generation with Omnidirectional Diffusion Models","license":"http://creativecommons.org/licenses/by-nc-nd/4.0/","headline":"","cross_cats":["cs.AI","cs.LG","cs.MM","eess.AS"],"primary_cat":"cs.SD","authors_text":"Alex Wang, Allen Wang, Boyu Chen, Peike Li, Yao Yao, Yikai Wang","submitted_at":"2023-08-09T06:27:24Z","abstract_excerpt":"Music generation has attracted growing interest with the advancement of deep generative models. However, generating music conditioned on textual descriptions, known as text-to-music, remains challenging due to the complexity of musical structures and high sampling rate requirements. Despite the task's significance, prevailing generative models exhibit limitations in music quality, computational efficiency, and generalization. This paper introduces JEN-1, a universal high-fidelity model for text-to-music generation. JEN-1 is a diffusion model incorporating both autoregressive and non-autoregres"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2308.04729","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2308.04729/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2308.04729","created_at":"2026-07-05T10:59:22.466207+00:00"},{"alias_kind":"arxiv_version","alias_value":"2308.04729v2","created_at":"2026-07-05T10:59:22.466207+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2308.04729","created_at":"2026-07-05T10:59:22.466207+00:00"},{"alias_kind":"pith_short_12","alias_value":"VEG4GUCR34QT","created_at":"2026-07-05T10:59:22.466207+00:00"},{"alias_kind":"pith_short_16","alias_value":"VEG4GUCR34QTP5H7","created_at":"2026-07-05T10:59:22.466207+00:00"},{"alias_kind":"pith_short_8","alias_value":"VEG4GUCR","created_at":"2026-07-05T10:59:22.466207+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.27838","citing_title":"Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text","ref_index":15,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/VEG4GUCR34QTP5H7DVXOU7SLFX","json":"https://pith.science/pith/VEG4GUCR34QTP5H7DVXOU7SLFX.json","graph_json":"https://pith.science/api/pith-number/VEG4GUCR34QTP5H7DVXOU7SLFX/graph.json","events_json":"https://pith.science/api/pith-number/VEG4GUCR34QTP5H7DVXOU7SLFX/events.json","paper":"https://pith.science/paper/VEG4GUCR"},"agent_actions":{"view_html":"https://pith.science/pith/VEG4GUCR34QTP5H7DVXOU7SLFX","download_json":"https://pith.science/pith/VEG4GUCR34QTP5H7DVXOU7SLFX.json","view_paper":"https://pith.science/paper/VEG4GUCR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2308.04729&json=true","fetch_graph":"https://pith.science/api/pith-number/VEG4GUCR34QTP5H7DVXOU7SLFX/graph.json","fetch_events":"https://pith.science/api/pith-number/VEG4GUCR34QTP5H7DVXOU7SLFX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/VEG4GUCR34QTP5H7DVXOU7SLFX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/VEG4GUCR34QTP5H7DVXOU7SLFX/action/storage_attestation","attest_author":"https://pith.science/pith/VEG4GUCR34QTP5H7DVXOU7SLFX/action/author_attestation","sign_citation":"https://pith.science/pith/VEG4GUCR34QTP5H7DVXOU7SLFX/action/citation_signature","submit_replication":"https://pith.science/pith/VEG4GUCR34QTP5H7DVXOU7SLFX/action/replication_record"}},"created_at":"2026-07-05T10:59:22.466207+00:00","updated_at":"2026-07-05T10:59:22.466207+00:00"}