{"as_of":"2026-08-17T16:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b7a65d819e8109ff215f3421a405c8c0fef58c5bc16059da13119a19c79b02a","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:22:18.146028Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.12641/citation-record","integrity":"/paper/2411.12641/integrity","json":"/paper/2411.12641/citation-record.json","paper":"/paper/2411.12641"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-17T00:33:41.369960Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-12T17:22:17.824039Z","title":"MusicLM: Generating music from text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.824039Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:d7919b7d8d1bed8b49bf3b4349cc34664a8a430a4d0bf656256bc203c32a43a2","observation_id":"990d35bb-ab15-4a86-b710-5824cc4d88dc","resolution":{"observed_at":"2026-08-12T17:22:17.824039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.314322Z","title":"Look, listen, and learn more: Design choices for deep audio embeddings","venue":null,"work_id":"92c42b0d-23a1-4bed-8453-fdbc6ce24c58","year":2019},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.846659Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:d2ca0a292a19b00c689ef6ad70b712370ab78ff24ae993728e4833796009476d","observation_id":"d34cade4-29f9-4155-a4e3-af00fe1ce649","resolution":{"observed_at":"2026-08-12T17:22:19.319985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T17:22:17.850829Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.850829Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:51c4202215c17bbb45559d7d5f4fa19d256494c5ed21f6b21b738c533c71519d","observation_id":"c1dbbc6d-6d7c-4958-b17f-ec351a2cf76e","resolution":{"observed_at":"2026-08-12T17:22:17.850829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16372","last_updated":"2023-07-31T02:32:02Z","snapshot_observed_at":"2026-08-16T15:12:06.867651Z","submitted_at":"2023-07-31T02:32:02Z","title":"LP-MusicCaps: LLM-Based Pseudo Music Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16372","snapshot_observed_at":"2026-08-12T17:22:17.865512Z","title":"LP-MusicCaps: LLM-based pseudo music captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.865512Z"},"links":{"cited_paper":"/paper/2307.16372","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:152435008d894e4855e2b8047a129cde0312fe7c51d25dfa6340c3e2782219f0","observation_id":"e601f507-1b25-4895-bf77-6822b18f1367","resolution":{"observed_at":"2026-08-12T17:22:17.865512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12662","last_updated":"2023-01-30T04:53:23Z","snapshot_observed_at":"2026-08-16T15:59:17.714674Z","submitted_at":"2023-01-30T04:53:23Z","title":"SingSong: Generating musical accompaniments from singing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12662","snapshot_observed_at":"2026-08-12T17:22:17.869956Z","title":"Singsong: Generating musical accompaniments from singing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.869956Z"},"links":{"cited_paper":"/paper/2301.12662","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:f9f2607028dbe603dcc3f9cdb3840c931c04186a8cf9e103c80bb4f6fad92908","observation_id":"86c8d089-5c58-4df5-955c-7d032858bf5d","resolution":{"observed_at":"2026-08-12T17:22:17.869956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.302072Z","title":"Joint music and language attention models for zero-shot music tagging","venue":null,"work_id":"cb7a42a3-08e4-4dc4-b684-4e36a20a8ac4","year":2024},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.874701Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:f8682658feab6b6f4d122f67626ce50ebd8a9825aaaec7daff01d6784b0df03e","observation_id":"5b17c951-e43c-4d6e-ba22-54cbf1d17685","resolution":{"observed_at":"2026-08-12T17:22:19.306287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10301","last_updated":"2024-07-29T14:52:26Z","snapshot_observed_at":"2026-08-17T11:23:59.787786Z","submitted_at":"2024-04-16T06:09:33Z","title":"Long-form music generation with latent diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10301","snapshot_observed_at":"2026-08-12T17:22:17.879005Z","title":"Fast timing-conditioned latent audio diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.879005Z"},"links":{"cited_paper":"/paper/2404.10301","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:a66013089102034a5f27d48f78717c3846dd39c148f223cb020b111067dfde79","observation_id":"c37ee982-b157-47eb-8672-99a29fa3df47","resolution":{"observed_at":"2026-08-12T17:22:17.879005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04686","last_updated":"2023-07-12T17:06:41Z","snapshot_observed_at":"2026-08-16T15:17:23.991877Z","submitted_at":"2023-07-10T16:42:03Z","title":"VampNet: Music Generation via Masked Acoustic Token Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04686","snapshot_observed_at":"2026-08-12T17:22:17.883184Z","title":"Hugo Flores Garcia, Prem Seetharaman, Rithesh Kumar, and Bryan Pardo","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.883184Z"},"links":{"cited_paper":"/paper/2307.04686","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:aa93697c2770c6a57f06e33e23f9033e55bd3ceb802b2a27926c88a3e18606c6","observation_id":"214f2509-3365-4596-b4c2-900f898a8b6c","resolution":{"observed_at":"2026-08-12T17:22:17.883184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.289649Z","title":"Audio set: An ontology and human-labeled dataset for audio events","venue":null,"work_id":"52b26af8-8e28-4e50-99e8-faa38007812f","year":2017},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.887501Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:1d74c81819fc90b31ccf1e585ff3e8eb5325f153dc9a990658d184fac8f6d8bf","observation_id":"506b6021-d676-4bda-b7e1-a3572e26369f","resolution":{"observed_at":"2026-08-12T17:22:19.294067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08753","last_updated":"2024-07-30T18:58:01Z","snapshot_observed_at":"2026-08-16T14:52:31.155134Z","submitted_at":"2023-10-12T22:43:38Z","title":"CompA: Addressing the Gap in Compositional Reasoning in Audio-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08753","snapshot_observed_at":"2026-08-12T17:22:17.891727Z","title":"Compa: Addressing the gap in compositional reasoning in audio-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.891727Z"},"links":{"cited_paper":"/paper/2310.08753","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:521c874679483aaad5916542e52d3dbc7673d7d97bc7569bed6f1856ddaa75d4","observation_id":"40bc01b0-0948-4894-8ce8-254c2ef195ae","resolution":{"observed_at":"2026-08-12T17:22:17.891727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14360","last_updated":"2023-12-12T06:55:08Z","snapshot_observed_at":"2026-08-17T14:11:32.083206Z","submitted_at":"2023-08-28T07:11:42Z","title":"InstructME: An Instruction Guided Music Edit And Remix Framework with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14360","snapshot_observed_at":"2026-08-12T17:22:17.896554Z","title":"Instructme: An instruction guided music edit and remix framework with latent diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.896554Z"},"links":{"cited_paper":"/paper/2308.14360","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:d14521d0771b8be6c08e84f6aaae116d603a651fb8d87d2bfb81c728d1b6f46b","observation_id":"eca96272-26cb-4398-8d2b-0d765900055d","resolution":{"observed_at":"2026-08-12T17:22:17.896554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T17:22:17.905866Z","title":"Cheng-Zhi Anna Huang, Tim Cooijmans, Adam Roberts, Aaron Courville, and Douglas Eck","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.905866Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:48ca02acce9f801d05610db33f9c4758d1bda974b4fa9daabc886474668c7d0d","observation_id":"de35cce0-8fe5-440a-9b0a-fdbdb3d63b6b","resolution":{"observed_at":"2026-08-12T17:22:17.905866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11255","last_updated":"2024-12-09T16:15:07Z","snapshot_observed_at":"2026-08-16T14:42:06.397804Z","submitted_at":"2023-11-19T06:50:52Z","title":"M$^{2}$UGen: Multi-modal Music Understanding and Generation with the Power of Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11255","snapshot_observed_at":"2026-08-12T17:22:17.914502Z","title":"M 2ugen: Multi-modal music understanding and generation with the power of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.914502Z"},"links":{"cited_paper":"/paper/2311.11255","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:bc9f84244fbbe8d174285a9025b5b91b7eead884304fb54a0183c5d167a8a3f3","observation_id":"524d5f25-d188-48a5-8ee9-4bfb8847f6c7","resolution":{"observed_at":"2026-08-12T17:22:17.914502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.274644Z","title":null,"venue":null,"work_id":"a0c23215-ef3f-433f-a038-a9cf09aaefe9","year":2016},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.919166Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:af32ec857e246e3ee4bd641ee6354ca98426d1e39f420098d60d5b16ebc03fa4","observation_id":"b5579418-771a-4633-a14e-002d6cbfc947","resolution":{"observed_at":"2026-08-12T17:22:19.280963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10384","last_updated":"2023-12-28T15:08:07Z","snapshot_observed_at":"2026-08-16T14:42:27.751713Z","submitted_at":"2023-11-17T08:21:56Z","title":"Retrieval Augmented Generation of Symbolic Music with LLMs","version":2},"cited_work":{"arxiv_id":"2311.10384","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.10384","snapshot_observed_at":"2026-08-12T17:22:18.869890Z","title":"Retrieval Augmented Generation of Symbolic Music with LLMs","venue":"cs.SD","work_id":"8331ecd2-2830-4d9d-bac4-bb2f6ca62594","year":2023},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.928087Z"},"links":{"cited_paper":"/paper/2311.10384","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:dc9c2c83d8d714e1c7de25d6db6bb86799f27fda14952c9bddb7cfc582e82721","observation_id":"b0111806-a9f6-4f14-af0e-a808c2b3e499","resolution":{"observed_at":"2026-08-12T17:22:18.874918Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-15T08:25:11.276003Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-12T17:22:17.932668Z","title":"Fr\\’echet audio distance: A metric for evaluating music enhancement algo- rithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.932668Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:b231e8f327f2978bfd45f36ad93a523e4c95e51901ded001cca8e2c762f3039f","observation_id":"7959ab72-2e7a-45c1-94b1-1a48bcaa3460","resolution":{"observed_at":"2026-08-12T17:22:17.932668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-12T17:22:17.941042Z","title":"Auto-encoding variational Bayes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.941042Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:ebae89a712b4239037ee84e1c64e7842779a4a67b66d78e80e763b68353a6b51","observation_id":"3bb143b2-f6e4-474b-86cc-4b67d6bef4cc","resolution":{"observed_at":"2026-08-12T17:22:17.941042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02252","last_updated":"2025-02-01T00:25:09Z","snapshot_observed_at":"2026-08-16T14:04:11.225834Z","submitted_at":"2024-04-02T19:18:42Z","title":"SMITIN: Self-Monitored Inference-Time INtervention for Generative Music Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02252","snapshot_observed_at":"2026-08-12T17:22:17.949611Z","title":"Smitin: Self-monitored inference-time intervention for generative music transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.949611Z"},"links":{"cited_paper":"/paper/2404.02252","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:e24ec97735c919b62bf5b05c373c0f5ef00df28daae06f88eceed2a6686f9adf","observation_id":"c664983b-0f43-43a8-8a62-8aaabf079cfa","resolution":{"observed_at":"2026-08-12T17:22:17.949611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-16T17:50:24.547828Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-12T17:22:17.953788Z","title":"Efficient training of audio transformers with patchout","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.953788Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:93bd0011b0012af8a36cb4ccb49e69fa3297df1b47408919ae64bd538f2398b3","observation_id":"a7f48f30-1d70-4f13-99b9-16df11f82b7d","resolution":{"observed_at":"2026-08-12T17:22:17.953788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02060","last_updated":"2024-10-02T22:11:31Z","snapshot_observed_at":"2026-08-16T13:13:09.529112Z","submitted_at":"2024-10-02T22:11:31Z","title":"PerTok: Expressive Encoding and Modeling of Symbolic Musical Ideas and Variations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02060","snapshot_observed_at":"2026-08-12T17:22:17.957983Z","title":"Peike Li, Boyu Chen, Yao Yao, Yikai Wang, Allen Wang, and Alex Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.957983Z"},"links":{"cited_paper":"/paper/2410.02060","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:6096eff1ff7fc19b3f7fb5d52a8fa83a2699ec941fda1cf66b14f6ff6f1050c8","observation_id":"e13e77da-de29-4894-a1f3-33bcdf016491","resolution":{"observed_at":"2026-08-12T17:22:17.957983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17162","last_updated":"2024-10-06T21:36:20Z","snapshot_observed_at":"2026-08-16T14:48:44.668196Z","submitted_at":"2023-10-26T05:24:38Z","title":"Content-based Controls For Music Large Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17162","snapshot_observed_at":"2026-08-12T17:22:17.962109Z","title":"Content-based controls for music large language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.962109Z"},"links":{"cited_paper":"/paper/2310.17162","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:cbab5708fcc5f8f611aa105a56775e43eef607252303e73ece75b7a53e518e7c","observation_id":"1f7e1e4f-e84d-4d2f-83ce-0fc66c659fb9","resolution":{"observed_at":"2026-08-12T17:22:17.962109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09508","last_updated":"2024-10-06T21:26:48Z","snapshot_observed_at":"2026-08-16T14:18:31.572938Z","submitted_at":"2024-02-14T19:00:01Z","title":"Arrange, Inpaint, and Refine: Steerable Long-term Music Audio Generation and Editing via Content-based Controls","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09508","snapshot_observed_at":"2026-08-12T17:22:17.966629Z","title":"Arrange, inpaint, and refine: Steerable long-term music audio generation and editing via content- based controls","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.966629Z"},"links":{"cited_paper":"/paper/2402.09508","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:eeca740c3c441a6cda5075afdd172b45e673fa614f4c02a61644934a9be8293e","observation_id":"1d9d8692-1128-4c04-a4e4-833456fff121","resolution":{"observed_at":"2026-08-12T17:22:17.966629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-16T15:59:22.404915Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-12T17:22:17.970735Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.970735Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:a893e46d2020311c233495ecf7eb13ee3ab0d3c7708da9b1f0e3e1bef336d8f0","observation_id":"6e8c9f1b-e2b0-4c2d-9d5a-ed0418f56f1d","resolution":{"observed_at":"2026-08-12T17:22:17.970735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-12T17:22:17.974840Z","title":"Audi- oldm 2: Learning holistic audio generation with self-supervised pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.974840Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:da7d89d9363872db5bc6afb043eb089f96d820288cfa79ef5a44fc81dc55bd66","observation_id":"7f74cdce-4863-49dc-8d77-68473f76c2d0","resolution":{"observed_at":"2026-08-12T17:22:17.974840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.248636Z","title":"Novice-AI music co-creation via AI-steering tools for deep generative models","venue":null,"work_id":"2c514279-f3fd-4e5e-bec2-1ec38e2ad8a0","year":2020},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.979035Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:9227b4f6b795b92879a304dd3f7e10a71af89a8d7508caecd19209f435ae9471","observation_id":"d54e9a4e-c430-4d5f-bba0-18693ff386d3","resolution":{"observed_at":"2026-08-12T17:22:19.252792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00110","last_updated":"2023-05-31T18:34:16Z","snapshot_observed_at":"2026-08-16T15:27:47.225337Z","submitted_at":"2023-05-31T18:34:16Z","title":"MuseCoco: Generating Symbolic Music from Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00110","snapshot_observed_at":"2026-08-12T17:22:17.982833Z","title":"MuseCoco: Generating symbolic music from text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.982833Z"},"links":{"cited_paper":"/paper/2306.00110","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:cc38b721ddbeef8fa8f7060afc6352a9a9dffecb5a1fb9eb8bd33dfd97daebdf","observation_id":"3ae3d660-10ae-42dd-be2d-40be5d851534","resolution":{"observed_at":"2026-08-12T17:22:17.982833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08152","last_updated":"2019-06-29T04:29:48Z","snapshot_observed_at":"2026-08-15T19:43:12.444022Z","submitted_at":"2019-06-19T15:25:29Z","title":"Learning Disentangled Representations of Timbre and Pitch for Musical Instrument Sounds Using Gaussian Mixture Variational Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08152","snapshot_observed_at":"2026-08-12T17:22:17.986909Z","title":"Learning disentangled repre- sentations of timbre and pitch for musical instrument sounds using gaussian mixture variational autoencoders","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.986909Z"},"links":{"cited_paper":"/paper/1906.08152","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:99f2a7da24097a5d4e84272d40a8d7b1e1ed7f860443b2efc1c23449777d58b2","observation_id":"45537720-6e91-4814-9d5e-00371d492646","resolution":{"observed_at":"2026-08-12T17:22:17.986909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-16T14:42:35.941984Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-08-12T17:22:17.991759Z","title":"The Song Describer Dataset: A corpus of audio captions for music-and- language evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.991759Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:403e2f0b2aa7e97590387f8d8d1cb2bd0c246945d180c2336bd47412b6aac463","observation_id":"1f262fcf-3f34-4c01-86fd-2ff4870db5d6","resolution":{"observed_at":"2026-08-12T17:22:17.991759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.236404Z","title":"Cutting music source separation some Slakh: A dataset to study the impact of training data quality and quantity","venue":null,"work_id":"e86ddfd7-5b5e-42a2-a244-a5409cca7cc4","year":2019},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.996053Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:70dc63485515153053af297d45be679db6c62b6233c5f7d2de02c86d675647b6","observation_id":"6bec592a-7b1c-4b21-ad97-ddd546f84ca9","resolution":{"observed_at":"2026-08-12T17:22:19.240664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:18.000506Z","title":"2019.8937170","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.000506Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:056cdcc24c20dc9311f333cd4a36467ac40d6f6438c5bbad3476c2b15a5e67fd","observation_id":"e2c73553-2e83-4041-9037-efc495714b3e","resolution":{"observed_at":"2026-08-12T17:22:18.000506Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.224322Z","title":"Stem- gen: A music generation model that listens","venue":null,"work_id":"2ce1adf0-4842-4ea4-bc2c-b83cbce1ce34","year":2024},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.012749Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:0a0781c7864bde7f80584e6e041912dc3899b9dd52cda03c0786d0a480bafa6e","observation_id":"2b7d0675-2c8f-4c2f-9d98-1e41803c0269","resolution":{"observed_at":"2026-08-12T17:22:19.228074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.212213Z","title":"Zero-shot image-to-image translation","venue":null,"work_id":"e580f0e0-7587-42a7-9ac0-170311b7f572","year":2023},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.016660Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:584cd9a88ad274e4e278f283c6f0fd14f82b31a699e30336c6ea2165aad693bc","observation_id":"94ce5295-f9f1-49ab-9bfe-e085ba0f4556","resolution":{"observed_at":"2026-08-12T17:22:19.216388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.198744Z","title":"Glove: Global vectors for word representation","venue":null,"work_id":"62751efa-333c-4c2d-b550-d16488ff79f3","year":2014},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.020738Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:d3b7f72b3bbbdd19b977b67ab462cfe805a0d13816e062b2579b22ccedcbd92a","observation_id":"1e186346-0f81-47ff-b771-832e2a9a2092","resolution":{"observed_at":"2026-08-12T17:22:19.203529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05365","last_updated":"2018-03-22T21:59:40Z","snapshot_observed_at":"2026-08-14T19:45:43.957260Z","submitted_at":"2018-02-15T00:05:11Z","title":"Deep contextualized word representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.05365","snapshot_observed_at":"2026-08-12T17:22:18.033393Z","title":"Karol J Piczak","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.033393Z"},"links":{"cited_paper":"/paper/1802.05365","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:cec589e9caff2613e08acd263760e01efbcf64938c36a60fd9d8cfd648af34e8","observation_id":"6505c8e3-76a5-42cf-97d2-7044012f2901","resolution":{"observed_at":"2026-08-12T17:22:18.033393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.166822Z","title":"Generalized multi-source inference for text conditioned music diffusion models","venue":null,"work_id":"0c20a629-7863-4413-8d58-2f0a8226a29b","year":2024},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.037046Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:919dc7069213ee431fa9ef4ea95d97d845ee0a4058a5833abf59c30f934aed78","observation_id":"da217417-315c-4b64-89c0-cda45a3910bb","resolution":{"observed_at":"2026-08-12T17:22:19.171499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:18.041327Z","title":"Paguri: a user experience study of creative interaction with text-to-music models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.041327Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:b78520e6da18a60915e4274b724e17ec4e396570bf2fce2b10f3d7cb9a0ea9e6","observation_id":"72792de0-2abd-4dfd-ba04-aea455bc04d8","resolution":{"observed_at":"2026-08-12T17:22:18.041327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12563","last_updated":"2024-07-30T09:44:09Z","snapshot_observed_at":"2026-08-16T13:33:26.497953Z","submitted_at":"2024-07-17T13:47:17Z","title":"Audio Conditioning for Music Generation via Discrete Bottleneck Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12563","snapshot_observed_at":"2026-08-12T17:22:18.045976Z","title":"Audio conditioning for music generation via discrete bottleneck features","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.045976Z"},"links":{"cited_paper":"/paper/2407.12563","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:f7d77ec120f4558868502eb74192139abee2c194906ddd4709bf6b45863b5e13","observation_id":"a8511da5-b9d9-409a-846c-139d67be53a5","resolution":{"observed_at":"2026-08-12T17:22:18.045976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.152801Z","title":null,"venue":null,"work_id":"8c25534e-a66e-4c18-af0d-147ac3718c20","year":2019},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.050497Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:7330fa2823b92d31fda5e06e1deb4a34e544d3ba70ab93e24da7d054aff85e17","observation_id":"c3572c32-6a17-4956-85e2-3fb128887240","resolution":{"observed_at":"2026-08-12T17:22:19.157232Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.86838","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:18.496119Z","title":"URL https://doi.org/10.1109/ICASSP.2019.8683855","venue":null,"work_id":"f5201553-545c-4e63-8d81-56b1d18e30b8","year":2019},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.062013Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:7d1967d627173025dc370cf86ba9b3bb982e9eadd4e503cbf3b442b0a1942f30","observation_id":"b6032a99-19c9-43ad-a077-09b2585925e6","resolution":{"observed_at":"2026-08-12T17:22:18.502761Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10970","last_updated":"2024-06-16T15:06:06Z","snapshot_observed_at":"2026-08-16T13:42:32.647258Z","submitted_at":"2024-06-16T15:06:06Z","title":"Joint Audio and Symbolic Conditioning for Temporally Controlled Text-to-Music Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10970","snapshot_observed_at":"2026-08-12T17:22:18.066712Z","title":"Joint audio and sym- bolic conditioning for temporally controlled text-to-music generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.066712Z"},"links":{"cited_paper":"/paper/2406.10970","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:2b8feaf324e8da15268a5efff576bd36fc0dbe1375f1db78180d1334b261193c","observation_id":"2f28cfb2-25c1-4eb9-8f49-b09ede1b1942","resolution":{"observed_at":"2026-08-12T17:22:18.066712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.15474","last_updated":"2020-07-29T16:01:45Z","snapshot_observed_at":"2026-08-14T05:44:45.826909Z","submitted_at":"2020-07-29T16:01:45Z","title":"Music FaderNets: Controllable Music Generation Based On High-Level Features via Low-Level Feature Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.15474","snapshot_observed_at":"2026-08-12T17:22:18.071838Z","title":"Music FaderNets: Controllable music generation based on high-level features via low-level feature modelling","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.071838Z"},"links":{"cited_paper":"/paper/2007.15474","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:e0bde6395d574c1318a8c42353d7139da44d045d0ea500c43886b9df2e3b692b","observation_id":"bee62ef0-c927-4586-b0fa-f3c5a1a85f37","resolution":{"observed_at":"2026-08-12T17:22:18.071838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T17:22:18.077072Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.077072Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:061ffbdb546f285d26e74382e47c33b7a7a35cec88559180e5902a85acb2a389","observation_id":"4ae40fbd-b2da-456a-8d2d-f086b3d3373c","resolution":{"observed_at":"2026-08-12T17:22:18.077072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.138867Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":"57fb2438-d9cb-455e-8a1c-7a75540bf9a3","year":1921},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.081609Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:2aac45a58507369f64f5422560c85119f21cc3332fd1d9f198f2e9c43f70dec4","observation_id":"36568fc4-9e0d-42c1-8a3e-651dd21d23c3","resolution":{"observed_at":"2026-08-12T17:22:19.143365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-08-16T05:39:41.727705Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-12T17:22:18.085750Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.085750Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:74ddb274ad3e331cd4ec8eed9f31bff16f833cb03984c6b91c4138e3368ece93","observation_id":"5f8e728e-061b-4156-9bd6-00b3c5458970","resolution":{"observed_at":"2026-08-12T17:22:18.085750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03209","last_updated":"2018-04-09T19:58:17Z","snapshot_observed_at":"2026-08-15T16:28:51.252929Z","submitted_at":"2018-04-09T19:58:17Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03209","snapshot_observed_at":"2026-08-12T17:22:18.094014Z","title":"Shiqi Wei, Gus Xia, Yixiao Zhang, Liwei Lin, and Weiguo Gao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.094014Z"},"links":{"cited_paper":"/paper/1804.03209","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:8d63c91a69aa94e74bdd5d4bf7ab102cbb759346094945bb9f6bb09caa01ea1c","observation_id":"e141c705-cb91-474c-a455-2ec8c01301d8","resolution":{"observed_at":"2026-08-12T17:22:18.094014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11216","last_updated":"2023-01-04T01:06:19Z","snapshot_observed_at":"2026-08-16T16:14:39.146284Z","submitted_at":"2022-11-21T07:19:17Z","title":"Exploring the Efficacy of Pre-trained Checkpoints in Text-to-Music Generation Task","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11216","snapshot_observed_at":"2026-08-12T17:22:18.098324Z","title":"Exploring the efficacy of pre-trained checkpoints in text-to-music generation task","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.098324Z"},"links":{"cited_paper":"/paper/2211.11216","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:282ad05a625434ad9623abb251135147a9763fccc0c92f03083e1b046f35822b","observation_id":"7fa745de-7c50-45fe-b3b1-1506c629e7b0","resolution":{"observed_at":"2026-08-12T17:22:18.098324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02084","last_updated":"2025-06-16T16:49:05Z","snapshot_observed_at":"2026-08-16T13:13:09.224550Z","submitted_at":"2024-10-02T23:10:21Z","title":"Generating Symbolic Music from Natural Language Prompts using an LLM-Enhanced Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02084","snapshot_observed_at":"2026-08-12T17:22:18.102619Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.102619Z"},"links":{"cited_paper":"/paper/2410.02084","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:4781720971244fcb329f19ddec01cbf3d0feee4df77a6783105159a1da53d2e4","observation_id":"5b21ed84-4989-4f8d-8f77-4858ca1e080e","resolution":{"observed_at":"2026-08-12T17:22:18.102619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.124830Z","title":"Iteratta: An interface for exploring both text prompts and audio priors in generating music with text-to-audio models","venue":null,"work_id":"b1969bc3-ac97-48ea-a0db-6d25d1c5b4d4","year":2023},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.106545Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:f94f47826d517c44effe8a451f677c0ecc840d052b9eff33772144fbd99e0b87","observation_id":"deaafc50-5a0a-4bd1-8afd-eccaff0c3403","resolution":{"observed_at":"2026-08-12T17:22:19.129595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-16T14:56:06.586855Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-12T17:22:18.110641Z","title":"UniAudio: An audio foundation model to- ward universal audio generation.CoRR, abs/2310.00704,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.110641Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:7f38efc793551daaef800f541b74d4aca2ec03eb2301853565c6ce524a23e60d","observation_id":"2703ed64-5d4f-4d4a-a51c-7e9cbb6c0e02","resolution":{"observed_at":"2026-08-12T17:22:18.110641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-16T14:56:06.586855Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-12T17:22:18.114817Z","title":"URL https://doi.org/10.48550/arxiv.2310.00704","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.114817Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:43b681e86eaedac7f2a74289dab12fba107ff67d687a8403965b4d54b690febe","observation_id":"d7d3a452-f80f-4be2-879c-54b11508117a","resolution":{"observed_at":"2026-08-12T17:22:18.114817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19180","last_updated":"2024-12-17T04:08:33Z","snapshot_observed_at":"2026-08-16T14:47:49.222858Z","submitted_at":"2023-10-29T22:51:49Z","title":"JEN-1 Composer: A Unified Framework for High-Fidelity Multi-Track Music Generation","version":4},"cited_work":{"arxiv_id":"2310.19180","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.19180","snapshot_observed_at":"2026-08-12T17:22:18.256143Z","title":"JEN-1 Composer: A Unified Framework for High-Fidelity Multi-Track Music Generation","venue":"cs.SD","work_id":"4d3da90b-7457-4dd7-ba4a-d0e291cd2e8d","year":2023},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.119324Z"},"links":{"cited_paper":"/paper/2310.19180","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:558716edaf698ef09378d03cefc4b917cbc23f572eac22b6406039447b1b6c2c","observation_id":"12264b63-e1f6-41f7-bfb4-7b46197d5f43","resolution":{"observed_at":"2026-08-12T17:22:18.262901Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16153","last_updated":"2024-02-25T17:19:41Z","snapshot_observed_at":"2026-08-16T14:15:31.491085Z","submitted_at":"2024-02-25T17:19:41Z","title":"ChatMusician: Understanding and Generating Music Intrinsically with LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16153","snapshot_observed_at":"2026-08-12T17:22:18.123882Z","title":"Chatmusician: Understanding and generating music intrinsically with llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.123882Z"},"links":{"cited_paper":"/paper/2402.16153","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:e34636bfa843f31f51c835b5f4d8571d6640d4886836ead30368ad9971260246","observation_id":"7aaae18c-fb86-4487-a150-aefcaa3649a6","resolution":{"observed_at":"2026-08-12T17:22:18.123882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-08-13T10:46:50.834601Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-12T17:22:18.128284Z","title":"LLaMA-Adapter: Efficient fine- tuning of language models with zero-init attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.128284Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:f44481a63585bb0529527aa66257ecd2ddfc0f1230662da7d9498192c764ed4f","observation_id":"3dedc977-28b4-44cd-a5de-2858df3024b6","resolution":{"observed_at":"2026-08-12T17:22:18.128284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.110299Z","title":"Cosmic: A conversational interface for human-ai music co-creation","venue":null,"work_id":"aa4e8d06-6ecd-4f5b-aef3-4026e47a8fa8","year":2021},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.132747Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:a79b0a4f169b58a758112d1db8c9333fb9dfd05d43c580e80e1ba8f28c453cbe","observation_id":"7d503132-40d5-45a0-8a85-75d23867d85b","resolution":{"observed_at":"2026-08-12T17:22:19.115111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11671","last_updated":"2022-08-24T17:07:37Z","snapshot_observed_at":"2026-08-16T16:37:06.588047Z","submitted_at":"2022-08-24T17:07:37Z","title":"Interpreting Song Lyrics with an Audio-Informed Pre-trained Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.11671","snapshot_observed_at":"2026-08-12T17:22:18.136706Z","title":"Interpreting song lyrics with an audio-informed pre-trained language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.136706Z"},"links":{"cited_paper":"/paper/2208.11671","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:4085b11f3d5ab06c94e07a125e3c9712569963500cdc526b4dcaa02a23951c4c","observation_id":"28009de3-3aab-4a83-b2f9-07d17531f7d8","resolution":{"observed_at":"2026-08-12T17:22:18.136706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-12T17:22:18.141425Z","title":"Wayne Xin Zhao, Kun Zhou, Junyi Li, Tianyi Tang, Xiaolei Wang, Yupeng Hou, Yingqian Min, Beichen Zhang, Junjie Zhang, Zican Dong, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.141425Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:491288338fd8e514545274bab557afbc980c8455e3a156bc803657f52efd076a","observation_id":"4c418d10-b949-4159-add6-a74d84190332","resolution":{"observed_at":"2026-08-12T17:22:18.141425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04577","last_updated":"2024-03-05T09:12:35Z","snapshot_observed_at":"2026-08-16T14:28:48.591931Z","submitted_at":"2024-01-09T14:29:39Z","title":"Masked Audio Generation using a Single Non-Autoregressive Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04577","snapshot_observed_at":"2026-08-12T17:22:18.146028Z","title":"Masked audio generation using a single non-autoregressive transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.146028Z"},"links":{"cited_paper":"/paper/2401.04577","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:e8101f3ee311e9a5304443132e5af4b6bed0f08d0f1f0473b234577fd1629271","observation_id":"b00db70a-dfd9-42df-9df6-e87647de670c","resolution":{"observed_at":"2026-08-12T17:22:18.146028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08384","last_updated":"2024-10-30T14:33:27Z","snapshot_observed_at":"2026-08-16T13:43:40.087697Z","submitted_at":"2024-06-12T16:34:26Z","title":"Diff-A-Riff: Musical Accompaniment Co-creation via Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08384","snapshot_observed_at":"2026-08-12T17:22:18.008497Z","title":"Diff-a-riff: Musical accompaniment co-creation via latent diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":1986,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.008497Z"},"links":{"cited_paper":"/paper/2406.08384","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:9571a82117a33f7562438854318abff492c8cd7bb0a704a7e237ac09b1807da6","observation_id":"f06bdcae-e553-4106-812e-acbba9ecca99","resolution":{"observed_at":"2026-08-12T17:22:18.008497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05496","last_updated":"2023-08-10T10:59:24Z","snapshot_observed_at":"2026-08-16T15:09:25.091808Z","submitted_at":"2023-08-10T10:59:24Z","title":"Exploring XAI for the Arts: Explaining Latent Space in Generative Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05496","snapshot_observed_at":"2026-08-12T17:22:17.829212Z","title":"Exploring xai for the arts: Explaining latent space in generative music","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":1996,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.829212Z"},"links":{"cited_paper":"/paper/2308.05496","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:f7aab5addcab9d0b345a57100fa2fb196c45b067940bfa1398ca2269210492fc","observation_id":"a57bb2bc-47fd-4c40-afeb-66e9746f6412","resolution":{"observed_at":"2026-08-12T17:22:17.829212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:18.090093Z","title":"2003.819861","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.090093Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:e425b84a649cdb97b4293a36ef7b72652a078ba357decbb9f4cc07e56420fa62","observation_id":"6bbe475b-5897-4987-86d2-2ab251e89d31","resolution":{"observed_at":"2026-08-12T17:22:18.090093Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15487","last_updated":"2024-07-08T20:15:33Z","snapshot_observed_at":"2026-08-16T13:42:01.810217Z","submitted_at":"2024-06-18T00:02:15Z","title":"Improving Text-To-Audio Models with Synthetic Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15487","snapshot_observed_at":"2026-08-12T17:22:17.945138Z","title":"Improving text- to-audio models with synthetic captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.945138Z"},"links":{"cited_paper":"/paper/2406.15487","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:c9767209460211eb6c15bf2fa67b772215ff572a63b2634c9fa2e3b998a47aac","observation_id":"370d21ad-03b8-494f-a600-fbf4f2ef17dc","resolution":{"observed_at":"2026-08-12T17:22:17.945138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.183064Z","title":"MoisesDB: A dataset for source separation beyond 4-stems","venue":null,"work_id":"6406f56d-6942-4970-83ef-b727f1b672fd","year":2023},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.024699Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:eb47f15398a06f0a0f98deafa7f98670539d58fd93d53c4831e10ebe4872cb69","observation_id":"d803a4f9-532f-4a98-844a-4347d9fe9899","resolution":{"observed_at":"2026-08-12T17:22:19.189399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02255","last_updated":"2024-07-22T09:34:46Z","snapshot_observed_at":"2026-08-16T13:46:18.767605Z","submitted_at":"2024-06-04T12:21:55Z","title":"MidiCaps: A large-scale MIDI dataset with text captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02255","snapshot_observed_at":"2026-08-12T17:22:18.004318Z","title":"Mustango: Toward controllable text-to- music generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:18.004318Z"},"links":{"cited_paper":"/paper/2406.02255","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:e8a80298068d4d3e0e07d76066dc07343b9506d75075bd89b5e1930b6b2cc59b","observation_id":"b6bd2d2e-5f02-4445-ac86-2279b1482464","resolution":{"observed_at":"2026-08-12T17:22:18.004318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.06801","last_updated":"2020-11-13T08:01:20Z","snapshot_observed_at":"2026-08-17T09:44:24.180929Z","submitted_at":"2020-11-13T08:01:20Z","title":"A Comprehensive Survey on Deep Music Generation: Multi-level Representations, Algorithms, Evaluations, and Future Directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.06801","snapshot_observed_at":"2026-08-12T17:22:17.923559Z","title":"URL https://doi.org/10.21437/ Interspeech.2016-1176","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.923559Z"},"links":{"cited_paper":"/paper/2011.06801","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:d13ea823ae2966a5daad7b29062e7015a522d2ba9ba6b8d0eb99c1fb8b915ad8","observation_id":"91e7ac71-eccd-4b9e-a718-16e7989b14e1","resolution":{"observed_at":"2026-08-12T17:22:17.923559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.261241Z","title":"Au- diocaps: Generating captions for audios in the wild","venue":null,"work_id":"bdce9e29-9ed4-464f-a1f6-966c4cd93bab","year":2019},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.936966Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:72c49d18b1de1cf349de7d1d78ab8ac3a089acc4e06c0b7a0b9ae1dcb1d3a11c","observation_id":"bf5cb6ad-9aa4-430d-ae8a-95a11b661c7a","resolution":{"observed_at":"2026-08-12T17:22:19.265481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12415","last_updated":"2022-08-26T03:13:21Z","snapshot_observed_at":"2026-08-16T16:36:45.618823Z","submitted_at":"2022-08-26T03:13:21Z","title":"MuLan: A Joint Embedding of Music Audio and Natural Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12415","snapshot_observed_at":"2026-08-12T17:22:17.910125Z","title":"Masked autoencoders that listen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.910125Z"},"links":{"cited_paper":"/paper/2208.12415","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:22aa461eda87ee5849caf8cdb220a57a777491e0ba65ad5969d006c49b6afbe3","observation_id":"0035bc81-1603-4cf1-8b24-b65ea1e86213","resolution":{"observed_at":"2026-08-12T17:22:17.910125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17645","last_updated":"2025-05-30T22:33:14Z","snapshot_observed_at":"2026-08-16T14:14:50.380903Z","submitted_at":"2024-02-27T16:15:28Z","title":"SongComposer: A Large Language Model for Lyric and Melody Generation in Song Composition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17645","snapshot_observed_at":"2026-08-12T17:22:17.861124Z","title":"Songcomposer: A large language model for lyric and melody composition in song generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.861124Z"},"links":{"cited_paper":"/paper/2402.17645","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:efc21fe1f0d1d9d2145bdbfc1c4be2ce7b4f7439284c13a8f7dc55dc91520f01","observation_id":"ca295f9c-16c9-4a67-9d7e-c3ddf8763784","resolution":{"observed_at":"2026-08-12T17:22:17.861124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-16T07:26:47.621702Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-08-12T17:22:17.855404Z","title":"Jukebox: A generative model for music","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.855404Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:7ca99b1fa21e5eca17fd67aa562823e3d4d0fa0bf8bd5771f8a07b4e46454b10","observation_id":"08a68021-b2fe-4f82-9568-cfe8712a4d44","resolution":{"observed_at":"2026-08-12T17:22:17.855404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.339968Z","title":"Musicldm: Enhancing novelty in text- to-music generation using beat-synchronous mixup strategies","venue":null,"work_id":"895a9012-f244-4bb5-a20e-f1d1c55d1179","year":2024},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.838339Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:266f93492c73a6f18fca3dfea8431b172d7c293a850e20e4c03f06c0eb694ef5","observation_id":"5decd465-1463-4b20-b74a-8ff02ef74acb","resolution":{"observed_at":"2026-08-12T17:22:19.343974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.351837Z","title":"Hts-at: A hierarchical token-semantic audio transformer for sound classification and detection","venue":null,"work_id":"22dc8707-773a-406a-9948-1113446cd8c6","year":2022},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.833825Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:f924304a7d98c50e0386bcb2f89e5fe03781ff03155075e78cabbf6e546ea6be","observation_id":"56994326-27b9-4dee-bca5-b81e86bbbaf9","resolution":{"observed_at":"2026-08-12T17:22:19.355936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:22:19.328439Z","title":"W2v-bert: Combining contrastive learning and masked language modeling for self-supervised speech pre-training","venue":null,"work_id":"0ee1abfc-c583-4ca1-9101-2336a676f105","year":2021},"citing_paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T17:22:17.842502Z"},"links":{"citing_paper":"/paper/2411.12641"},"observation_digest":"sha256:89f7e178d9ec5734024c37f09d0991a3bfa174b6371a340a865cd392311992fc","observation_id":"0a50e756-deba-4490-bf58-6fdf0d6ea5b5","resolution":{"observed_at":"2026-08-12T17:22:19.332606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.12641","last_updated":"2024-11-21T11:46:13Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T21:13:57.094598Z","submitted_at":"2024-11-19T16:52:34Z","title":"Improving Controllability and Editability for Pretrained Text-to-Music Generation Models"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":49,"verified_exact":2,"verified_fuzzy":17},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2411.12641."}