{"as_of":"2026-08-09T07:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:91c63f8ee39fe3490c9e75548d75c1ae5c7fc4363762d37a8233cb768e1ce13a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:12:29.458700Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T00:04:22.608820Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2302.03917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-07-08T00:04:22.608820Z","title":"Noise2music: Text-conditioned music generation with diffusion models","venue":"cs.SD","work_id":"c46cc447-8a7d-4123-bbdf-96b5571efcb6","year":2023},"citing_paper":{"arxiv_id":"2305.02463","last_updated":"2023-05-03T23:59:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-03T23:59:13Z","title":"Shap-E: Generating Conditional 3D Implicit Functions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T15:32:06.563955Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2305.02463"},"observation_digest":"sha256:a35485a4d269083c82611688c3acbe5754f985c6467d216defa4ce6f30164d96","observation_id":"2aac7385-01d9-46ac-9a52-5ffe35473201","resolution":{"observed_at":"2026-05-16T15:32:06.770084Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2302.03917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-07-08T00:04:22.608820Z","title":"Noise2music: Text-conditioned music generation with diffusion models","venue":"cs.SD","work_id":"c46cc447-8a7d-4123-bbdf-96b5571efcb6","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:79b0250a650b22533d07ea0852d9f1866b686e620b934604dd4a41bd40b04614","observation_id":"eca944cf-56c8-4bf3-8dff-1ab0605dd869","resolution":{"observed_at":"2026-05-11T14:16:23.975684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2302.03917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-07-08T00:04:22.608820Z","title":"Noise2music: Text-conditioned music generation with diffusion models","venue":"cs.SD","work_id":"c46cc447-8a7d-4123-bbdf-96b5571efcb6","year":2023},"citing_paper":{"arxiv_id":"2411.15913","last_updated":"2026-05-13T09:39:21Z","snapshot_observed_at":"2026-07-06T19:56:12.654263Z","submitted_at":"2024-11-24T16:53:34Z","title":"Repurposing Image Diffusion Models for Training-Free Music Style Transfer on Mel-spectrograms","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T08:32:51.237590Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2411.15913"},"observation_digest":"sha256:50afb41df23f18793ecb0ea76bd01aa42170fc6566ca9ae57bc8e0daa4119e15","observation_id":"4d2759e9-e5bf-4ab9-9810-e44e547a7987","resolution":{"observed_at":"2026-05-23T08:35:29.732673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-08T20:12:29.458700Z","title":"Park, Tao Wang, Timo I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05130","last_updated":"2025-07-29T07:31:59Z","snapshot_observed_at":"2026-08-09T05:08:43.033940Z","submitted_at":"2025-02-07T18:02:47Z","title":"Latent Swap Joint Diffusion for 2D Long-Form Latent Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T20:12:29.458700Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2502.05130"},"observation_digest":"sha256:81d7098993d69eb9ae3bf69f0a6b5fae89f29158f9f2976de1f1608fd877ec0b","observation_id":"595b6822-e9fd-40f2-b3de-95f4545bcdda","resolution":{"observed_at":"2026-08-08T20:12:29.458700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-08T13:09:46.440827Z","title":"Park, Tao Wang, Timo I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07328","last_updated":"2025-05-06T09:48:44Z","snapshot_observed_at":"2026-08-08T13:02:30.965314Z","submitted_at":"2025-02-11T07:46:29Z","title":"Music for All: Representational Bias and Cross-Cultural Adaptability of Music Generation Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T13:09:46.440827Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2502.07328"},"observation_digest":"sha256:40b2237092d2823a83609bf19cb8bcf7c25c03da5f395eb04ce0f155295c380f","observation_id":"0ced350e-1c9f-4f23-a5b8-0f6fa6c6fc80","resolution":{"observed_at":"2026-08-08T13:09:46.440827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-08T12:43:30.119680Z","title":"Huang, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07461","last_updated":"2025-05-16T07:57:01Z","snapshot_observed_at":"2026-08-08T20:14:22.556203Z","submitted_at":"2025-02-11T11:12:19Z","title":"JamendoMaxCaps: A Large Scale Music-caption Dataset with Imputed Metadata","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T12:43:30.119680Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2502.07461"},"observation_digest":"sha256:037410561e72f21884e7e9aa5c50d09f82e81a45c3b4f7ba191e3cb6b436d54e","observation_id":"72d3c04e-dfc8-4e57-b219-88712ec7df77","resolution":{"observed_at":"2026-08-08T12:43:30.119680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-08T05:10:06.205335Z","title":"arXiv preprint arXiv:2302.03917 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10467","last_updated":"2025-02-12T14:10:52Z","snapshot_observed_at":"2026-08-08T05:05:26.383210Z","submitted_at":"2025-02-12T14:10:52Z","title":"YNote: A Novel Music Notation for Fine-Tuning LLMs in Music Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T05:10:06.205335Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2502.10467"},"observation_digest":"sha256:e51d2843fc18eda136e996f884804f21949a965d66b8bb64620ed9dffc903970","observation_id":"a56ba5e3-1794-4899-9743-b7378d6eac04","resolution":{"observed_at":"2026-08-08T05:10:06.205335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-07T05:12:24.656553Z","title":"Noise2music: Text-conditioned music generation with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08570","last_updated":"2025-09-04T11:54:13Z","snapshot_observed_at":"2026-08-09T03:27:15.286565Z","submitted_at":"2025-06-10T08:37:45Z","title":"Auto-Regressive vs Flow-Matching: a Comparative Study of Modeling Paradigms for Text-to-Music Generation","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T05:12:24.656553Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2506.08570"},"observation_digest":"sha256:80501c11a8a8274b41e261442cbcd0b093ed4f9eee3227a97b9c87b6ca921b9e","observation_id":"2e992f79-4caa-4c9e-aa50-0cc9b025c4c8","resolution":{"observed_at":"2026-08-07T05:12:24.656553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-07T00:49:43.230631Z","title":"Noise2music: Text-conditioned music generation with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12573","last_updated":"2025-06-27T22:16:16Z","snapshot_observed_at":"2026-08-08T11:30:56.714691Z","submitted_at":"2025-06-14T16:58:42Z","title":"Video-Guided Text-to-Music Generation Using Public Domain Movie Collections","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:49:43.230631Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2506.12573"},"observation_digest":"sha256:1e82bdcdbec6893741f863442c30cd201ba3230ccfb69547585edb07c74905ef","observation_id":"92b97fe1-1c0a-456e-a812-f804e48e40f9","resolution":{"observed_at":"2026-08-07T00:49:43.230631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-06T23:58:33.511112Z","title":"Noise2music: Text-conditioned music generation with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15530","last_updated":"2025-06-18T15:01:25Z","snapshot_observed_at":"2026-08-08T08:30:17.628486Z","submitted_at":"2025-06-18T15:01:25Z","title":"Diff-TONE: Timestep Optimization for iNstrument Editing in Text-to-Music Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:58:33.511112Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2506.15530"},"observation_digest":"sha256:590549e2c838c767df00b43f60357828bbde437b1e7c82c4e267e4f13c555625","observation_id":"5f4478ee-a3e7-4058-8c70-4eea61bc3156","resolution":{"observed_at":"2026-08-06T23:58:33.511112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-06T23:20:33.008408Z","title":"Noise2music: Text-conditioned music generation with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18779","last_updated":"2025-06-23T15:48:54Z","snapshot_observed_at":"2026-08-08T07:54:26.802587Z","submitted_at":"2025-06-23T15:48:54Z","title":"DefFusionNet: Learning Multimodal Goal Shapes for Deformable Object Manipulation via a Diffusion-based Probabilistic Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:33.008408Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2506.18779"},"observation_digest":"sha256:a71ccb5f822c4d71c6846de5ac7bbe83b543836818ad40a9e844bf362ebf24fe","observation_id":"7a6206e4-2e84-4a1a-ae3a-370afd45f416","resolution":{"observed_at":"2026-08-06T23:20:33.008408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-06T20:09:33.815726Z","title":"Noise2music: Text-conditioned music generation with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.03599","last_updated":"2025-07-04T14:12:19Z","snapshot_observed_at":"2026-08-06T20:03:50.724542Z","submitted_at":"2025-07-04T14:12:19Z","title":"MusGO: A Community-Driven Framework For Assessing Openness in Music-Generative AI","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:09:33.815726Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2507.03599"},"observation_digest":"sha256:56f8773b7a687a425f144f2be1ec4fd6257f0f69c5d53b1ca06bc4bc2a7142e9","observation_id":"c0f3978c-ab5d-443c-bfe1-9135a99d1740","resolution":{"observed_at":"2026-08-06T20:09:33.815726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-06T19:39:54.151850Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04959","last_updated":"2025-07-13T09:31:19Z","snapshot_observed_at":"2026-08-07T10:47:44.341783Z","submitted_at":"2025-07-07T13:01:50Z","title":"Hear-Your-Click: Interactive Object-Specific Video-to-Audio Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:54.151850Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2507.04959"},"observation_digest":"sha256:29bcd45c085f3f8e96b9ed15a5ef47e2d681f8d5488be9aead26ca7fa439e173","observation_id":"edeebd84-0513-45ed-bc21-0844fbe762e9","resolution":{"observed_at":"2026-08-06T19:39:54.151850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-06T17:48:05.438833Z","title":"Noise2music: Text-conditioned music generation with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.09904","last_updated":"2025-07-14T04:18:15Z","snapshot_observed_at":"2026-08-06T17:41:56.408735Z","submitted_at":"2025-07-14T04:18:15Z","title":"ASTAR-NTU solution to AudioMOS Challenge 2025 Track1","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:48:05.438833Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2507.09904"},"observation_digest":"sha256:45995c16a9a2f5df53f6bafd8b296784e755d80764f6a56f48567bc8a9e30d4e","observation_id":"578d84d0-bd93-44ac-8b77-23fdcd9af446","resolution":{"observed_at":"2026-08-06T17:48:05.438833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-06T16:40:49.218862Z","title":"Noise2music: Text-conditioned music generation with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12890","last_updated":"2025-07-24T08:15:02Z","snapshot_observed_at":"2026-08-08T03:25:27.344834Z","submitted_at":"2025-07-17T08:18:55Z","title":"DiffRhythm+: Controllable and Flexible Full-Length Song Generation with Preference Optimization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:40:49.218862Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2507.12890"},"observation_digest":"sha256:58c0c63d47fbe41d319eda169b5259c86bf046d482e57cdcc6bcb66280dad38e","observation_id":"6d7c490a-eda3-4d2b-93c4-5e3ddbb3a816","resolution":{"observed_at":"2026-08-06T16:40:49.218862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2302.03917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-07-08T00:04:22.608820Z","title":"Noise2music: Text-conditioned music generation with diffusion models","venue":"cs.SD","work_id":"c46cc447-8a7d-4123-bbdf-96b5571efcb6","year":2023},"citing_paper":{"arxiv_id":"2604.17986","last_updated":"2026-04-20T09:08:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T09:08:13Z","title":"Latent Fourier Transform","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T03:45:07.892234Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2604.17986"},"observation_digest":"sha256:40661f2f189e6133f3c6fb1ea06ec1148d92c12a519fdbb298fb93fb733a3c67","observation_id":"835621e8-4d12-4349-af34-4f93ca4f668a","resolution":{"observed_at":"2026-05-11T12:21:07.015691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2302.03917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-07-08T00:04:22.608820Z","title":"Noise2music: Text-conditioned music generation with diffusion models","venue":"cs.SD","work_id":"c46cc447-8a7d-4123-bbdf-96b5571efcb6","year":2023},"citing_paper":{"arxiv_id":"2605.17414","last_updated":"2026-05-17T12:22:17Z","snapshot_observed_at":"2026-08-06T15:14:48.165289Z","submitted_at":"2026-05-17T12:22:17Z","title":"S2Accompanist: A Semantic-Aware and Structure-Guided Diffusion Model for Music Accompaniment Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-19T22:50:08.321514Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2605.17414"},"observation_digest":"sha256:7578a2f631e05d8e549dbe63f502b1086e4ec9b14160a7ced6f738c540b9cf81","observation_id":"3b8d8a75-84f4-4d56-8c02-060757903951","resolution":{"observed_at":"2026-05-19T22:52:50.509604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2302.03917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-07-08T00:04:22.608820Z","title":"Noise2music: Text-conditioned music generation with diffusion models","venue":"cs.SD","work_id":"c46cc447-8a7d-4123-bbdf-96b5571efcb6","year":2023},"citing_paper":{"arxiv_id":"2606.01703","last_updated":"2026-06-01T05:12:20Z","snapshot_observed_at":"2026-07-06T23:42:12.125247Z","submitted_at":"2026-06-01T05:12:20Z","title":"JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T13:10:29.213917Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2606.01703"},"observation_digest":"sha256:780f6877927d9c55b7b376e2298dc6d446af4e75a625c8e6920d2cbfd6d9bb1d","observation_id":"6703c3df-9d62-4e89-bec4-759e24a71161","resolution":{"observed_at":"2026-07-02T00:56:24.705379Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2302.03917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-07-08T00:04:22.608820Z","title":"Noise2music: Text-conditioned music generation with diffusion models","venue":"cs.SD","work_id":"c46cc447-8a7d-4123-bbdf-96b5571efcb6","year":2023},"citing_paper":{"arxiv_id":"2606.24307","last_updated":"2026-06-23T08:37:15Z","snapshot_observed_at":"2026-08-07T12:00:12.881089Z","submitted_at":"2026-06-23T08:37:15Z","title":"Real-Time Interactive Music Generation via Data-Free Streaming Consistency Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-25T22:42:57.448084Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2606.24307"},"observation_digest":"sha256:ddbea97f7687e82de6f56d12bea388e9e67fc6719bf1f6643b1df6a9f698ecdf","observation_id":"ad8a4e55-1445-49d6-8647-b606405e5c84","resolution":{"observed_at":"2026-07-04T18:40:02.633895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":"2302.03917","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-07-08T00:04:22.608820Z","title":"Noise2music: Text-conditioned music generation with diffusion models","venue":"cs.SD","work_id":"c46cc447-8a7d-4123-bbdf-96b5571efcb6","year":2023},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-08T14:15:13.834590Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:059556b3e40e21d9150715aafbf1fe6421254f017a1bb2f9302871b758a9b31a","observation_id":"9db21f8c-1fc6-4015-a917-b6380c2c3b29","resolution":{"observed_at":"2026-07-08T00:04:22.610666Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2302.03917 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-08T14:15:13.834590Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:bfb88df0442829ab0c4e12aa5bd5fbbf04ff0cbc3d887c54af0c6e136b8d207e","observation_id":"8418f976-53c8-4112-8b00-ae6de539a584","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-07-14T10:59:22.914974Z","title":"Noise2music: Text-conditioned music generation with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10537","last_updated":"2026-07-12T02:40:27Z","snapshot_observed_at":"2026-08-07T16:13:53.605999Z","submitted_at":"2026-07-12T02:40:27Z","title":"Dance to Music Generation leveraging Pre-training with Unpaired data and Contrastive Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T10:59:22.914974Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2607.10537"},"observation_digest":"sha256:076b58cbfc1b42bd24d7c4b76ce4f2b180abcadd6f48bfeb51d716ec4dd6ed70","observation_id":"98879aa0-8241-4e01-830b-39094736f6fd","resolution":{"observed_at":"2026-07-14T10:59:22.914974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-07-14T06:45:43.330341Z","title":"Noise2music: Text-conditioned music generation with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11143","last_updated":"2026-07-18T06:21:59Z","snapshot_observed_at":"2026-08-02T07:05:02.947075Z","submitted_at":"2026-07-13T06:26:28Z","title":"Anysynth:Zero-Shot Instrument Cloning via In-Context Learning and Asymmetric Hierarchical Guidance","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T06:45:43.330341Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2607.11143"},"observation_digest":"sha256:55b77fdf09dcf59a2672dbdeb5fa3fde291f615e32215cb600ed55e9871f0cdd","observation_id":"3683c75c-7bf9-41af-b7d9-61610cab0cec","resolution":{"observed_at":"2026-07-14T06:45:43.330341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-02T07:05:04.187324Z","title":"Noise2music: Text-conditioned music generation with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11143","last_updated":"2026-07-18T06:21:59Z","snapshot_observed_at":"2026-08-02T07:05:02.947075Z","submitted_at":"2026-07-13T06:26:28Z","title":"Anysynth:Zero-Shot Instrument Cloning via In-Context Learning and Asymmetric Hierarchical Guidance","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T07:05:04.187324Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2607.11143"},"observation_digest":"sha256:8acf8b7bde6d5011a295f891488545398dabbf9212b050367a31ab156a9b5630","observation_id":"2dc6e734-ab82-41b3-b91a-18b412ca60aa","resolution":{"observed_at":"2026-08-02T07:05:04.187324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-07-14T03:47:22.936776Z","title":"Qingqing Huang, Daniel S Park, Tao Wang, Timo I Denk, Andy Ly, Nanxin Chen, Zhengdong Zhang, Zhishuai Zhang, Jiahui Yu, Christian Frank, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11699","last_updated":"2026-07-27T11:24:39Z","snapshot_observed_at":"2026-08-07T07:32:51.039386Z","submitted_at":"2026-07-13T15:31:45Z","title":"Qwen-Music Technical Report","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T03:47:22.936776Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2607.11699"},"observation_digest":"sha256:c8a5780a327aa515f9003a7472e9df4606d4363b69fcc4d922ab314e2b4068f5","observation_id":"2b3a3ea5-6b82-430b-a2e1-714f927cb42b","resolution":{"observed_at":"2026-07-14T03:47:22.936776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-02T06:52:27.502401Z","title":"Qingqing Huang, Daniel S Park, Tao Wang, Timo I Denk, Andy Ly, Nanxin Chen, Zhengdong Zhang, Zhishuai Zhang, Jiahui Yu, Christian Frank, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11699","last_updated":"2026-07-27T11:24:39Z","snapshot_observed_at":"2026-08-07T07:32:51.039386Z","submitted_at":"2026-07-13T15:31:45Z","title":"Qwen-Music Technical Report","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T06:52:27.502401Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2607.11699"},"observation_digest":"sha256:f7e89262734d2cdf6edb249777dd3c8f317b290fe06f98d2956c47a376e907a3","observation_id":"00a124f4-2a01-4bab-8e06-eb59a87321a6","resolution":{"observed_at":"2026-08-02T06:52:27.502401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-08-01T17:47:12.237390Z","title":"Noise2music: Text-conditioned music generation with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17526","last_updated":"2026-07-20T04:00:16Z","snapshot_observed_at":"2026-08-05T11:29:26.582848Z","submitted_at":"2026-07-20T04:00:16Z","title":"FlowSonic: Stable Zero-Shot Music Editing via High-Order Trajectory Integration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:12.237390Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2607.17526"},"observation_digest":"sha256:af27ff445e97841a52be6a145bd4c6d65cec9deb215869e5915804e6cb8e561d","observation_id":"ede239d2-b610-4e20-a7c0-d065cdc4d680","resolution":{"observed_at":"2026-08-01T17:47:12.237390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03917","snapshot_observed_at":"2026-07-31T23:25:26.807855Z","title":"arXiv preprint arXiv:2302.03917 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24873","last_updated":"2026-07-27T03:51:40Z","snapshot_observed_at":"2026-08-09T03:53:52.095700Z","submitted_at":"2026-07-27T03:51:40Z","title":"MusiChat: Vibe Composing for Music Creation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-31T23:25:26.807855Z"},"links":{"cited_paper":"/paper/2302.03917","citing_paper":"/paper/2607.24873"},"observation_digest":"sha256:369f0a6cd40b9409fba591d89d00de5d568edb805b159ea654111da944ccdff1","observation_id":"ab0c43f7-3f42-4f3f-8ea9-1629982ca015","resolution":{"observed_at":"2026-07-31T23:25:26.807855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2302.03917/citation-record","integrity":"/paper/2302.03917/integrity","json":"/paper/2302.03917/citation-record.json","paper":"/paper/2302.03917"},"outbound":[],"paper":{"arxiv_id":"2302.03917","last_updated":"2023-03-06T18:09:56Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T18:29:25.356544Z","submitted_at":"2023-02-08T07:27:27Z","title":"Noise2Music: Text-conditioned Music Generation with Diffusion Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 28 inbound Pith citation observations for arXiv:2302.03917."}