{"as_of":"2026-08-10T20:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32d90b99a303c724897ef15a55d7c5269f086aeb17e9a654a954322507a4abe3","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:16:19.338517Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":36,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:14:43.128810Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:48:59.860115Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-06T13:14:37.507871Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20880","last_updated":"2025-07-28T14:34:02Z","snapshot_observed_at":"2026-08-06T16:37:02.345788Z","submitted_at":"2025-07-28T14:34:02Z","title":"JAM: A Tiny Flow-based Song Generator with Fine-grained Controllability and Aesthetic Alignment","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T13:14:37.507871Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2507.20880"},"observation_digest":"sha256:b98861e4716a4c64de29d678fa1fbbcaec1c00a4f5c62699c5ce237dcfb7f259","observation_id":"607794e3-305a-4413-8fa2-5d90040a27f4","resolution":{"observed_at":"2026-08-06T13:14:37.507871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-06T06:04:29.880406Z","title":"Ace-step: A step towards music generation foundation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00733","last_updated":"2025-08-07T04:31:04Z","snapshot_observed_at":"2026-08-09T12:20:24.219814Z","submitted_at":"2025-08-01T16:03:57Z","title":"AudioGen-Omni: A Unified Multimodal Diffusion Transformer for Video-Synchronized Audio, Speech, and Song Generation","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T06:04:29.880406Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2508.00733"},"observation_digest":"sha256:cbbb0188e36b99e5b593fddfa49a38e4816604ab28a13f80cb48a56455a65c42","observation_id":"c7bb091b-edf2-421f-808d-1cf2109f21c1","resolution":{"observed_at":"2026-08-06T06:04:29.880406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-05T23:43:03.692143Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05011","last_updated":"2025-08-07T03:49:18Z","snapshot_observed_at":"2026-08-06T05:37:26.433479Z","submitted_at":"2025-08-07T03:49:18Z","title":"Towards Hallucination-Free Music: A Reinforcement Learning Preference Optimization Framework for Reliable Song Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T23:43:03.692143Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2508.05011"},"observation_digest":"sha256:a87edf62049a2887070899c1f317d6f151d49327ba69d18adc24410964304e12","observation_id":"0a61d2d4-36d4-439c-83c2-634dc4032319","resolution":{"observed_at":"2026-08-05T23:43:03.692143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-05T00:05:47.596423Z","title":"Ace-step: A step towards music generation foundation model.arXiv preprint arXiv:2506.00045, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-05T00:05:44.790684Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T00:05:47.596423Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2509.06155"},"observation_digest":"sha256:1b13effc12172b5f0cfeb6486cdc1ddcd24324564a3d6ec1890b6bb5c4e9ee85","observation_id":"5110b3af-f508-44e5-b08f-763b95cffc20","resolution":{"observed_at":"2026-08-05T00:05:47.596423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-06T11:49:53.749464Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T01:03:15.183360Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2510.01284"},"observation_digest":"sha256:f2ca04b1766565b69c9325569f15ba56538d7e459bb41e9718b2e6fea2fe9e23","observation_id":"af8bd234-643b-4344-aedd-ca8b67093cd6","resolution":{"observed_at":"2026-05-17T01:03:15.219965Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2510.02797","last_updated":"2026-04-08T17:04:46Z","snapshot_observed_at":"2026-07-06T22:31:35.666707Z","submitted_at":"2025-10-03T08:10:19Z","title":"SongFormer: Scaling Music Structure Analysis with Heterogeneous Supervision","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T10:45:09.089710Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2510.02797"},"observation_digest":"sha256:e1c013a6dff4e19ac51cd90f0020d7aef4b72084205936f334fb096c5bdb1ff4","observation_id":"b6b2c2c2-c7a3-481f-8e9c-b03a6dd75d6a","resolution":{"observed_at":"2026-05-18T10:46:16.858659Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-03T16:25:55.887395Z","title":"Ace-step: A step towards music generation foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-08T08:34:03.360784Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:55.887395Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:612fadf83f01f688e26482681356a72dc5820923884dd53e2b61e06c746a2b3f","observation_id":"7ae5821c-dec4-4de1-bb54-c93df909c2ee","resolution":{"observed_at":"2026-08-03T16:25:55.887395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2602.11910","last_updated":"2026-05-18T20:48:30Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-02-12T13:07:14Z","title":"TADA! Tuning Audio Diffusion Models through Activation Steering","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T13:40:47.112814Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2602.11910"},"observation_digest":"sha256:a81f36bd3bae6de6735a8f3cc7b7e4f21768def391322b1539b870d6a0fbbeeb","observation_id":"9968680e-dce0-4bf3-84ac-c4ce297dd30f","resolution":{"observed_at":"2026-05-21T13:44:11.551922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2602.22029","last_updated":"2026-05-05T13:00:43Z","snapshot_observed_at":"2026-08-03T04:31:55.954534Z","submitted_at":"2026-02-24T06:43:27Z","title":"MIDI-Informed Singing Accompaniment Generation in a Compositional Song Pipeline","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T20:17:45.920234Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2602.22029"},"observation_digest":"sha256:75ec374b92fae3c8817cc27a4202dd863d7e051b53badba242f374a44afcb533","observation_id":"7c6cabd7-a8aa-43c8-be3d-6880c211ae87","resolution":{"observed_at":"2026-05-15T20:20:17.918821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-02T17:35:47.688979Z","title":"ACE-step: A step towards music generation foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.688979Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:b6e24c4b8370d1926d42bf7ade7972cfd756986bac7a9598a307f8c9288db17c","observation_id":"310031d3-f4a0-4f8d-9b1a-2c3d248d3cb6","resolution":{"observed_at":"2026-08-02T17:35:47.688979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2604.11052","last_updated":"2026-07-23T10:38:22Z","snapshot_observed_at":"2026-08-07T15:30:54.909219Z","submitted_at":"2026-04-13T06:29:34Z","title":"LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T16:08:58.648967Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2604.11052"},"observation_digest":"sha256:da34c4f10c078c7c808a57cf6afcfbdaa76f5a33847ae16e06120f91576c03c3","observation_id":"ecbcf569-4432-4a67-8b22-40bd3d323ec8","resolution":{"observed_at":"2026-05-11T09:16:01.532365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-02T16:27:21.119692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11052","last_updated":"2026-07-23T10:38:22Z","snapshot_observed_at":"2026-08-07T15:30:54.909219Z","submitted_at":"2026-04-13T06:29:34Z","title":"LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T16:27:21.119692Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2604.11052"},"observation_digest":"sha256:5e21d8eb0c727f0f533ce639e9949663a2bc2e53a2e13abf2a319a23e3aeb742","observation_id":"13a0087d-9539-4c4a-8519-843e847b4df9","resolution":{"observed_at":"2026-08-02T16:27:21.119692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2604.25937","last_updated":"2026-04-16T04:26:34Z","snapshot_observed_at":"2026-08-04T04:34:28.014298Z","submitted_at":"2026-04-16T04:26:34Z","title":"SongBench: A Fine-Grained Multi-Aspect Benchmark for Song Quality Assessment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T10:14:41.499130Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2604.25937"},"observation_digest":"sha256:bbe272b142087f80c87c99a5ec18f0712fb6b073944550d954d1f5e8b07758c9","observation_id":"d0263534-865a-4bae-b7db-23f713ff310f","resolution":{"observed_at":"2026-05-10T10:24:22.334741Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2605.01809","last_updated":"2026-05-03T10:25:47Z","snapshot_observed_at":"2026-08-06T14:33:30.037257Z","submitted_at":"2026-05-03T10:25:47Z","title":"TMD-Bench: A Multi-Level Evaluation Paradigm for Music-Dance Co-Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T16:11:16.551910Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2605.01809"},"observation_digest":"sha256:cd34a8154e9ca1ccae47ee105376c5f77e65335f9e8bf663465a5107f1bc4c58","observation_id":"86ef11ed-3261-4695-a0b5-79949d4777c1","resolution":{"observed_at":"2026-05-11T16:36:06.108044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2605.03395","last_updated":"2026-06-05T18:04:38Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T06:11:51Z","title":"APEX: Large-scale Multi-task Aesthetic-Informed Popularity Prediction for AI-Generated Music","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-07T13:27:41.439049Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2605.03395"},"observation_digest":"sha256:4ac829ae2dfc6023c45b8bd5f45999cb3776c7b4daf810e2fcd3edb6f7225180","observation_id":"be05e593-f1f9-4e55-abdc-b9638dcd151c","resolution":{"observed_at":"2026-05-12T10:56:29.750313Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2605.03395","last_updated":"2026-06-05T18:04:38Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T06:11:51Z","title":"APEX: Large-scale Multi-task Aesthetic-Informed Popularity Prediction for AI-Generated Music","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-01T00:35:42.697038Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2605.03395"},"observation_digest":"sha256:0fb79a6fe1fef6a8290229be6d5b8d9143079593a989388a3d87728307a1f498","observation_id":"36991cea-e9fa-440d-b263-15473293870c","resolution":{"observed_at":"2026-07-01T00:45:12.341833Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-12T16:57:23.214654Z","title":"Ace-step: A step towards music generation foundation model.arXiv preprint arXiv:2506.00045,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.12479","last_updated":"2026-07-06T08:55:19Z","snapshot_observed_at":"2026-07-12T16:57:22.059952Z","submitted_at":"2026-05-12T17:56:29Z","title":"Cutting rules in strong field QED with application to trident pair production","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T16:57:23.214654Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2605.12479"},"observation_digest":"sha256:d952a07283fcb3b11f8a6cfe102e2ed194fd2788e9fc6ff5f157f8f45a44075e","observation_id":"8cef5aeb-d6b0-4e75-aee4-3ee51dfd1d14","resolution":{"observed_at":"2026-07-12T16:57:23.214654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2605.12480","last_updated":"2026-05-12T17:56:59Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:56:59Z","title":"OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T06:16:20.612291Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2605.12480"},"observation_digest":"sha256:d43a309951f9f981964cf2d8da8f78dc9775b0cdb76855ebf5d43b48afebdac2","observation_id":"12dd018e-0aad-4d75-9e9d-1619b69a25eb","resolution":{"observed_at":"2026-05-13T06:17:22.920096Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2605.17414","last_updated":"2026-05-17T12:22:17Z","snapshot_observed_at":"2026-08-06T15:14:48.165289Z","submitted_at":"2026-05-17T12:22:17Z","title":"S2Accompanist: A Semantic-Aware and Structure-Guided Diffusion Model for Music Accompaniment Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-19T22:50:08.321514Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2605.17414"},"observation_digest":"sha256:e83001e5441c2dd97fcab1a09d40484e849fdc7c23c3023646e1190d6cfe8b04","observation_id":"788b2689-12cb-414e-8b9a-0b20e04cbf89","resolution":{"observed_at":"2026-05-19T22:52:50.459830Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2605.21433","last_updated":"2026-05-20T17:23:58Z","snapshot_observed_at":"2026-08-02T08:06:48.596429Z","submitted_at":"2026-05-20T17:23:58Z","title":"Instrumental Text-to-Music Generation with Auxiliary Conditioning Branches","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T02:43:16.101544Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2605.21433"},"observation_digest":"sha256:879e6972c0427ff7792feda3a61ad8fab19b249a5649bf62416f6f7d2d749f36","observation_id":"ebc97580-98ed-49a8-a723-6ca14b67c2c3","resolution":{"observed_at":"2026-05-21T02:43:54.924541Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2605.30965","last_updated":"2026-05-29T07:58:54Z","snapshot_observed_at":"2026-08-02T19:54:21.945716Z","submitted_at":"2026-05-29T07:58:54Z","title":"ImmersiveTTS: Environment-Aware Text-to-Speech with Multimodal Diffusion Transformer and Domain-Specific Representation Alignment","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T21:12:19.893944Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2605.30965"},"observation_digest":"sha256:515e1139e113597676506a176bd3d6071fb59b29c76048bc9baee5ec443575a4","observation_id":"9d0fd53c-60e0-46d6-8c91-6b165351c0aa","resolution":{"observed_at":"2026-07-01T20:26:12.662750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2606.07015","last_updated":"2026-06-05T07:59:17Z","snapshot_observed_at":"2026-08-07T10:25:26.085858Z","submitted_at":"2026-06-05T07:59:17Z","title":"Towards Unified Song Generation and Singing Voice Conversion with Accompaniment Co-Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T21:14:08.243894Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2606.07015"},"observation_digest":"sha256:83aa033ddab12fdb4c3b9797dfcb219a74a1a6d892920cbc3ca6f456424c18d9","observation_id":"d47d9dbf-9398-49a1-b09c-e73fb9ac7a28","resolution":{"observed_at":"2026-07-02T19:57:19.597322Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2606.18052","last_updated":"2026-06-16T15:29:25Z","snapshot_observed_at":"2026-07-06T23:53:36.096914Z","submitted_at":"2026-06-16T15:29:25Z","title":"An Empirical Analysis of AI Slop in Music Streaming","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T00:08:36.279506Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2606.18052"},"observation_digest":"sha256:6329956f159831b67443f3157ee2322fb894e472132bbc4524158ba066da318f","observation_id":"e3b93717-bbc5-4583-8be1-24859dd65462","resolution":{"observed_at":"2026-07-03T21:48:59.861457Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":"2506.00045","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-03T21:48:59.860115Z","title":"Junmin Gong, Sean Zhao, Sen Wang, Shengyuan Xu, and Joe Guo","venue":null,"work_id":"0d4831b4-71c3-4405-b540-1683d26109f6","year":2025},"citing_paper":{"arxiv_id":"2606.30642","last_updated":"2026-06-29T17:59:20Z","snapshot_observed_at":"2026-08-10T03:18:36.396375Z","submitted_at":"2026-06-29T17:59:20Z","title":"LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T04:21:38.825926Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2606.30642"},"observation_digest":"sha256:4914cf062b10220043533fc1f055c649ae18d3e4d0ba0caf96e5bee2898fef6c","observation_id":"ddcc77e6-6770-4132-9653-1005ed10afa5","resolution":{"observed_at":"2026-07-01T15:15:47.551038Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-14T06:56:53.384109Z","title":"Ace-step: A step towards music generation foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11117","last_updated":"2026-07-13T05:48:08Z","snapshot_observed_at":"2026-08-04T03:50:24.298863Z","submitted_at":"2026-07-13T05:48:08Z","title":"MusicMark: A Robust Generative Watermarking Framework for Music Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T06:56:53.384109Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.11117"},"observation_digest":"sha256:5f659da2008729016b3d9ddcb91da67e5fc5570abea2368bebfddf46d49561a9","observation_id":"1db8f3b9-87af-4035-ab09-b0e72081ee04","resolution":{"observed_at":"2026-07-14T06:56:53.384109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-14T06:45:43.330341Z","title":"Ace-step: A step towards music generation foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11143","last_updated":"2026-07-18T06:21:59Z","snapshot_observed_at":"2026-08-02T07:05:02.947075Z","submitted_at":"2026-07-13T06:26:28Z","title":"Anysynth:Zero-Shot Instrument Cloning via In-Context Learning and Asymmetric Hierarchical Guidance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T06:45:43.330341Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.11143"},"observation_digest":"sha256:9f911b9bec23bd8e85d8966f1cb94bee0fe67d3c470197493d8dbaa008c5b2de","observation_id":"f2752145-d739-4f3b-abbc-59bf5cc42406","resolution":{"observed_at":"2026-07-14T06:45:43.330341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-02T07:05:04.510458Z","title":"Ace-step: A step towards music generation foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11143","last_updated":"2026-07-18T06:21:59Z","snapshot_observed_at":"2026-08-02T07:05:02.947075Z","submitted_at":"2026-07-13T06:26:28Z","title":"Anysynth:Zero-Shot Instrument Cloning via In-Context Learning and Asymmetric Hierarchical Guidance","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T07:05:04.510458Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.11143"},"observation_digest":"sha256:441253c7be6a63042c0d5d31c1be5491f9bac7a554911c057f654017d9630c3d","observation_id":"91482bf6-aca7-4c5f-9ea9-c288237debd6","resolution":{"observed_at":"2026-08-02T07:05:04.510458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-14T03:47:22.936776Z","title":"Ace-step: A step towards music generation foundation model.arXiv preprint arXiv:2506.00045,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11699","last_updated":"2026-07-27T11:24:39Z","snapshot_observed_at":"2026-08-07T07:32:51.039386Z","submitted_at":"2026-07-13T15:31:45Z","title":"Qwen-Music Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T03:47:22.936776Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.11699"},"observation_digest":"sha256:3d02fc74705384e9ca43859ae4abfd319d28b84e66c31514de85cef1c89dcb61","observation_id":"27e079cd-46e0-4357-a4b9-92661222b514","resolution":{"observed_at":"2026-07-14T03:47:22.936776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-02T06:52:26.903347Z","title":"Ace-step: A step towards music generation foundation model.arXiv preprint arXiv:2506.00045,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11699","last_updated":"2026-07-27T11:24:39Z","snapshot_observed_at":"2026-08-07T07:32:51.039386Z","submitted_at":"2026-07-13T15:31:45Z","title":"Qwen-Music Technical Report","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T06:52:26.903347Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.11699"},"observation_digest":"sha256:5160849bd2b4753c28ee3a04c3a795e7a3c6c24856af80c1e5d3f8d33e3f78a7","observation_id":"fe00cef8-e6c0-4493-ab55-6566a33784d9","resolution":{"observed_at":"2026-08-02T06:52:26.903347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-02T03:25:50.281276Z","title":"Ace- step: A step towards music generation foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13903","last_updated":"2026-07-15T14:44:50Z","snapshot_observed_at":"2026-08-08T20:01:31.101744Z","submitted_at":"2026-07-15T14:44:50Z","title":"Genre Bias or Aesthetic Perception? Identifying and Mitigating Shortcut Learning in Music Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T03:25:50.281276Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.13903"},"observation_digest":"sha256:ab4ddb9bf2479968b08d00db0ac4f4a41e6b97d809e33ef601c7a2ec8bc46942","observation_id":"db7d261c-a992-4881-837a-d860a877bf17","resolution":{"observed_at":"2026-08-02T03:25:50.281276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-01T12:01:57.134742Z","title":"arXiv preprint arXiv:2506.00045 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19688","last_updated":"2026-07-22T02:35:45Z","snapshot_observed_at":"2026-08-09T21:53:08.751359Z","submitted_at":"2026-07-22T02:35:45Z","title":"A Diagnostic Evaluation Framework for AI-Generated Cover Songs Using Music-Theoretic and Acoustic Features","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T12:01:57.134742Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.19688"},"observation_digest":"sha256:25d156671539189d94763002602146b43562f5ba32d51d66c4ea5b906f019e06","observation_id":"d949e0fb-134b-4f84-8d6c-0bedcbd70441","resolution":{"observed_at":"2026-08-01T12:01:57.134742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-01T10:24:19.082295Z","title":"Ace-step: A step towards music generation foundation model.arXiv preprint arXiv:2506.00045, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20253","last_updated":"2026-07-29T04:40:54Z","snapshot_observed_at":"2026-08-08T12:11:38.978134Z","submitted_at":"2026-07-22T15:11:46Z","title":"Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T10:24:19.082295Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.20253"},"observation_digest":"sha256:348fea2de8d408dc2cdc2e5c964d3026285eb73c2887f593c1f5dadfa667d8c7","observation_id":"c2a48299-6730-44a6-baaf-3ad500282caf","resolution":{"observed_at":"2026-08-01T10:24:19.082295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-07-30T23:40:07.801267Z","title":"Ace- step: A step towards music generation foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26698","last_updated":"2026-07-29T09:45:13Z","snapshot_observed_at":"2026-08-06T06:36:00.327490Z","submitted_at":"2026-07-29T09:45:13Z","title":"MPEcho: A Melody and Phoneme-Aware Generative Framework for Controllable Cover Song Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-30T23:40:07.801267Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.26698"},"observation_digest":"sha256:d2949ce7ed0b4773126b492662acacead5db8f3ae742799da9aa43b1aeb2854d","observation_id":"17568aa2-93fd-49dc-b420-c0f47a369205","resolution":{"observed_at":"2026-07-30T23:40:07.801267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-03T01:28:28.022775Z","title":"2506.00045 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28896","last_updated":"2026-07-30T23:28:11Z","snapshot_observed_at":"2026-08-10T16:52:29.863986Z","submitted_at":"2026-07-30T23:28:11Z","title":"TORUS: A Test of Rendering-Understanding Self-Coherence for Unified Audio Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T01:28:28.022775Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2607.28896"},"observation_digest":"sha256:6421a3cb4c1eb98cfaad11e07f2dcacc74b450a32cb9d54022e8a6cb78395f09","observation_id":"37152fb8-a22d-4c0f-b544-e5e048dca679","resolution":{"observed_at":"2026-08-03T01:28:28.022775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-04T16:29:20.556905Z","title":"Ace-step: A step towards music generation foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-09T11:38:54.510697Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:20.556905Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:818daa6c3484ee41b884d6e4760395912aa515b459c00d49228723f33168ea63","observation_id":"4942d2d7-e8a2-4feb-bb5a-321663b226e2","resolution":{"observed_at":"2026-08-04T16:29:20.556905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-07T00:14:43.128810Z","title":"Ace-step: A step towards music generation foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-09T11:38:54.510697Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:43.128810Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:a9d46e659b2a0af5d0606e699d5a8bb35bc1661b43db611e498f3b6c4d6d2283","observation_id":"0518d6f5-8d75-48c3-b78a-d633529e7370","resolution":{"observed_at":"2026-08-07T00:14:43.128810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00045/citation-record","integrity":"/paper/2506.00045/integrity","json":"/paper/2506.00045/citation-record.json","paper":"/paper/2506.00045"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:25.558155Z","title":"Yue: Scaling open foundation models for long-form music generation, 2025","venue":null,"work_id":"9c4319b0-45ba-4cc4-bea1-b997283dc706","year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:12.788886Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:acb42b56407ca362a371124c4945b2f21a6aeb6c4f4839124d680eee0706c673","observation_id":"a3000579-c655-4ccd-8eeb-6ad66dab2aef","resolution":{"observed_at":"2026-08-07T13:16:25.668650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:25.320076Z","title":"Songgen: A single stage auto-regressive transformer for text-to-song generation, 2025","venue":null,"work_id":"16fb156f-5d74-4e6b-acd9-35bba5f75939","year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:12.857886Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:471dfc65221e6fcc9eeaf2af9c1b191b7df1d8e5f8b70efee31f8121c1a512c4","observation_id":"4255b198-fae2-4325-a752-c7ad77d29d30","resolution":{"observed_at":"2026-08-07T13:16:25.446330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01183","last_updated":"2025-03-03T05:15:34Z","snapshot_observed_at":"2026-08-08T12:11:23.489892Z","submitted_at":"2025-03-03T05:15:34Z","title":"DiffRhythm: Blazingly Fast and Embarrassingly Simple End-to-End Full-Length Song Generation with Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01183","snapshot_observed_at":"2026-08-07T13:16:12.977552Z","title":"DiffRhythm: Blazingly fast and embarrassingly simple end-to-end full-length song generation with latent diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:12.977552Z"},"links":{"cited_paper":"/paper/2503.01183","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:0e30e9e6e72687a85bfa7eda88a2b49c12b6deb4e559d733638b5bedfabf39cb","observation_id":"d98a8a89-41db-4cec-936a-a6fd0dab535f","resolution":{"observed_at":"2026-08-07T13:16:12.977552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:13.077727Z","title":"Sana: Efficient high-resolution image synthesis with linear diffusion transformer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.077727Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:9ee999a9c70064367f7074e4ed65c18c4740175a0dffd4b38b1642d70fbb0a0e","observation_id":"b6a86041-e35e-4705-83e3-54706ec5eb98","resolution":{"observed_at":"2026-08-07T13:16:13.077727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10733","last_updated":"2025-05-18T21:17:22Z","snapshot_observed_at":"2026-08-08T21:24:29.917572Z","submitted_at":"2024-10-14T17:15:07Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10733","snapshot_observed_at":"2026-08-07T13:16:13.142079Z","title":"Deep compression autoencoder for efficient high-resolution diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.142079Z"},"links":{"cited_paper":"/paper/2410.10733","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:c61b9d388e6695ebc6aaf0e7fa3b07c1c04d408ebfe6a65ee9a16932637b3bd6","observation_id":"433aee22-c312-42d5-86a4-7cf845f2b03f","resolution":{"observed_at":"2026-08-07T13:16:13.142079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:25.085414Z","title":"Mert: Acoustic music understanding model with large-scale self-supervised training, 2023","venue":null,"work_id":"0a3ba59e-23e9-4de8-9e18-a3f811a4ec72","year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.234494Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:5e1ee6e8f7ad3a2bf90f22d4a74672872711c513a32b2122bef4f3757b233c16","observation_id":"2589ed82-51ac-4461-8b3c-f03ef7a4ae49","resolution":{"observed_at":"2026-08-07T13:16:25.180698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:24.885005Z","title":"mhubert-147: A compact multilingual hubert model","venue":null,"work_id":"59bd1706-89f6-497a-bec7-8ca451f7dfaa","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.348470Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:1bb8b9bb2055972b1c505f00bb3677a9a8cade269df96814b8bbd0cee757bcba","observation_id":"3c5ea20a-81e4-40f1-a753-405ba1c4e262","resolution":{"observed_at":"2026-08-07T13:16:24.971652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:13.472359Z","title":"Representation alignment for generation: Training diffusion transformers is easier than you think","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.472359Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:7a93beaa71b5a0180b59dc17a20ee5c6919515293b86533f9e4859c1a0d5c514","observation_id":"cf59c7bb-f0ad-4a2a-9c97-9ebdb1aecd2e","resolution":{"observed_at":"2026-08-07T13:16:13.472359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:13.580729Z","title":"High-resolution image synthesis with latent diffusion models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.580729Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:1539638f3afeb5f65a75dda0a079c5adec60c67f9d894000e0be2bf614743c68","observation_id":"3aa12378-f07a-4b68-b16b-689f0133f0bd","resolution":{"observed_at":"2026-08-07T13:16:13.580729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:13.698954Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.698954Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:969d014e2058f84a9644dc70467ab01fecc898456a619a95e52a3c78012bfacb","observation_id":"a665c522-449b-4a78-9fe9-ab3b64547272","resolution":{"observed_at":"2026-08-07T13:16:13.698954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:16:13.846965Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.846965Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:2dd711ac35488e0698349151f364766d23dfc31929f61bd9c39a749ca894c927","observation_id":"2528ee31-d1c1-4366-b2e2-c0c7be8d4db0","resolution":{"observed_at":"2026-08-07T13:16:13.846965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T13:16:13.964802Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:13.964802Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:b0d2fa4498b5395d9bb143c7ae042ae72db2cb1c478989ad570873a41b759724","observation_id":"5dbff2c0-301d-4a87-acd6-9b7f09410249","resolution":{"observed_at":"2026-08-07T13:16:13.964802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:14.113728Z","title":"Deepseek-v3 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:14.113728Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:ae8bc9919c9a66320e795883a6511a64a3fcd8f8c28476b7b5504f1d649b62fc","observation_id":"d73db496-44ac-42ad-88d2-2a32b812dc3d","resolution":{"observed_at":"2026-08-07T13:16:14.113728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:24.668353Z","title":"Improving Image Generation with Better Captions","venue":null,"work_id":"1548bd0b-b74f-45bc-a9ac-20982b46989e","year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:14.253432Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:250175c837c931ec8351f15c630c76e335b776941ea540907db48aec43ecc76c","observation_id":"54a29bf8-ac64-44fc-87d2-774e64440123","resolution":{"observed_at":"2026-08-07T13:16:24.769749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:14.370744Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:14.370744Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:b6251a51373279b3f14b7234bea87141159c2e257e06069114763cc67d628e1e","observation_id":"3db75307-76be-43f4-be64-410f63a112bc","resolution":{"observed_at":"2026-08-07T13:16:14.370744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:24.414140Z","title":"Imagen 3","venue":null,"work_id":"5a3275d4-66c3-4347-95c8-c4559cedc746","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:14.498247Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:ac4c88cb6607675128b3802556a38745636e79a0d4e461e97444bdb389b60a8f","observation_id":"032a81a8-48ef-4875-acc7-b16e737b0078","resolution":{"observed_at":"2026-08-07T13:16:24.542576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:24.193037Z","title":"Video generation models as world simulators","venue":null,"work_id":"442d0149-3e3d-4b74-9e11-9acc739c49d8","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:14.590362Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:6417ba1ef988f5639b241848044ff754eb09a21af0c4d904f2b6b5e1cc3d8050","observation_id":"b3d4face-d1e9-4fe9-8575-ff0f68040a27","resolution":{"observed_at":"2026-08-07T13:16:24.306066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:24.038054Z","title":"Kling AI Video Generation Large Model","venue":null,"work_id":"f9f8cb6a-f012-475f-a939-7ee0f9da7c00","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:14.758686Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:531263e9baa7a0748d62162071f6e265c59ca06040fecc302224c115fa2c5eed","observation_id":"36bfe483-0532-4eb5-a634-1a25ad3b1c5c","resolution":{"observed_at":"2026-08-07T13:16:24.129381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T13:16:14.901360Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:14.901360Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:88c357daf2a9d568375995ea8c84f76a739b8b9d8c65279970eda3a6c3bc0aa6","observation_id":"0eeb16a1-3e25-4afd-939d-d8ab09c85dcc","resolution":{"observed_at":"2026-08-07T13:16:14.901360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-06T03:57:57.420510Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-08-07T13:16:15.015975Z","title":"Jukebox: A generative model for music","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.015975Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:a3bc8e833f9f159077b920cb9cfc6e2fa4bdb694a4e461eb43ed38a4eb4322f4","observation_id":"c1ab91cc-a288-4e78-94fd-1b9f9c61077f","resolution":{"observed_at":"2026-08-07T13:16:15.015975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:23.871392Z","title":"Simple and controllable music generation, 2024","venue":null,"work_id":"33c353de-3986-4cbf-b11b-388a8cd485c8","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.135052Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:2a9250dfd4d5f899d9cc2cb457ea4e0e43276cbda9dfb49a9da3bdba3a7d442f","observation_id":"fb8fcf73-5fa6-4dad-94bf-0430639983ac","resolution":{"observed_at":"2026-08-07T13:16:23.969399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:15.277712Z","title":"AudioLDM: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.277712Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:d39bcd3cd176563911d23c9c16db59965f9fabd08f475804d2a95d2fbc6b9400","observation_id":"cefd8126-934c-499e-86dd-8758f887d83b","resolution":{"observed_at":"2026-08-07T13:16:15.277712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:23.649925Z","title":"Plumbley","venue":null,"work_id":"3397599e-4fbe-4c44-acbf-2610f0c2055a","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.444744Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:6decd890fab9af276b06c4621eb2883eca45d502ad8f586f17744d56093ca299","observation_id":"2c80b67f-2374-4816-a3e5-48bee299dd49","resolution":{"observed_at":"2026-08-07T13:16:23.735523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:23.398435Z","title":"Suno: Ai music generation platform","venue":null,"work_id":"e603fe1d-f7b8-4641-a079-e5ede8df282b","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.551102Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:73c1817ee34a1bde59e11a68436769055b45403d412ab4b61fa007b7476db6da","observation_id":"be19aa28-23b5-4c92-b8ac-b9afdf88f0ea","resolution":{"observed_at":"2026-08-07T13:16:23.529406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:23.132991Z","title":"Udio: Ai music creation platform","venue":null,"work_id":"dd2fb81d-e32d-4333-914e-ab1257b34bd9","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.666192Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:85fa614d23c35e030528e9e82b078715e34195db37c6380ab42308d78fb9dfaf","observation_id":"77fd87bf-e74c-457d-b26c-12c7b13daf85","resolution":{"observed_at":"2026-08-07T13:16:23.260573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:22.937599Z","title":"Riffusion: Stable diffusion for real-time music generation","venue":null,"work_id":"b567628c-ab4e-46aa-81aa-ec0720808dad","year":2022},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.731915Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:00924c537eff2a22cd043882b89505b7c85889c29811786d0f9ea7e05c4b38b9","observation_id":"da6d2e8c-483f-4fd1-86da-7988f2c1a9f4","resolution":{"observed_at":"2026-08-07T13:16:23.004960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:15.788346Z","title":"Parker, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.788346Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:1d12b452cb1bbc9ac9ed5b65795214386d2b733663bb8d591699c4c7ef1ca805","observation_id":"502e9e4b-5afd-432d-8ca9-7055c521d108","resolution":{"observed_at":"2026-08-07T13:16:15.788346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:22.670984Z","title":"Fast text-to-audio generation with adversarial post-training, 2025","venue":null,"work_id":"132b0b4a-dd2c-49b8-b4ab-6a371e2c88f2","year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.845585Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:e02888fa05506b2a3e0383a39e4425dc5b42fde7034f314dfe4d7c917348c7b3","observation_id":"41b8446b-b645-45db-b479-d1ca6c03f281","resolution":{"observed_at":"2026-08-07T13:16:22.787291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-07T13:16:15.893630Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.893630Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:39b0dfdc4f3b874d55800c1cb7afefd0b7034193910fc02d9447da4aeb24aaa4","observation_id":"5b8c6a90-b403-45be-91b9-c5ad4371ff17","resolution":{"observed_at":"2026-08-07T13:16:15.893630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:22.545032Z","title":"Efficientvit: Multi-scale linear attention for high-resolution dense prediction, 2024","venue":null,"work_id":"cdfa30d2-3534-42d3-8fec-e126f4248dcf","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:15.986885Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:a94459c9e97ac8907986ee1a0fa3805893dca153da0c27d0341960216b1de413","observation_id":"67bd7ed7-129c-4f63-a0c9-86e7737876e3","resolution":{"observed_at":"2026-08-07T13:16:22.589340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.081109Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.081109Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:2a08824f04a3e221cfc12c27368e33cabfce0315900127662a1849ba23899ea3","observation_id":"6d5f9850-9028-4703-a449-c41822ad9d5a","resolution":{"observed_at":"2026-08-07T13:16:16.081109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.172758Z","title":"Adding conditional control to text-to-image diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.172758Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:8ffc100f4eeeb025cc1d9fcc5687836a4b3591a74a8fa696d3b23b47eeb0b432","observation_id":"63d68aac-c2fc-4035-8987-286191a8ca6c","resolution":{"observed_at":"2026-08-07T13:16:16.172758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:22.374590Z","title":"Statistical parametric speech synthesis, 2007","venue":null,"work_id":"f1b6480b-b959-4193-84e0-93c80d87053e","year":2007},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.265993Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:0bec6b25ffa734381685ebc29dfb66ea6daa4d79482b2910ad002f7d81100ddc","observation_id":"b9368db9-aa8b-432d-9efc-e8f9e1fadb3a","resolution":{"observed_at":"2026-08-07T13:16:22.444048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-10T16:20:00.218685Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-07T13:16:16.366580Z","title":"Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.366580Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:f341a9baf9dd248e0e96a3ae6fe7b781031608850a327bef5fd337e0c4f320eb","observation_id":"587953c3-962d-4b96-8ae5-507bfbef7791","resolution":{"observed_at":"2026-08-07T13:16:16.366580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.460073Z","title":"Neural discrete representation learning, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.460073Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:3415e42106f74e4e640d19a26a9d233073d8d7fc68cb1d16129aca06d1ff10b2","observation_id":"f2543d06-48ff-44c9-b707-fe77133774a3","resolution":{"observed_at":"2026-08-07T13:16:16.460073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:22.195849Z","title":"Denk, Zalán Borsos, Jesse Engel, Mauro Verzetti, Antoine Caillon, Qingqing Huang, Aren Jansen, Adam Roberts, Marco Tagliasacchi, Matt Sharifi, Neil Zeghidour, and Christian Frank","venue":null,"work_id":"82ad1b35-deea-48a8-9f85-3eabbda6466d","year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.534619Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:4f3c0427ace85b4117404c53a0affd830525fa2ddb65fa904b59f59b047d1bb2","observation_id":"6dd4fbcc-2fb6-41c2-ae42-37249840015a","resolution":{"observed_at":"2026-08-07T13:16:22.263871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:21.906549Z","title":"High fidelity neural audio compression, 2022","venue":null,"work_id":"f2aa15a4-b00a-475a-a89a-7c5ed04e746a","year":2022},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.619063Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:6daef102c2e02772b5844e8de0212e9e3d4dab2a7a52566d86953a90a6d1c60d","observation_id":"6e5baced-7c4b-4e37-96f8-8f2d22c21b12","resolution":{"observed_at":"2026-08-07T13:16:22.059052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:21.692789Z","title":"Large- scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":"5f4718db-5171-4746-a34a-4ae8368af29f","year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.749152Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:38c0a827548bc13bc2cea41604d6c0b24997c57b9a83feb3b9e3f85a439249a2","observation_id":"b38abdfa-eddb-436a-96b3-1811361198a5","resolution":{"observed_at":"2026-08-07T13:16:21.790631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.842940Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.842940Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:a6fdf36ad8e6ec67b6d6b18ce5073ccd3ab5b5d94476e8278306cea83b650319","observation_id":"a5bbe826-79cd-46da-9e6c-766a694cd5b4","resolution":{"observed_at":"2026-08-07T13:16:16.842940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:16.936678Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:16.936678Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:909ed37fb3c2b03951e585f18715840680ec75e699d9c0e677156eafad8a1b18","observation_id":"0a48cfb5-87c1-4360-94a0-4a48302fc962","resolution":{"observed_at":"2026-08-07T13:16:16.936678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.004006Z","title":"Scalable diffusion models with transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.004006Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:f11b3b6a33da593a3c1bee62d1ec7394462752c49e6c7c573de22d6c48b015bb","observation_id":"55040861-a98a-43d6-87d5-39e4c0d1eed6","resolution":{"observed_at":"2026-08-07T13:16:17.004006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.092132Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.092132Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:4679abeb95cd4a9f24ab76ccdd44337b66064412b0d1cb61abb06258ed5427b1","observation_id":"40dc43ad-6a7c-4351-b11e-9b8bd383284b","resolution":{"observed_at":"2026-08-07T13:16:17.092132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.167427Z","title":"U-net: Convolutional networks for biomedical image segmentation, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.167427Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:38074e8a7299b4974cb29467a920cd84f83054bf156bcae810f07c7fe4b906f4","observation_id":"f2465be3-9e95-4ce1-8488-3cc5f589b692","resolution":{"observed_at":"2026-08-07T13:16:17.167427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.253728Z","title":"Meta audiobox aesthetics: Unified automatic quality assessment for speech, music, and sound","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.253728Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:bb293edd271fb88b242cf21b8b1e574622385e70b6247c3ae4d7af20a030e124","observation_id":"6b2dcfad-8129-4fce-96a4-18d49de674f5","resolution":{"observed_at":"2026-08-07T13:16:17.253728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T13:16:17.352668Z","title":"Qwen2.5-omni technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.352668Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:e974e6a465b96e80ac36e6d1e4f362e2e9a61a47ac149df1eec0448710395297","observation_id":"62638e80-0a3d-4f37-8f4c-bc087b8beeee","resolution":{"observed_at":"2026-08-07T13:16:17.352668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:17.424130Z","title":"Robust speech recognition via large-scale weak supervision, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.424130Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:c7841d2f07aaad414064b5a19902f5af33b24f1d52c47e3ce982747b0a771de3","observation_id":"a724f43c-4e91-4834-95d8-45eda269d2b9","resolution":{"observed_at":"2026-08-07T13:16:17.424130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:21.483154Z","title":"ekzhu/datasketch: v1.6.5, May 2024","venue":null,"work_id":"c915e46a-72c4-4782-b574-7ebe9e6c5a3c","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.512771Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:b1357ebf60ec5ccc9c856317f8df012d91c65524dd5f83e3025addf3f3336b59","observation_id":"bfc12106-f8f9-4142-96a3-2b41058488de","resolution":{"observed_at":"2026-08-07T13:16:21.578319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:21.292109Z","title":"Byt5 model for massively multilingual grapheme-to-phoneme conversion","venue":null,"work_id":"008a4d55-0a2f-4bb7-9c5a-644b417fa9b6","year":2022},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.590060Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:307b14a82dd77c7a0d123d5d7c0077b9c241d63b58555db25e596c88e7ee00a6","observation_id":"35c29adf-ab98-49a5-b5b2-aa40a98aee3c","resolution":{"observed_at":"2026-08-07T13:16:21.373421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:21.051758Z","title":"All-in-one metrical and functional structure analysis with neighborhood attentions on demixed audio","venue":null,"work_id":"0d861838-54d7-4df2-be71-a51efef6acbe","year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.671225Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:5b8a4ab1daa61ec9e5e862bd94739f18fe260993305959713e567b8d0ac31809","observation_id":"b98c5d1f-f36e-4a92-99c6-a50be36cd851","resolution":{"observed_at":"2026-08-07T13:16:21.189976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.868433Z","title":"Beat this! accurate beat tracking without DBN postpro- cessing","venue":null,"work_id":"1d175490-3b64-4294-8de8-adb6c8e8ff9c","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.799489Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:4410dbcb6dc67e390ddfc960db8861dce9129e2d32a1205c66ca014a54e0d4d0","observation_id":"68373a3d-a027-485c-9967-8950194a1811","resolution":{"observed_at":"2026-08-07T13:16:20.948160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.679109Z","title":"Essentia: An audio analysis library for music information retrieval","venue":null,"work_id":"5a825bde-511a-464c-8974-9d1d3ccc005e","year":2013},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:17.920550Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:140fda2a93db491ce13ec816aaf73f9d68da73b6b1a205b1b57b0c10290be436","observation_id":"cbdea552-a5c0-4afe-81ec-8c671937469c","resolution":{"observed_at":"2026-08-07T13:16:20.776114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.517725Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model, 2024","venue":null,"work_id":"30a2e3ef-ec5e-4873-99d8-bf9df6553d08","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.015834Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:d32cccc79d8c79430e14ad3e5bf294f36e5ea6f11d71ba698fd58f3da5717071","observation_id":"711bf726-379a-44c7-a7b0-2038a34f9ceb","resolution":{"observed_at":"2026-08-07T13:16:20.580518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.358649Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis, 2024","venue":null,"work_id":"2e0d77f5-639c-4169-8a6e-877d7f3932f4","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.106129Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:7cb559f6069eec3346314071f407ac70a0eec75ac3299ab126b66844f6dd84ff","observation_id":"876fc305-bd3e-4431-9b59-e4b551bf33c4","resolution":{"observed_at":"2026-08-07T13:16:20.426135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:18.231538Z","title":"Pixart-α: Fast training of diffusion transformer for photorealistic text-to-image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.231538Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:5f077d2df12ca6340ab9c7184fa6bb62f28385cd1f51ce830b45f06e6cba737c","observation_id":"e626520f-3c7f-4b8d-88fa-fefb94a03737","resolution":{"observed_at":"2026-08-07T13:16:18.231538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.212658Z","title":"Unimax: Fairer and more effective language sampling for large-scale multilingual pretraining, 2023","venue":null,"work_id":"a47136f8-68b7-4b02-b0b9-beff90794d9c","year":2023},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.345992Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:fec426452f67d3a39506b7654492fc3339b0e604525ca09218a7626523dc4914","observation_id":"9879f042-94ca-47cf-899d-307e3e426a08","resolution":{"observed_at":"2026-08-07T13:16:20.277393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:20.066102Z","title":"Learning diverse features with part-level resolution for person re-identification, 2020","venue":null,"work_id":"decfc4bd-b1be-41e9-82fb-ffe504ef4c26","year":2020},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.495011Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:fbf8d6c42172cf56e592e4ebe62dc9dc17a88d2bab9ed3cf95efdd57f13ce175","observation_id":"3f70d972-b2da-4ae0-9ce9-9a8f7eae6228","resolution":{"observed_at":"2026-08-07T13:16:20.133842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:18.572288Z","title":"Scaling rectified flow transformers for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.572288Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:a41ad88f7609fcd08689c4ee8023425374f76928347d6158ce1e0e1917ced579","observation_id":"4ef08c98-252d-4b9d-8399-48c7620debb5","resolution":{"observed_at":"2026-08-07T13:16:18.572288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.870577Z","title":"Adapting frechet audio distance for generative music evaluation","venue":null,"work_id":"36719dc8-3b73-409c-ad5a-852a8ed273b8","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.701310Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:85db295aaa7d29748d8faa8e11213ebaeee21be9e57a93a4ec392ed35a739b4c","observation_id":"9e9a9e3c-20c2-44da-b4ca-9d0df6151958","resolution":{"observed_at":"2026-08-07T13:16:19.979871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.684944Z","title":"Stable Audio Metrics, 2024","venue":null,"work_id":"79cb31d0-0cdf-41e5-bf5a-4ed3f08c0dad","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.830656Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:e39259847d6f3ea7970120fbfbd1504992c4b10c9793e1a436bf2ede8623c4a1","observation_id":"837ce3fc-4811-4b2a-81eb-be22b0b2d8ac","resolution":{"observed_at":"2026-08-07T13:16:19.788623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01108","last_updated":"2025-01-03T08:35:34Z","snapshot_observed_at":"2026-08-02T14:58:36.177043Z","submitted_at":"2025-01-02T07:08:29Z","title":"MuQ: Self-Supervised Music Representation Learning with Mel Residual Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01108","snapshot_observed_at":"2026-08-07T13:16:18.929184Z","title":"Muq: Self-supervised music representation learning with mel residual vector quantization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.929184Z"},"links":{"cited_paper":"/paper/2501.01108","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:102e629cc67a7eb6ff12a9294753fbd2b7b4eddd345523efac6314aa19630830","observation_id":"a56da72c-0086-41a0-85d5-db3e88f850a4","resolution":{"observed_at":"2026-08-07T13:16:18.929184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.515208Z","title":"stable-ts: Stabilizing Timestamps for Whisper, 2024","venue":null,"work_id":"691b2f0d-f95f-42de-bb0c-ec1d3240a9c5","year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:18.996979Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:a5fce5eadba80df4db92490cee9bc73170f9d30ac27d6fd81ff8d32f1a17159a","observation_id":"f76fba90-df7f-43ae-af5a-a196407df3fe","resolution":{"observed_at":"2026-08-07T13:16:19.581782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10793","last_updated":"2025-05-16T02:06:25Z","snapshot_observed_at":"2026-08-09T21:53:00.424066Z","submitted_at":"2025-05-16T02:06:25Z","title":"SongEval: A Benchmark Dataset for Song Aesthetics Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10793","snapshot_observed_at":"2026-08-07T13:16:19.098611Z","title":"Songeval: A benchmark dataset for song aesthetics evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:19.098611Z"},"links":{"cited_paper":"/paper/2505.10793","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:fb179e9962a80bda08ff0e4c75b48755b82967d4bb5f883e73d0134b7cf95c47","observation_id":"73391fcb-d9e8-4f78-a451-9e57ef435084","resolution":{"observed_at":"2026-08-07T13:16:19.098611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:16:19.207061Z","title":"Simplifying, stabilizing and scaling continuous-time consistency models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:19.207061Z"},"links":{"citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:1f12b28a6624fb733fbe1ef5048965660edf0c81f5aa8e458357cb98d923447f","observation_id":"b5ccf2bb-3846-43b3-b876-238fa7d2be45","resolution":{"observed_at":"2026-08-07T13:16:19.207061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08629","last_updated":"2025-07-22T12:07:56Z","snapshot_observed_at":"2026-08-07T00:06:35.032642Z","submitted_at":"2024-12-11T18:50:29Z","title":"FlowEdit: Inversion-Free Text-Based Editing Using Pre-Trained Flow Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08629","snapshot_observed_at":"2026-08-07T13:16:19.338517Z","title":"Flowedit: Inversion-free text-based editing using pre-trained flow models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:19.338517Z"},"links":{"cited_paper":"/paper/2412.08629","citing_paper":"/paper/2506.00045"},"observation_digest":"sha256:c470c020324de5f4c21f6d231861cc7bf9b855a305e11984878338590654077f","observation_id":"1a7b8550-da2e-4817-86e1-545e4bad6098","resolution":{"observed_at":"2026-08-07T13:16:19.338517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 36 inbound Pith citation observations for arXiv:2506.00045."}