{"as_of":"2026-08-09T21:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7cb8c80338838e456615914ae88f791e5dccb345730f954bdc3ed94abdad421c","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T17:35:47.715860Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T17:35:47.604755Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.23667","snapshot_observed_at":"2026-08-02T17:35:47.604755Z","title":"To address these gaps, we introduceEchoes, an evaluation- centric dataset for training and benchmarking AI-generated mu- sic detectors","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.604755Z"},"links":{"cited_paper":"/paper/2603.23667","citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:2428b838a87958f4b8bb84c616f9afa40045d1c9e79c7c4fa7cb76f905889257","observation_id":"44ad8c0c-fa1a-4a10-8bb1-7a30b24ed5b1","resolution":{"observed_at":"2026-08-02T17:35:47.604755Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.23667","snapshot_observed_at":"2026-08-01T02:12:19.708682Z","title":"Echoes: A semantically-aligned music deepfake de- tection dataset,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25530","last_updated":"2026-07-28T10:17:35Z","snapshot_observed_at":"2026-08-09T17:14:44.073080Z","submitted_at":"2026-07-28T10:17:35Z","title":"Finding the noise: Zero-shot AI Music Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T02:12:19.708682Z"},"links":{"cited_paper":"/paper/2603.23667","citing_paper":"/paper/2607.25530"},"observation_digest":"sha256:e42231b70a5acd00d61eda749ce08126eb96af37f03ddb81150a43b4f520f0f3","observation_id":"a01719dc-b2e6-4d4b-b754-9f96a4133432","resolution":{"observed_at":"2026-08-01T02:12:19.708682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2603.23667/citation-record","integrity":"/paper/2603.23667/integrity","json":"/paper/2603.23667/citation-record.json","paper":"/paper/2603.23667"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.597690Z","title":"Modern generators can pro- duce realistic music from short prompts, increasing the feasi- bility of large-scale synthetic music creation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.597690Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:05cc36723b556baf95be50e11b641c7f77361d0408c528c307a91f52a5c74fb1","observation_id":"45252b34-e399-4810-9588-d5c6058cd3e5","resolution":{"observed_at":"2026-08-02T17:35:47.597690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.608307Z","title":"Generation pipeline To build our dataset, we start from bona fide music tracks from the Free Music Archive (FMA) [26]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.608307Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:5dd7c1a725e7ad309828c126554b382880c8e8db17900d9160da198215e7e471","observation_id":"cc34b7aa-2bf0-4cdf-a16c-678466e75cf1","resolution":{"observed_at":"2026-08-02T17:35:47.608307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.611352Z","title":"Table 2:AI-music providers used to create Echoes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.611352Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:0b17c19a92b11a0d113ee51526888ec6cd7e029c00f18624460425781be290f8","observation_id":"f7bf9d8a-b853-4279-950e-fcc6489b121a","resolution":{"observed_at":"2026-08-02T17:35:47.611352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.614414Z","title":"Echoes contains 3577tracks (110hours) across pop, rock, and electronic mu- sic genres","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.614414Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:ab52962c7a3275fb5489d1f791800462a487647636ea09fec46d30ee17c030bb","observation_id":"f8331247-4f20-43d1-b7da-e433316504d1","resolution":{"observed_at":"2026-08-02T17:35:47.614414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.628735Z","title":"Automatic speaker verification spoofing and deep- fake detection using wav2vec 2.0 and data augmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.628735Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:d1e724393dab4e33da23281f4f801893743c86b756efa2551c8d6ce5e0315c07","observation_id":"8575e210-b8b8-4ce0-808e-8b79073382b6","resolution":{"observed_at":"2026-08-02T17:35:47.628735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.631519Z","title":"Towards generalisable and calibrated audio deepfake detection with self- supervised representations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.631519Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:0be502e0bed2ceca0ff862a744fc353c8e55c18710b857d09a12aa735721fb5e","observation_id":"eea60656-54b7-4958-8002-7d8b0fc049e0","resolution":{"observed_at":"2026-08-02T17:35:47.631519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.617454Z","title":"Deezer: 28% of all delivered music is now fully AI-generated,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.617454Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:245f628f9bef3295d51100dcfd75c2338f9b63b8dd89635f24035172ed6d2be0","observation_id":"aedaa9dc-d943-4ad2-a6aa-788e6c3bf31b","resolution":{"observed_at":"2026-08-02T17:35:47.617454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.620109Z","title":"End-to-end anti-spoofing with RawNet2,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.620109Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:e45fc13a0e69c867647ce24da3841c78c91440beea3f1d7b2856e71ca91b20b5","observation_id":"d56b1db8-2f94-4e66-92a3-f9876f4887c4","resolution":{"observed_at":"2026-08-02T17:35:47.620109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.623048Z","title":"AASIST: Audio anti-spoofing using in- tegrated spectro-temporal graph attention networks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.623048Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:e376ba7a9e0a26b159919d62734fcc7a0e666a0af7fc555e0f72db8674235979","observation_id":"3fc41619-1614-4b16-99b6-5823313f8992","resolution":{"observed_at":"2026-08-02T17:35:47.623048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.625772Z","title":"Singing voice graph modeling for singfake detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.625772Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:90b309f06e5f4f33bda1fba6ea6e82f8e0defa685095aced1d2d4fd3533e99e7","observation_id":"dc6e70d2-ccdc-4a80-a480-d76f2306ca11","resolution":{"observed_at":"2026-08-02T17:35:47.625772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.645497Z","title":"Speech is silver, silence is golden: What do asvspoof-trained models really learn?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.645497Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:4dbfc8550b7cfb727e3f5a7e86872da55b65b55d0260ba23a1b0386f4905edc9","observation_id":"989ecfcb-6806-46cb-b54f-9b6c990b888a","resolution":{"observed_at":"2026-08-02T17:35:47.645497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.648024Z","title":"Is synthetic voice detection research going into the right direction?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.648024Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:4cebc068c3adc9814b12b20c762451031b9b7c1a5b1147b237b62cd21a840e1f","observation_id":"3e3a0d5c-e7d9-4c4a-a2f7-1f240fc57594","resolution":{"observed_at":"2026-08-02T17:35:47.648024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04181","last_updated":"2024-05-22T09:31:21Z","snapshot_observed_at":"2026-08-06T15:30:49.806824Z","submitted_at":"2024-05-07T10:39:19Z","title":"Detecting music deepfakes is easy but actually hard","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04181","snapshot_observed_at":"2026-08-02T17:35:47.634115Z","title":"Detect- ing music deepfakes is easy but actually hard,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.634115Z"},"links":{"cited_paper":"/paper/2405.04181","citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:d3d63abcbc64e32eddea2acfcd3dcab6d0241c4d23e28aad5102ac782d623068","observation_id":"d649dba4-9d5d-42cb-99bb-d5151bce7d3d","resolution":{"observed_at":"2026-08-02T17:35:47.634115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00571","last_updated":"2024-12-10T10:23:54Z","snapshot_observed_at":"2026-08-03T20:55:17.602231Z","submitted_at":"2024-11-30T19:53:23Z","title":"From Audio Deepfake Detection to AI-Generated Music Detection -- A Pathway and Overview","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00571","snapshot_observed_at":"2026-08-02T17:35:47.637077Z","title":"From audio deepfake detection to AI-generated music detection–A pathway and overview,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.637077Z"},"links":{"cited_paper":"/paper/2412.00571","citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:c3411b56d41680ea0fec5f90ac12f4d0b464565b7d884bb70cf69ab288611a94","observation_id":"880e0dd3-d78b-439b-95dc-79809e193344","resolution":{"observed_at":"2026-08-02T17:35:47.637077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.640002Z","title":"Asvspoof 2019: Future horizons in spoofed and fake audio detec- tion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.640002Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:92a834a744ddaa46f88b7e280c14e3e48da4f2e0527798b9b75a41df906d24ee","observation_id":"dc159d6a-9e54-4f11-8616-4257ea57fd21","resolution":{"observed_at":"2026-08-02T17:35:47.640002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.642919Z","title":"Does audio deepfake detection generalize?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.642919Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:6d67eaedbe053496570d55a4151c010413ad8a16504761a70fd2360f82378ea0","observation_id":"8fb34544-7378-4f25-9b70-ae006fbc8580","resolution":{"observed_at":"2026-08-02T17:35:47.642919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.661708Z","title":"Simple and controllable music gen- eration,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.661708Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:742e131ecd9379b2aa97f7cce886d37ed7e4fe9456e496ea9e01d9be7fc426c1","observation_id":"0bbb1136-304b-425d-9624-2c4232cc987d","resolution":{"observed_at":"2026-08-02T17:35:47.661708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.664410Z","title":"Audioldm: Text-to-audio generation with la- tent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.664410Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:78e22d9e41cae02d49659ae43a7eb219a3e88952ee7d86db5cad45eb68a1e4d7","observation_id":"1842c29b-2214-49ca-9d82-6515d9178291","resolution":{"observed_at":"2026-08-02T17:35:47.664410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.650647Z","title":"Circum- venting shortcuts in audio-visual deepfake detection datasets with unsupervised learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.650647Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:4ddc4e967e65053ad853d588f347b0c5c8c6edf91f7e0dafee9526042f965907","observation_id":"b64ef3ce-ca4f-4a27-8eeb-327aeaf748a1","resolution":{"observed_at":"2026-08-02T17:35:47.650647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.653367Z","title":"Spoofed training data for speech spoofing countermeasure can be efficiently created using neural vocoders,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.653367Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:64b6d2e8b693de3d8581f1c61b154c59f7dc922c93451f80664e8562c247caec","observation_id":"f777843b-1b1e-4b30-8342-311b1cb4fe78","resolution":{"observed_at":"2026-08-02T17:35:47.653367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.656072Z","title":"On the effec- tiveness of dataset alignment for fake image detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.656072Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:8e5cf038c340870ef1c054d83effdd199cfa87566d7c19fdc1ab7253b6e5a4c2","observation_id":"26c8155b-a6af-4a33-b5a3-200f18d5a78f","resolution":{"observed_at":"2026-08-02T17:35:47.656072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-02T17:35:47.658728Z","title":"MusicLM: Generating music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.658728Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:aec5ade8851c94a996412fea3b31216c06be8603cbab8ae198f136db82eaf16d","observation_id":"aaa7c602-2808-4d18-9b52-5ca0b3236756","resolution":{"observed_at":"2026-08-02T17:35:47.658728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.678138Z","title":"Benchmarking music generation models and metrics via human preference studies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.678138Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:2d50e480feb0fca102c6496b8ba0cf259a38a06fe2bc5c4e0b77ed5f4ecbb1ee","observation_id":"efdb90e4-fccd-46c3-8e50-e949560e42ce","resolution":{"observed_at":"2026-08-02T17:35:47.678138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.601713Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.601713Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:81b6d2b9f2f4d2bc69d293df42340e02229c2f38f01dac073eb818481f2ca215","observation_id":"956b0606-b043-42a8-a443-0451353381e9","resolution":{"observed_at":"2026-08-02T17:35:47.601713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.23667","snapshot_observed_at":"2026-08-02T17:35:47.604755Z","title":"To address these gaps, we introduceEchoes, an evaluation- centric dataset for training and benchmarking AI-generated mu- sic detectors","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.604755Z"},"links":{"cited_paper":"/paper/2603.23667","citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:2428b838a87958f4b8bb84c616f9afa40045d1c9e79c7c4fa7cb76f905889257","observation_id":"44ad8c0c-fa1a-4a10-8bb1-7a30b24ed5b1","resolution":{"observed_at":"2026-08-02T17:35:47.604755Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.667151Z","title":"Stable audio open,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.667151Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:b493b23bcba641b630c14486a3a19526dd96fbc783b73eb4fa6cc0023968fdd4","observation_id":"1fec0e70-473f-4b9b-9392-1c9e82eef8d2","resolution":{"observed_at":"2026-08-02T17:35:47.667151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.669793Z","title":"The AI mu- sic arms race: On the detection of AI-generated music,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.669793Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:989214f1e56427a56e6010a40180ad87ec430ed241dc58a7101a799add5d6757","observation_id":"8d85e2f4-64e6-412a-b6c7-d940e31e53ef","resolution":{"observed_at":"2026-08-02T17:35:47.669793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.672439Z","title":"Singfake: Singing voice deepfake detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.672439Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:cfaa18b6e5adafc843a7c1023bfb1391314868ce57498d36daeec800fbfadf77","observation_id":"4e2f75e2-42c5-428d-8527-18a46809197c","resolution":{"observed_at":"2026-08-02T17:35:47.672439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.675423Z","title":"SVDD 2024: The inaugural singing voice deepfake detection challenge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.675423Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:923fa0a67df387f1219fd66651ee5f10b46f494a34e779728432305919a7ab16","observation_id":"2f275c51-cb2a-4d72-9f43-2d5e57d7999a","resolution":{"observed_at":"2026-08-02T17:35:47.675423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.680810Z","title":"FakeMusicCaps: A dataset for detection and attribution of synthetic music generated via text-to-music models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.680810Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:4b43158fbb9e7113c7194c6f6fc65db44f3e859946cbc651c349de16bb675774","observation_id":"2f1614d1-70e4-4207-b462-2e7304da280f","resolution":{"observed_at":"2026-08-02T17:35:47.680810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.683700Z","title":"Sonics: Synthetic or not-identifying counterfeit songs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.683700Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:4183650f3036690fbb4442a39544b857a0db4c4f5db514ebbf4441db7ee04b8b","observation_id":"f2cc8a16-490d-4e0b-83c8-2b77128af670","resolution":{"observed_at":"2026-08-02T17:35:47.683700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.686235Z","title":"Fma: A dataset for music analysis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.686235Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:61eea8630e9ac46d5b56344586885227d73aad355d6a289307bdeb0c1b447783","observation_id":"1360d617-3f49-41cb-b2e1-7923710bc507","resolution":{"observed_at":"2026-08-02T17:35:47.686235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00045","last_updated":"2025-05-28T12:23:09Z","snapshot_observed_at":"2026-08-09T08:18:10.025134Z","submitted_at":"2025-05-28T12:23:09Z","title":"ACE-Step: A Step Towards Music Generation Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00045","snapshot_observed_at":"2026-08-02T17:35:47.688979Z","title":"ACE-step: A step towards music generation foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.688979Z"},"links":{"cited_paper":"/paper/2506.00045","citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:b6e24c4b8370d1926d42bf7ade7972cfd756986bac7a9598a307f8c9288db17c","observation_id":"310031d3-f4a0-4f8d-9b1a-2c3d248d3cb6","resolution":{"observed_at":"2026-08-02T17:35:47.688979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.692091Z","title":"Brev AI Music Generator,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.692091Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:b18a801b93fc1b36f21cab0d59c6f7827a6a74858798290827c6c228e90df1ce","observation_id":"e1518fce-7dc1-4f9a-90f6-08e4283063b3","resolution":{"observed_at":"2026-08-02T17:35:47.692091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01183","last_updated":"2025-03-03T05:15:34Z","snapshot_observed_at":"2026-08-08T12:11:23.489892Z","submitted_at":"2025-03-03T05:15:34Z","title":"DiffRhythm: Blazingly Fast and Embarrassingly Simple End-to-End Full-Length Song Generation with Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01183","snapshot_observed_at":"2026-08-02T17:35:47.694727Z","title":"DiffRhythm: Blazingly fast and embarrassingly sim- ple end-to-end full-length song generation with latent diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.694727Z"},"links":{"cited_paper":"/paper/2503.01183","citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:1b4b8ceed005fb317470e7b72c058c7cfbe879586440b7028ddabbe5b71a05ba","observation_id":"304ea97c-2504-47b8-9f27-966a268d524c","resolution":{"observed_at":"2026-08-02T17:35:47.694727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.697934Z","title":"Mubert AI Music Generator,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.697934Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:63993b88f51f2c8880867b5a996002d0bbf41e5f5748a55138ae76bfd0c1e47b","observation_id":"27e72b17-c0f0-4150-b34d-183b078f60c9","resolution":{"observed_at":"2026-08-02T17:35:47.697934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.700589Z","title":"Stable Audio 2.5,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.700589Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:fe1ab7aaed1bb0cfe4e7e67f1955f066c2f0c5bc5caf8ae57718d3326c6b62fe","observation_id":"5a78663a-b9fe-4544-b78a-41b954ee528b","resolution":{"observed_at":"2026-08-02T17:35:47.700589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.703276Z","title":"Songgen: A single stage auto-regressive transformer for text-to-song generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.703276Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:7c71285a8b013fb41f75ad02b52ddd093bc175f5bb1ebc8a8aa29078a89ca1d3","observation_id":"391fd423-cee0-4b85-870a-1b478d49cf9d","resolution":{"observed_at":"2026-08-02T17:35:47.703276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.705806Z","title":"Suno: AI Music,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.705806Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:f1e5e27218911242c6e8fe38125b205640e8265021b779a5b6d079f5b8877bc6","observation_id":"de576d16-fbf1-4e6f-9127-015733262d74","resolution":{"observed_at":"2026-08-02T17:35:47.705806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.708338Z","title":"Riffusion – Stable Diffusion for Real-Time Music Generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.708338Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:cb8813dabaea9f15b65cee608f87edfc47a61730b96865adf6a77f04d68d8431","observation_id":"f73c9b07-7791-435b-b620-3b284ead0273","resolution":{"observed_at":"2026-08-02T17:35:47.708338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.710839Z","title":"Udio: AI Music Generator,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.710839Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:e2babd40b939232cc3a9a90085fae997532f3dcd2dc4fd42a5a30c60c733d9b8","observation_id":"5d6ba32e-f7ef-430a-b01e-7f362e7e5b56","resolution":{"observed_at":"2026-08-02T17:35:47.710839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.713386Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.713386Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:e4182556ce1bbc5f3306fee45e46b117eaa1b3418d90833f321cb504fdf29f10","observation_id":"8d3e1a88-4a7f-435a-8f0c-659154796206","resolution":{"observed_at":"2026-08-02T17:35:47.713386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T17:35:47.715860Z","title":"Xls-r: Self- supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T17:35:47.715860Z"},"links":{"citing_paper":"/paper/2603.23667"},"observation_digest":"sha256:091c640ef4be6f038d24b222f35eb13861acf021a3aabdd44593ebda9cb553fe","observation_id":"19235081-2ae8-45dc-aa1d-0cd1c072cfbe","resolution":{"observed_at":"2026-08-02T17:35:47.715860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.23667","last_updated":"2026-07-16T17:12:51Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T20:07:16.825904Z","submitted_at":"2026-03-24T19:10:42Z","title":"Echoes: A semantically-aligned music deepfake detection dataset"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 2 inbound Pith citation observations for arXiv:2603.23667."}