{"as_of":"2026-08-11T22:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0ed558b4507ac45c756deaaca193af811b067eca22bb7a684f2c0058a30f49ce","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:15:41.020223Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.05586/citation-record","integrity":"/paper/2501.05586/integrity","json":"/paper/2501.05586/citation-record.json","paper":"/paper/2501.05586"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.573848Z","title":"FreeVC: Towards High-Quality Text-Free One-Shot V oice Conversion,","venue":null,"work_id":"a3fd739b-9e9b-4d10-82f6-817f442b503d","year":2023},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.848447Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:3d41753693648973c7e01b3e9ac16afba47610d912a6249a4ec2406be28b5d19","observation_id":"6931adb5-9994-4127-a861-e69d554f02e4","resolution":{"observed_at":"2026-08-10T21:15:41.577390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.561922Z","title":"Style tokens: Unsupervised style modeling, control and transfer in end-to-end speech synthesis,","venue":null,"work_id":"07aa0e12-936c-4eed-a11f-de87a121ea5b","year":2018},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.853537Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:1b47216cf2e1ccd3f9bca5d4f362f4ff6e1fc95257c632564419f65a3a1a9977","observation_id":"b5107cb2-805e-4f4e-af4a-b04f622ec761","resolution":{"observed_at":"2026-08-10T21:15:41.566532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:40.858432Z","title":"Seen and unseen emotional style transfer for voice conversion with a new emotional speech dataset,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.858432Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:dcadf6d93254050416d83f9cef110c8249e9fa618e1ac831a5cde1b067c6fbad","observation_id":"03d09075-c589-4f6a-b469-7b448722632e","resolution":{"observed_at":"2026-08-10T21:15:40.858432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.541494Z","title":"Pitchnet: Unsupervised singing voice conversion with pitch adversarial network,","venue":null,"work_id":"5996f258-fd0d-482a-8c13-22e3358400dd","year":2020},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.862902Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:d11e3c6c77788724a1e92ff4d614effe87332b9935e84d1c213c5a10c12e0d7f","observation_id":"91e33771-d8de-433d-87c4-0702ff63dff4","resolution":{"observed_at":"2026-08-10T21:15:41.546045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.529441Z","title":"Towards high-fidelity singing voice conversion with acoustic reference and contrastive predictive coding,","venue":null,"work_id":"88bb8f09-1962-4c6b-aff2-196119a9211f","year":2021},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.867763Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:8d89ccf30fc1e884ee7e45b843db94aa756bdb0fdf1f2eb3c6b567d0a298c5fe","observation_id":"a4f02b7b-0962-4a68-87ac-86bcc2f60afd","resolution":{"observed_at":"2026-08-10T21:15:41.533932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.515985Z","title":"Diffsvc: A diffusion probabilistic model for singing voice conversion,","venue":null,"work_id":"9dc43c8c-f0eb-4141-b23a-f883378f1cad","year":2021},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.872138Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:fadc10aa6c1e78ff3e177d3e777f0d9f84353f59c4e38ec5a33d72b8f1de1de7","observation_id":"766e6f71-76ee-43e0-a654-dd5604d0c9e5","resolution":{"observed_at":"2026-08-10T21:15:41.520925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.503376Z","title":"FastSVC: Fast Cross- Domain Singing V oice Conversion With Feature-Wise Linear Modula- tion,","venue":null,"work_id":"510d8a0f-06b5-4ac7-8cb1-d7a76bdb4e1e","year":2021},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.877703Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:94293bb740a9f4e615fd7bcdb03b8ddc1032b0ed46fed2798207912ea2289728","observation_id":"273dc869-75a2-4976-9eee-76b8004127b8","resolution":{"observed_at":"2026-08-10T21:15:41.508628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.490402Z","title":"Improving adversarial waveform generation based singing voice conversion with harmonic signals,","venue":null,"work_id":"988ca249-ed88-4034-971c-0060106cefce","year":2022},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.881787Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:87a647598a130eb4640b656ae5c862c52ab313e60c8e77cbf6c0a1d401475280","observation_id":"d2ba06d7-d4c7-40f9-8173-d8e31914eb60","resolution":{"observed_at":"2026-08-10T21:15:41.494919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.478576Z","title":"Self- supervised representations for singing voice conversion,","venue":null,"work_id":"46f2c53d-47f7-4ca0-a470-d8ae3899bd2a","year":2023},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.886461Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:012f28a934ceb9e9df5a3655351b3e9032b947f13af2f6336852456a6c09dbe9","observation_id":"12a1af83-9281-4811-a2a8-5711a3bcdf13","resolution":{"observed_at":"2026-08-10T21:15:41.482600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.467367Z","title":"VITS-Based Singing V oice Conversion System with DSPGAN Post-Processing for SVCC2023,","venue":null,"work_id":"69b7a434-0fbf-4751-9a05-c197d5531d31","year":2023},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.890747Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:ae9cb5bf92d00e5747ee9dd0647bc27b6723d6a4350a1c35083fc615612b0be5","observation_id":"68d52e9d-b27b-46d3-8f49-9507ffa7b842","resolution":{"observed_at":"2026-08-10T21:15:41.471467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06103","last_updated":"2021-06-11T01:07:12Z","snapshot_observed_at":"2026-08-02T17:41:21.677381Z","submitted_at":"2021-06-11T01:07:12Z","title":"Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06103","snapshot_observed_at":"2026-08-10T21:15:40.894643Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.894643Z"},"links":{"cited_paper":"/paper/2106.06103","citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:6435e0d9f97d145051513fe50fbec5c8d3205281640197ff83022bf147135a23","observation_id":"4a58f97b-7ec4-4fd8-a89b-e463ce3e10c9","resolution":{"observed_at":"2026-08-10T21:15:40.894643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:40.898636Z","title":"Yourtts: Towards zero-shot multi-speaker tts and zero-shot voice conversion for everyone,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.898636Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:f28b67b38aaa86e7395a6c13fa2ef419ecef92d9ad5717f15e27c807dac2889b","observation_id":"58f294bf-dd32-490c-a8b6-d115af412565","resolution":{"observed_at":"2026-08-10T21:15:40.898636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:40.902399Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.902399Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:8e4e6a60d74bd90e209a32e8bc2b39049c798bc2c908bf244480491c6bcaf054","observation_id":"969c4212-e812-4cef-95d2-dee58ed7931e","resolution":{"observed_at":"2026-08-10T21:15:40.902399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:40.905931Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.905931Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:31dbcbc725e7e7f65c2043b5d7c177b612ead6c43a36c33d28b9993bc679b004","observation_id":"49b13319-e78e-47ca-a05e-e73bcb05e8f6","resolution":{"observed_at":"2026-08-10T21:15:40.905931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.09224","last_updated":"2022-06-23T19:15:10Z","snapshot_observed_at":"2026-07-06T13:01:51.959430Z","submitted_at":"2022-04-20T04:56:14Z","title":"ContentVec: An Improved Self-Supervised Speech Representation by Disentangling Speakers","version":2},"cited_work":{"arxiv_id":"2204.09224","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.09224","snapshot_observed_at":"2026-08-10T21:15:41.122719Z","title":"ContentVec: An Improved Self-Supervised Speech Representation by Disentangling Speakers","venue":"cs.SD","work_id":"95fe0d41-6839-461e-bf6e-7c3dca115299","year":2022},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.909914Z"},"links":{"cited_paper":"/paper/2204.09224","citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:24d0763049687b3fce763354e24dcc63d34392d21f3777aea7fce1841e02c38d","observation_id":"adf3aa77-22e2-41ea-8eb8-79d766a238f4","resolution":{"observed_at":"2026-08-10T21:15:41.127275Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.443552Z","title":"A unified model for zero-shot singing voice conversion and synthesis,","venue":null,"work_id":"78fd9b05-1597-4407-bb72-8dcfbcae8325","year":2022},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.914334Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:f95e208fc30a9b641a85979764d21191e5d85b69e655635e2fdf0c4df9608f95","observation_id":"4489eba6-c5b2-4bfc-8f8c-22130fca693d","resolution":{"observed_at":"2026-08-10T21:15:41.446943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.432565Z","title":"Zero-shot singing voice conversion based on timbre space modeling and excitation signal control,","venue":null,"work_id":"4cf74aec-6980-4b0d-a751-592fe234f6b5","year":2023},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.919237Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:f51e3a1165891b3fc977dd5e6e0e852045e0dff4b9b34500f04b9a45f4d8b370","observation_id":"4e353233-3024-476d-8ab7-c1fbf85c6ce1","resolution":{"observed_at":"2026-08-10T21:15:41.436211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11072","last_updated":"2023-05-18T15:59:36Z","snapshot_observed_at":"2026-08-04T04:23:05.343520Z","submitted_at":"2023-05-18T15:59:36Z","title":"Self-supervised Fine-tuning for Improved Content Representations by Speaker-invariant Clustering","version":1},"cited_work":{"arxiv_id":"2305.11072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.11072","snapshot_observed_at":"2026-08-10T21:15:41.104730Z","title":"Self-supervised Fine-tuning for Improved Content Representations by Speaker-invariant Clustering","venue":"cs.CL","work_id":"fc9c6b78-dbd7-4970-a749-bf032bc88e0f","year":2023},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.923718Z"},"links":{"cited_paper":"/paper/2305.11072","citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:5300e74fbd87b9a149306267b1e3e8e6f3105938e30538423e50e6c1994e7731","observation_id":"587774d7-5ff5-4d2b-825b-8c208f5edd30","resolution":{"observed_at":"2026-08-10T21:15:41.110996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.421989Z","title":"ECAPA2: A Hybrid Neural Network Architecture and Training Strategy for Robust Speaker Embeddings,","venue":null,"work_id":"00716546-6385-4308-9cdb-ecdc65c06aa2","year":2023},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.928644Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:3dc95cc00f442a9a9c8634b5877e8ffb393e58c8dd9827b77e93c9c1160ee25c","observation_id":"3f2ea55f-54e2-4338-adfb-fbb55daead03","resolution":{"observed_at":"2026-08-10T21:15:41.425692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.408944Z","title":"V oxCeleb2: Deep Speaker Recognition,","venue":null,"work_id":"cc57f029-c4a0-42d9-bbcc-1d7ef68e8f2e","year":2018},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.932406Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:1bd3cda9762dac22de60ff61857313eb8cefc086015d1a6c17cf57cb806299f1","observation_id":"9e5e8609-d6eb-431e-86f1-b27797633f02","resolution":{"observed_at":"2026-08-10T21:15:41.414019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15412","last_updated":"2023-06-28T01:53:37Z","snapshot_observed_at":"2026-08-05T14:08:17.696756Z","submitted_at":"2023-06-27T12:11:55Z","title":"RMVPE: A Robust Model for Vocal Pitch Estimation in Polyphonic Music","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15412","snapshot_observed_at":"2026-08-10T21:15:40.937286Z","title":"RMVPE: A robust model for vocal pitch estimation in polyphonic music,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.937286Z"},"links":{"cited_paper":"/paper/2306.15412","citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:0034d114ce19f89c5ea2edc9116dd0e82188ba31e43b7d6913ed244033e41751","observation_id":"e435b2a6-cdd0-40f5-b07e-2b2c47897c46","resolution":{"observed_at":"2026-08-10T21:15:40.937286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.397465Z","title":"U-net-based medical image segmentation,","venue":null,"work_id":"623736d9-09a3-4df3-819b-f6fb3769c812","year":2022},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.941498Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:3fc2230b8fed88a8cd7c2adf1011e4a51092a4af1f956ee8f34f720c21e6ebcb","observation_id":"3a2a45c4-c48d-45b2-be30-424042d266ae","resolution":{"observed_at":"2026-08-10T21:15:41.400778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3555","last_updated":"2014-12-11T06:46:53Z","snapshot_observed_at":"2026-08-10T04:10:43.257455Z","submitted_at":"2014-12-11T06:46:53Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.3555","snapshot_observed_at":"2026-08-10T21:15:40.945407Z","title":"Empirical evaluation of gated recurrent neural networks on sequence modeling,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.945407Z"},"links":{"cited_paper":"/paper/1412.3555","citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:f20367f502884c5debfb53bc93be6727b0ad8aee515e464bdd8d79fae6acf98f","observation_id":"1684ec90-5603-4fce-9a83-f0b23a1ebfe4","resolution":{"observed_at":"2026-08-10T21:15:40.945407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.386703Z","title":"AISHELL-1: An open- source Mandarin speech corpus and a speech recognition baseline,","venue":null,"work_id":"620f749f-0743-4d47-868a-d537543b1ebc","year":2017},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.949845Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:10523e786ca846b594df62e8b73dde1889f0163a305c3ff4487227dce01c781f","observation_id":"7de0cc37-c90a-440f-b9a1-b6ef68ce6caf","resolution":{"observed_at":"2026-08-10T21:15:41.390540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.376565Z","title":"AISHELL-3: A Multi- Speaker Mandarin TTS Corpus,","venue":null,"work_id":"b6054a07-bb14-4fe6-af19-8f1c1f677819","year":2021},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.953697Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:a46a90e01ea5cde6d09e3c7d457ad9fab44eca1bb2c3918a3482a8b2ee302053","observation_id":"9ba4a60f-607e-4a9d-b582-c64e26f7869a","resolution":{"observed_at":"2026-08-10T21:15:41.379939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.364912Z","title":"CML-TTS: A multilingual dataset for speech synthesis in low-resource languages,","venue":null,"work_id":"d3fc58f6-4f10-409d-af40-bd59b2412090","year":2023},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.957570Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:a2723ee3ab3221456f484d2565be7c245699f5b3333a93f987f90816348ee2e1","observation_id":"e98d9516-b95e-4806-b9e5-16724cb4f1ed","resolution":{"observed_at":"2026-08-10T21:15:41.369099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.06248","last_updated":"2019-08-17T06:04:46Z","snapshot_observed_at":"2026-08-10T04:14:03.409069Z","submitted_at":"2019-08-17T06:04:46Z","title":"JVS corpus: free Japanese multi-speaker voice corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.06248","snapshot_observed_at":"2026-08-10T21:15:40.960693Z","title":"JVS Corpus: free japanese multi-speaker voice corpus,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.960693Z"},"links":{"cited_paper":"/paper/1908.06248","citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:b45d73fd5b8a3ca980577073ad33dca7136c30c24d74595d61cad75f6f7d57d6","observation_id":"49102bf8-95a7-4e8a-98f7-c1922ec94470","resolution":{"observed_at":"2026-08-10T21:15:40.960693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.351627Z","title":"Hi-Fi Multi- Speaker English TTS Dataset,","venue":null,"work_id":"01942625-1806-4b6d-b035-eab1a6fdd301","year":2021},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.963974Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:d2ed618b6480faa3517d56ec2a7ca2d4c76927dc49ef07fecae0fb81cc1264d0","observation_id":"96ae84f9-98e2-4439-aa93-511fb102ed89","resolution":{"observed_at":"2026-08-10T21:15:41.356453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.340505Z","title":"LibriTTS-R: A restored multi-speaker text-to-speech corpus,","venue":null,"work_id":"c08409e8-90cc-4430-9db3-29bf9cf750a5","year":2023},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.969365Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:43330d676390b657ad2779ea9b1cefa631d555649bc9d49d8dc7e0d5c234608a","observation_id":"9c7f3811-37b6-4e3b-bbec-a350cefe05d0","resolution":{"observed_at":"2026-08-10T21:15:41.344722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:40.973686Z","title":"CSTR VCTK Corpus: English multi-speaker corpus for cstr voice cloning toolkit (version 0.92),","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.973686Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:1a0d3232969e7837c823b3cd8fb96f15166dbdafa5ad01d9b6467ecaa5f94d55","observation_id":"9f2f7636-13a8-40a2-b37f-bb8a8bf67e80","resolution":{"observed_at":"2026-08-10T21:15:40.973686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.328857Z","title":"NHSS: A speech and singing parallel database,","venue":null,"work_id":"58a64e32-c165-4260-909d-7d0d7e42d8f3","year":2021},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.977501Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:39d5aa6b789cc3e1ced04158cf570ce33571529ea05ab5ddb3efdc0325145043","observation_id":"0129c77e-54c9-47df-b11a-97ba02a65e8b","resolution":{"observed_at":"2026-08-10T21:15:41.332881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.315947Z","title":"Multi-Singer: Fast Multi-Singer Singing V oice V ocoder With A Large-Scale Corpus,","venue":null,"work_id":"fdd9a274-e0b8-4101-8eb6-8f081af4bdc7","year":2021},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.982126Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:87acc3de3590ed80f1a5850304e01bec89b227df50d39333c9e26fe1baab7c96","observation_id":"4d574d68-ba21-496b-b91c-99c14236dddc","resolution":{"observed_at":"2026-08-10T21:15:41.320970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.304879Z","title":"Opencpop: A high-quality open source chinese popular song corpus for singing voice synthesis,","venue":null,"work_id":"d3e5e732-c36b-461d-8a2a-c28ce09548e5","year":2022},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.986840Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:71394ad5cfdcdfcd65380ffe3dd3586fba31c026f022e60e00989f16e06a796c","observation_id":"7a602aa3-b7f9-4cb9-8bb4-566f35f20f95","resolution":{"observed_at":"2026-08-10T21:15:41.308285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.294577Z","title":"Learning the beauty in songs: Neural singing voice beautifier,","venue":null,"work_id":"1ae7053b-4eaa-44ad-b4bb-c7cb24b25651","year":2022},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.991230Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:f93bdd63ad169b802d8fbaf31623288ef88667e9cc2db756cec3462350c2b66a","observation_id":"a94e7eee-3282-4407-a79c-5f387dcb8509","resolution":{"observed_at":"2026-08-10T21:15:41.298442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.283300Z","title":"DiffSinger: Diffusion Acoustic Model for Singing V oice Synthesis,","venue":null,"work_id":"f5da2b59-40f6-4921-a570-bf1b54406283","year":2021},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.995490Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:1e71db387c030dd915e93d849410d6b469bc121163715c3e9ba3a6eb6b0fbfe3","observation_id":"3d2167fc-54fa-4583-aeb3-58cd9aa92da6","resolution":{"observed_at":"2026-08-10T21:15:41.287196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.271239Z","title":"V ocalSet: A singing voice dataset","venue":null,"work_id":"ee0ddf5e-6f7e-4564-8150-04caef26e939","year":2018},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:40.999501Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:58533f9fc895528a1dd9817c6da7341d91c1b28d5646054edf553bae6fcb1988","observation_id":"c1d1f930-8c56-4abb-85c7-98c0a167c798","resolution":{"observed_at":"2026-08-10T21:15:41.275904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.003966Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:41.003966Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:9168d1ab29ca49071a56c0b8f97c48828a08bc7b067beedfd4568f4929283321","observation_id":"68a2b5ad-d452-42cc-bb23-1865f5f45760","resolution":{"observed_at":"2026-08-10T21:15:41.003966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13516","last_updated":"2023-05-22T22:09:41Z","snapshot_observed_at":"2026-08-02T15:37:26.541116Z","submitted_at":"2023-05-22T22:09:41Z","title":"Scaling Speech Technology to 1,000+ Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13516","snapshot_observed_at":"2026-08-10T21:15:41.008870Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:41.008870Z"},"links":{"cited_paper":"/paper/2305.13516","citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:6bb7c49fd9734f6a61a361b192de6935530823300c1420dc3e505b59de6d1d99","observation_id":"553924f0-a986-4f16-b206-ba942c3f43d9","resolution":{"observed_at":"2026-08-10T21:15:41.008870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.253786Z","title":"Efron and R","venue":null,"work_id":"ef7c11df-7ea1-4555-8dfe-9190695012d2","year":1994},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:41.014399Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:f196a137fcb97db3a0748b9443edb6d317ef8f791ca5687edeffb459ff8ac53d","observation_id":"8df15eac-2d04-458c-bce0-e8bdbbf90684","resolution":{"observed_at":"2026-08-10T21:15:41.257823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:15:41.242940Z","title":"Confidence intervals for evaluation in machine learning,","venue":null,"work_id":"8e4e6bb2-4ea0-4d1c-b409-fe872ac74810","year":null},"citing_paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:41.020223Z"},"links":{"citing_paper":"/paper/2501.05586"},"observation_digest":"sha256:b6417b3ebb68bcfeda009f539de18721dd7487496ba28eb042cd0cbc1822c26e","observation_id":"00428290-5691-44a1-be86-2392169b2da7","resolution":{"observed_at":"2026-08-10T21:15:41.246661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.05586","last_updated":"2025-01-09T21:39:09Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T21:10:34.833875Z","submitted_at":"2025-01-09T21:39:09Z","title":"FreeSVC: Towards Zero-shot Multilingual Singing Voice Conversion"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":2,"verified_fuzzy":27},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2501.05586."}