{"as_of":"2026-08-09T19:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9fd0a914b55bac709d04cdef70548940a02d4f64b3438aa506ad40e1f0b9c860","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:30:27.279088Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-15T12:21:48.698333Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04519","snapshot_observed_at":"2026-07-15T12:21:48.698333Z","title":"Genvc: Self-supervised zero-shot voice conversion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.08977","last_updated":"2026-06-07T05:11:25Z","snapshot_observed_at":"2026-08-08T02:32:59.132973Z","submitted_at":"2026-03-09T22:11:40Z","title":"Universal Speech Content Factorization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-15T12:21:48.698333Z"},"links":{"cited_paper":"/paper/2502.04519","citing_paper":"/paper/2603.08977"},"observation_digest":"sha256:451437419135f6f157f8cad7d8a4faa3098c4ee92658582617f3cd68f9b25039","observation_id":"7860c175-f3de-4ccb-9b1b-5cb692542da4","resolution":{"observed_at":"2026-07-15T12:21:48.698333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04519/citation-record","integrity":"/paper/2502.04519/integrity","json":"/paper/2502.04519/citation-record.json","paper":"/paper/2502.04519"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.781538Z","title":"AutoVC: Zero-Shot V oice Style Transfer with Only Autoencoder Loss,","venue":null,"work_id":"1f3d11b7-4578-4158-801c-30c93a54645d","year":2019},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.923708Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:3d569be1907fad1065161cf5d3b28e778474b983cd897a51674f6441ba5e83a4","observation_id":"71c1e84d-e24a-42b8-a8bb-bf8fafaa6425","resolution":{"observed_at":"2026-08-08T22:30:28.786485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.766166Z","title":"GAZEV: GAN-Based Zero-Shot V oice Conversion Over Non-Parallel Speech Corpus,","venue":null,"work_id":"fad2516a-212e-473a-8f72-2f8ed78d5a8f","year":2020},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.928673Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:0b5996b9b1b01f0823c759e61cdfb518c6f4b9dc3505e2b2ce481bd7afcfc9d8","observation_id":"57116bc2-e5d8-408b-95e9-061b836bf82b","resolution":{"observed_at":"2026-08-08T22:30:28.770998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.751635Z","title":"SIG-VC: A Speaker Information Guided Zero-Shot V oice Conversion System for Both Human Beings and Machines,","venue":null,"work_id":"ca1c0901-a9dc-4867-b003-94e8bb376533","year":2022},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.933327Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:b814113c41d9dc1b4860ddf83f1f88d54e541ac91aac35cd20017524879c0a2a","observation_id":"df37264a-c034-4dc6-b631-090ebe334686","resolution":{"observed_at":"2026-08-08T22:30:28.756520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.737192Z","title":"An Overview of V oice Conversion and Its Challenges: From Statistical Modeling to Deep Learning,","venue":null,"work_id":"4481690e-3985-44eb-9800-c09b324e26fa","year":2020},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.938863Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:fb2ade5ee1d949b5deadb87f3296a9cb805fd6ca7d020a3ae451bd4e4296c7e7","observation_id":"3295ab77-01da-4aaa-aecf-fabe67f77fe5","resolution":{"observed_at":"2026-08-08T22:30:28.741973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.721165Z","title":"Prosodic Features for Speaker Veri- fication,","venue":null,"work_id":"58aca136-130b-41ac-944e-4d5fd6d83d77","year":2006},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.943697Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:93f6c20569f30db157c2e2196f926e9fe7c1081ed7df52efbe9ac813d90c7bca","observation_id":"64126789-70a5-402e-adbe-610c91a006a8","resolution":{"observed_at":"2026-08-08T22:30:28.726198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.706573Z","title":"FreeVC: Towards High-Quality Text- Free One-Shot V oice Conversion,","venue":null,"work_id":"4cf2d195-62f5-487b-96ea-b38d02c24a34","year":2023},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.948572Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:d0eaf23f823e9c35ae09e233e4c31871e1225cc0683f5ba969e80a93f25964f1","observation_id":"476bdcb9-b688-495a-b790-e32c5dbce96d","resolution":{"observed_at":"2026-08-08T22:30:28.711160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.692019Z","title":"The Database and Benchmark For the Source Speaker Tracing Challenge 2024,","venue":null,"work_id":"87b2f8ec-d313-46f0-b664-185ec1d25182","year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.953894Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:c974a30df484faa74e4652440afe224ffbe456b9728d77e4cca2e12d49f572c3","observation_id":"538bf111-925b-44b5-8b3a-4e36cf41c6e4","resolution":{"observed_at":"2026-08-08T22:30:28.697041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.676383Z","title":"NeuralVC: Any-to-Any V oice Conver- sion Using Neural Networks Decoder For Real-Time V oice Conversion,","venue":null,"work_id":"dd7a9dcd-309c-4ad3-a72d-132d6475cc22","year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.958510Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:050ee1fb90b668338283cafead32c3e82b611432b59b5e68bdddd4d34d2461c2","observation_id":"de760ea2-d4a8-4d40-a297-0217ed2dfa9c","resolution":{"observed_at":"2026-08-08T22:30:28.681244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.661071Z","title":"Identifying Source Speakers for V oice Conversion based Spoofing Attacks on Speaker Verification Systems,","venue":null,"work_id":"6f71fb07-36d8-43a3-81ad-1a257897a5c4","year":2023},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.962975Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:7c0028746940ac6ba3f51d7734d5f56f51a60e2f362c4f29673e22b87fcf9eaf","observation_id":"06902400-f3bf-48cb-9471-d92026eb4610","resolution":{"observed_at":"2026-08-08T22:30:28.665812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.646518Z","title":"Privacy Versus Emotion Preservation Trade-Offs in Emotion-Preserving Speaker Anonymization,","venue":null,"work_id":"32a6bd5b-d285-4cdc-b0d8-545226654de0","year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.967484Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:42a3dbb7387cd5d3a2c21c290fc4b274d3d8eaf7776aada7417b8b0c9f29e0ff","observation_id":"93174113-860c-4897-b38a-40e4f4548454","resolution":{"observed_at":"2026-08-08T22:30:28.650766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.632827Z","title":"Zero-Shot V oice Conversion with Adjusted Speaker Embeddings and Simple Acoustic Features,","venue":null,"work_id":"91dcafd6-7f98-459e-b3ff-90566a3d98bd","year":2021},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.972138Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:7367f6793a1116466be9eb0c7a60f70b7bca941abf03214cce20b21e45999ca3","observation_id":"ae623d40-0a59-4f2f-8eb9-5e9288abd926","resolution":{"observed_at":"2026-08-08T22:30:28.637204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.617667Z","title":"YourTTS: Towards Zero-Shot Multi-Speaker TTS and Zero-Shot V oice Conversion for Everyone,","venue":null,"work_id":"ed30467b-a55f-4657-96c2-e1bb2eb4e392","year":2022},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.976480Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:0ea0c5b473eca59f6ee75637fabd1161816e61f5f650397eed584c2e1e17b03a","observation_id":"9de9da97-adc0-4f55-9dfa-719cfdff486d","resolution":{"observed_at":"2026-08-08T22:30:28.622650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.602471Z","title":"Neural Analysis and Synthesis: Reconstructing Speech from Self-Supervised Representations,","venue":null,"work_id":"67f0fb19-b03c-49d1-a4ba-fb4268889f50","year":2021},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.980919Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:48196f9ce6e65d6527349d6f936d2d0b58ba21d82715ae1d464efdf4ba816366","observation_id":"bbf74823-d13d-4fd4-ba91-14c7037c60c9","resolution":{"observed_at":"2026-08-08T22:30:28.607510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.587492Z","title":"NANSY++: Unified V oice Synthesis with Neural Analysis and Synthesis,","venue":null,"work_id":"c1f7de75-169f-4c4f-a141-b7b4bda81d45","year":2023},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.985319Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:cbb89aa86fb16f327db6a66909b20a7d66f8e466adfdf266951309a08f4ef5d3","observation_id":"283487b7-4969-4266-b073-6e2aedeb86a4","resolution":{"observed_at":"2026-08-08T22:30:28.592358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-08T22:30:26.989835Z","title":"Better Speech Synthesis through Scaling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.989835Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:0b17f799ce17599c3ee0d02ec776bc74b2c0b457685b656fe2dc282d4e2919f3","observation_id":"4e19c775-5283-49ee-b401-6287a4341f94","resolution":{"observed_at":"2026-08-08T22:30:26.989835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.572190Z","title":"LM-VC: Zero-Shot V oice Conversion via Speech Generation Based on Language Models,","venue":null,"work_id":"c146b231-06a2-4ae2-ad80-8555d2225a6b","year":2023},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.995136Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:69e29cb84016c468e51ab115f4fc94a963f4aa50c7fe5485bac77b5c36f1b128","observation_id":"4c70f03d-fd70-4823-82d4-4c41599edd4f","resolution":{"observed_at":"2026-08-08T22:30:28.577280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.556273Z","title":"AudioGen: Textually Guided Audio Generation,","venue":null,"work_id":"67fc450a-77db-4ad3-b7fa-c670252efad9","year":2023},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.999490Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:a326f5d04b5d432d8824d44591563e8532b5aafe7f3bdf140fe3f3b83fe20389","observation_id":"26d1928a-3ae2-404b-83e9-36498cc8c7cb","resolution":{"observed_at":"2026-08-08T22:30:28.561580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-06T03:13:16.529776Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-08T22:30:27.004124Z","title":"Towards Audio Language Modeling-An Overview,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.004124Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:b04efb9801f3481f409bdd0619772d46caaf479d2aa3570efa362aa18620b3be","observation_id":"a7b5bfff-4835-4fca-9494-232bfbd952d1","resolution":{"observed_at":"2026-08-08T22:30:27.004124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.540106Z","title":"AudioLM: A Language Modeling Approach to Audio Generation,","venue":null,"work_id":"78baeea5-cbe6-44fe-9edc-326a967b3966","year":2023},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.009093Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:d75590d5cf4891293a1c5dfb2359ecc8441cfe9f622b23916c2a4adba3d70205","observation_id":"d04fdc0e-588b-44ab-8ec1-331074856051","resolution":{"observed_at":"2026-08-08T22:30:28.545081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.524741Z","title":"SoundStream: An End-to-End Neural Audio Codec,","venue":null,"work_id":"ad6a10de-3eba-45df-9e09-4354c21e8fca","year":2021},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.013711Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:a474a9276ee4619d3aee75e585fb2746d505f72f7ca784c3746845e70ec6ce07","observation_id":"206007ce-f73a-4dd6-94e2-9d81f43803f1","resolution":{"observed_at":"2026-08-08T22:30:28.529707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.508821Z","title":"Speak, Read and Prompt: High-Fidelity Text-to-Speech with Minimal Supervision,","venue":null,"work_id":"0c12b934-4c2b-4cbf-8764-2eb2a28f4173","year":2023},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.018358Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:aa5c69bb1167464dcb350b8287776311e351541b0f90bc1455f43ec19fa204b4","observation_id":"883ded18-f916-4399-98d9-a62732267a98","resolution":{"observed_at":"2026-08-08T22:30:28.513984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.493624Z","title":"V oiceCraft: Zero-shot speech editing and text-to-speech in the wild,","venue":null,"work_id":"54da8576-86d3-4f90-8433-0424e8698faa","year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.023068Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:aa37a9fbb50c45d33a7925e1f27ed1e56c1d100a806b66e1d538b6c91bf397c5","observation_id":"f221b66a-5587-46ab-8e7c-6fc5c67c127e","resolution":{"observed_at":"2026-08-08T22:30:28.498449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-08T22:30:27.027812Z","title":"CosyV oice 2: Scalable Streaming Speech Syn- thesis with Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.027812Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:dd16702bee393ddf802264f4941f4aa16c35f3c0054675ba7c2cc7e63be864b9","observation_id":"c5f122a8-dc71-4a6f-8a70-27c097e0ed36","resolution":{"observed_at":"2026-08-08T22:30:27.027812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-08T16:08:45.949013Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-08T22:30:27.032838Z","title":"CosyV oice 3: Towards In-the-wild Speech Generation via Scaling-up and Post- training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.032838Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:fa83d4441863eadb3307dca46722d22b1475f87e8ca58aade21c752311d6682e","observation_id":"3d79ea97-d09b-43cd-ab5b-75a2af4c6e69","resolution":{"observed_at":"2026-08-08T22:30:27.032838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-08T22:30:27.038490Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.038490Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:380ad7c302c293f723494c0b79f3171772b968b92356e81f0f85845798396ee2","observation_id":"87c2e8c0-a97c-4489-87a2-d93220f7b470","resolution":{"observed_at":"2026-08-08T22:30:27.038490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.477957Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers,","venue":null,"work_id":"d75abb8c-b673-4a7d-8751-4fa232555732","year":2025},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.043717Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:ab8036f87748a72c3ab0eb7c94c7942b73a1896b01e3c5b738a088d1b2ad12ba","observation_id":"d06cc4bc-1dc0-4259-bfc5-8c0e0d9f6c57","resolution":{"observed_at":"2026-08-08T22:30:28.482999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.048979Z","title":"High Fidelity Neural Audio Compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.048979Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:9baaf8bd3e3232f0618b02f018cac9a4345499bdf73f137b29a3bd6a52dcad6f","observation_id":"3c7bba64-613b-4124-b151-b901c08c3609","resolution":{"observed_at":"2026-08-08T22:30:27.048979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-08T22:30:27.053709Z","title":"Speak Foreign Languages with Your Own V oice: Cross-Lingual Neural Codec Language Modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.053709Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:917cd46bd2dc94bfc8b90b966cb12102d8b33be26e25c296807798a832deb453","observation_id":"4584d383-7a8d-4aa6-adec-bfdb1e2a0d79","resolution":{"observed_at":"2026-08-08T22:30:27.053709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-08T07:23:06.245954Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-08T22:30:27.058372Z","title":"V ALL-E 2: Neural Codec Language Models are Hu- man Parity Zero-Shot Text to Speech Synthesizers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.058372Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:d7853bd8230625f55160b36b2c25aea749f2fec0df7fbbc791cb332ab52e4201","observation_id":"2e6b6df4-1043-4cc5-8546-9e5b37c4b2af","resolution":{"observed_at":"2026-08-08T22:30:27.058372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-08T22:30:27.062791Z","title":"CosyV oice: A Scalable Multilingual Zero-Shot Text-to-Speech Synthesizer Based on Supervised Semantic Tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.062791Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:3a09a681df13ab1f45e0e7e9332e628e6cb0b6743c609adae9a591606ceb6b98","observation_id":"de3460c9-6464-4313-8607-a64dd04f09bd","resolution":{"observed_at":"2026-08-08T22:30:27.062791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.452276Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer,","venue":null,"work_id":"469fcc15-bc70-443e-a4de-f2d0e3c6a7d7","year":2025},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.067170Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:d9bfaa62a9212ddca6d2db408420ced664729a3767395e4a5a9787e756a57f60","observation_id":"dc341715-b904-4c60-a1c7-d36307712231","resolution":{"observed_at":"2026-08-08T22:30:28.457575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.437550Z","title":"Simple and Controllable Music Generation,","venue":null,"work_id":"0efbbaea-e260-49be-8221-b2085f5e33d0","year":2023},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.071252Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:53e2e49527a874a9d8ce2f3388985a1d73ef233296fb62de916fcc49815bf384","observation_id":"f7010b0d-f354-4d29-956a-7f9edc90c6e6","resolution":{"observed_at":"2026-08-08T22:30:28.442369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-08T22:30:27.075348Z","title":"Moshi: A Speech-Text Foundation Model for Real-Time Dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.075348Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:bf72849256a897300b68c0f94916f091c515040fb8fb8f37ca2a24b68a0118a7","observation_id":"89e60a65-2387-4e5f-aa28-4397eca88b5d","resolution":{"observed_at":"2026-08-08T22:30:27.075348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.422966Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model,","venue":null,"work_id":"f0e82a03-08d5-4adf-a673-32859fc3558c","year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.079438Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:ea6eaedf96d0c275638b037e2d1860261db4343b58d4a417016726b4d434d21e","observation_id":"017cc5e1-ca13-49a4-b0eb-c714a05140fb","resolution":{"observed_at":"2026-08-08T22:30:28.427706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.408297Z","title":"StreamV oice: Streamable Context-Aware Language Modeling for Real-time Zero-Shot V oice Conversion,","venue":null,"work_id":"fd490fde-1f26-4b93-9c41-303af7adff99","year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.084111Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:3e6b965d3422df4e0991c2fd19300565ebca6ea534ec5fa9e5c01aa2e92ad8dc","observation_id":"cf02f2e7-e96a-4201-ba1b-a3c5f0534f42","resolution":{"observed_at":"2026-08-08T22:30:28.413035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.392787Z","title":"Vevo: Control- lable Zero-Shot V oice Imitation with Self-Supervised Disentanglement,","venue":null,"work_id":"75b60b95-9160-4fa1-8ccb-77804f2df84a","year":2025},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.088859Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:30d0ca296f443241e42264d4365fd5ab70b9b5ca2e564b8972fc46332aa0f374","observation_id":"e316393a-9101-4af5-8dc3-630a32aa095a","resolution":{"observed_at":"2026-08-08T22:30:28.397784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02677","last_updated":"2024-06-12T14:05:43Z","snapshot_observed_at":"2026-07-06T17:55:03.561275Z","submitted_at":"2024-04-03T12:20:51Z","title":"The VoicePrivacy 2024 Challenge Evaluation Plan","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02677","snapshot_observed_at":"2026-08-08T22:30:27.094409Z","title":"The V oicePri- vacy 2024 Challenge Evaluation Plan,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.094409Z"},"links":{"cited_paper":"/paper/2404.02677","citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:d0194edaaaa0a86b697df4e59d6b2d7a8d6b0c9aa8439cefd19a1ff182534465","observation_id":"b59e1905-62e8-44d2-91c3-ab4a9795d566","resolution":{"observed_at":"2026-08-08T22:30:27.094409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.377319Z","title":"Self-Supervised Speech Representations are More Pho- netic than Semantic,","venue":null,"work_id":"40462d5a-73c0-4e7c-856f-4715d8fc4028","year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.099365Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:fc64be652e84b6867508dd1841770739659e4224d28be6749ea72adbf120f536","observation_id":"e8faea19-f188-4800-ae26-702bcc22c750","resolution":{"observed_at":"2026-08-08T22:30:28.382328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.361208Z","title":"S2VC: A Frame- work for Any-to-Any V oice Conversion with Self-Supervised Pretrained Representations,","venue":null,"work_id":"7c5e8ae8-6c49-4c29-b65c-5030c5205fcd","year":2021},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.103917Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:d72068569958a3325ad2af517494a214b7997c9d8bb690ef725ca13b511d6c54","observation_id":"53d349fd-6a88-4d19-92ee-87da1b6168dc","resolution":{"observed_at":"2026-08-08T22:30:28.366410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.343793Z","title":"S3PRL-VC: Open-Source V oice Conversion Framework with Self-Supervised Speech Representations,","venue":null,"work_id":"71ba08b7-ac19-4641-b765-2c41130ea36c","year":2022},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.108491Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:3e10646fc335a8218b661f83c30ab701a308c75058128853262eefc00802624b","observation_id":"6ab9a73c-379e-4d93-9b55-975ec331535f","resolution":{"observed_at":"2026-08-08T22:30:28.349822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.325968Z","title":"Neural Discrete Representation Learning,","venue":null,"work_id":"5da6162c-0d0d-4430-9936-b7c57c3de594","year":2017},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.113146Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:51981e285555f1eb6fe80749fed2305e66ab93e6fab07d14cdd913aa03f33af7","observation_id":"a16894b2-ec46-47e3-81ce-2c0ba66f305e","resolution":{"observed_at":"2026-08-08T22:30:28.331698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.309316Z","title":"Attention is All you Need,","venue":null,"work_id":"3cb9b102-0f06-4bb6-b93f-609870bfac4a","year":2017},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.117803Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:4fb14dbe374afbcf13f78256b3d22dbae5856d4b9839d08c00e57669a087bdfb","observation_id":"30a846b8-d196-4590-949b-9d622174ba4c","resolution":{"observed_at":"2026-08-08T22:30:28.313805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.292895Z","title":"Flamingo: A Visual Language Model for Few-Shot Learning,","venue":null,"work_id":"3f44ff1e-26a1-4989-9a70-32d5ee18da9f","year":2022},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.122721Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:2de64d3720a60553fec06a652b2e3586ec925a606828f7c61841762bfecbddfd","observation_id":"f26daa61-61b2-4ba1-bac6-0a2fead6521e","resolution":{"observed_at":"2026-08-08T22:30:28.298619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.277376Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers,","venue":null,"work_id":"bf6a3c49-4f6d-47d2-88c9-b1731cf1d387","year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.127444Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:003820eee04e32e5231826add938bc2e0ae0964b8a8963121fceb243b5e4d3a4","observation_id":"7288cac4-2c4e-4d43-afa4-b221ae96f723","resolution":{"observed_at":"2026-08-08T22:30:28.282304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.261400Z","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis,","venue":null,"work_id":"0b7bc0d4-600c-4320-b669-108e25f636e2","year":2020},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.131978Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:0397fb1b1afb6dad7bbc032fd67a16bff48463f6f6eca490a6c70c6ffb425a8f","observation_id":"4fd34713-3c3d-48c1-a1fe-7319b6d7fe23","resolution":{"observed_at":"2026-08-08T22:30:28.266549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.244696Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text- to-Speech,","venue":null,"work_id":"ec8ed470-4c57-47fe-9762-24fed3d9cef8","year":2019},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.136838Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:5fe6b005614777ca021b26179413224c3d18d68f9de51148f1f6f2fbdc6aeeb6","observation_id":"77a7b491-dd80-4067-af6a-a7683c040642","resolution":{"observed_at":"2026-08-08T22:30:28.250786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.142012Z","title":"Common V oice: A Massively-Multilingual Speech Corpus,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.142012Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:5744549560b58bc280920c7157a9df55f932fb80d56194c96418fbd08c3629bd","observation_id":"21fcf77c-46f6-4cff-8ffd-0aed48e9c707","resolution":{"observed_at":"2026-08-08T22:30:27.142012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.146476Z","title":"MLS: A Large-Scale Multilingual Dataset for Speech Research,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.146476Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:51521c5839ec4dc34f65c82eb7831f7b23e81b30af49516b10fc11ce309d450f","observation_id":"ddf739fd-5418-4521-b8e7-fd27cd1818d8","resolution":{"observed_at":"2026-08-08T22:30:27.146476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.206839Z","title":"CMU ARCTIC Databases for Speech Synthesis,","venue":null,"work_id":"14748587-96cf-461a-bbbd-61efd228d484","year":2003},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.151196Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:3b0d756fa36dab79421fbf6725b661d84d8f8c307479fce159f18629303d36e9","observation_id":"d3d017ef-8948-4d91-9071-165606f983ca","resolution":{"observed_at":"2026-08-08T22:30:28.211890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.190841Z","title":"The EMIME Mandarin Bilingual Database,","venue":null,"work_id":"a5c67cc0-6c45-4a06-81f2-a2a92b29f0bb","year":2011},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.155742Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:e981008bed31082e6a0f9d285f2e31368d3349163d110f20d607ca1a5c6acd32","observation_id":"48910e9d-6469-4166-9e87-0251622825f1","resolution":{"observed_at":"2026-08-08T22:30:28.195744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.174484Z","title":"Librispeech: An ASR Corpus Based on Public Domain Audio Books,","venue":null,"work_id":"30d7760c-9aa0-4790-a281-1d0e34b56672","year":2015},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.160700Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:adcbd71c4f12ddf99bc9590d36d4b86a87eb655748abb06fdfe13fc476fc17e7","observation_id":"f0fc4360-e347-43b2-b436-a216be764e81","resolution":{"observed_at":"2026-08-08T22:30:28.179990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.158687Z","title":"V oxCeleb: A Large-Scale Speaker Identification Dataset,","venue":null,"work_id":"a86df410-c9af-4f68-a7b4-9c8fbdc52e99","year":2017},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.165129Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:dd357158d614e3c06873c15b4164679019926e28eeb0fb433335597364ae71ff","observation_id":"d3f548f3-a30c-4472-82a9-f95c79720c30","resolution":{"observed_at":"2026-08-08T22:30:28.163119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.142994Z","title":"V oxCeleb2: Deep Speaker Recognition,","venue":null,"work_id":"bf23fcf0-cb3a-4ca7-a324-360818912f6e","year":2018},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.169658Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:698dec1749ff3ebc6ede2a2c73d9b8d4ab0055ee42ca6c093d35da96210e0a5f","observation_id":"1eac42d6-8919-4482-86c3-ed284ed169d8","resolution":{"observed_at":"2026-08-08T22:30:28.148092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.127163Z","title":"ContentVec: An Improved Self-Supervised Speech Representation by Disentangling Speakers,","venue":null,"work_id":"7bedde6a-ec91-4e8e-aba5-03ee59f504fa","year":2022},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.174264Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:1aa0af281124a7077fffbebbab8e34ae086b8d8311a3841faa1130f22768183b","observation_id":"d2f1e9d4-05c6-4b38-b143-3270e332a156","resolution":{"observed_at":"2026-08-08T22:30:28.132448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.110871Z","title":"Language Models Are Unsupervised Multitask Learners,","venue":null,"work_id":"31117583-2db1-40e7-9c54-ee3fa9c03353","year":2019},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.178754Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:7266a79d0f2f3cedbaff0dcf2cf2ae9d2238ed3ea7950b54ba5290dddc28dca1","observation_id":"3e0a27f5-c905-4ff7-bf7b-7f44d10c0a7b","resolution":{"observed_at":"2026-08-08T22:30:28.116030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.093971Z","title":"Multi-Scale Sub-Band Constant-Q Transform Discriminator for High-Fidelity V ocoder,","venue":null,"work_id":"e238dc66-3db1-4aa5-ad41-fc91d5a903e4","year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.183079Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:ed5284e1907c11a5eb389cc37fb60bdf6c2e6854113b74a17c57f8779e73a567","observation_id":"1f6270ec-ed66-4316-94af-48eef01aa0de","resolution":{"observed_at":"2026-08-08T22:30:28.099154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.187548Z","title":"WavLM: Large-Scale Self-Supervised Pre- Training for Full Stack Speech Processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.187548Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:ffc7f2632a78dfb606b328d99308fe7370833a0a4c7c302422ad92ed3c63f1ab","observation_id":"f4122fc2-ac26-4c4d-ad20-377b459695d2","resolution":{"observed_at":"2026-08-08T22:30:27.187548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.066503Z","title":"The T05 System for The V oiceMOS Challenge 2024: Transfer Learning from Deep Image Classifier to Naturalness MOS Prediction of High-Quality Synthetic Speech,","venue":null,"work_id":"fe4511d4-787b-4966-aca0-fdf09ec560ec","year":2024},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.192099Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:1a82d139d4bf80b9b43f220b8aac3704104135c92055f030baa506ab0c215e7b","observation_id":"65b9d42d-a89e-4127-83db-e8c489112a3e","resolution":{"observed_at":"2026-08-08T22:30:28.071545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.051056Z","title":"Bias and Statistical Significance in Evaluating Speech Synthesis with Mean Opinion Scores,","venue":null,"work_id":"410b7fa8-a460-477a-b4b3-a987aada9b68","year":2017},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.196870Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:18ab89286cb7092254bbe9f04225deb090eda1c312c263360d2d11ca6109cd38","observation_id":"0908d85b-52f9-4b4e-a5a8-e5168c5ac5d8","resolution":{"observed_at":"2026-08-08T22:30:28.056193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.201566Z","title":"Good Practices for Evaluation of Synthesized Speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.201566Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:7ea23db91a3ecce91dbc637f1408b8ec00bdcba489e03372f8223529440b926b","observation_id":"73d23412-d759-4870-b8a1-8e9756cca0da","resolution":{"observed_at":"2026-08-08T22:30:27.201566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.034069Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification,","venue":null,"work_id":"1d022ca6-52d0-4ddf-93f9-6a3cc3afb2a8","year":2020},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.206324Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:cabade517b306a1a260bbb5c6528c810c315d88821ee7a55f6d32b8b829df636","observation_id":"f2f18524-0dae-410b-90d5-34ab5563589d","resolution":{"observed_at":"2026-08-08T22:30:28.039189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-08T22:30:27.210988Z","title":"Scaling Laws for Neural Language Models,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.210988Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:084226e48add99b9f9400cc58ac13b34b6aea92b29dcbd6e49e4e40fea7c0940","observation_id":"98089578-ca5b-461d-adeb-6d92b72c1c06","resolution":{"observed_at":"2026-08-08T22:30:27.210988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.018895Z","title":"Deep Residual Learning for Image Recognition,","venue":null,"work_id":"8941f9e9-3352-41ba-8c0b-a9ca23d4037c","year":2016},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.215698Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:6b414009a552834a0e17f65180798ba9938d6fe5b29d79ea234f25834f302d3b","observation_id":"7f04a0d9-cb12-4ceb-9e0f-57512511c733","resolution":{"observed_at":"2026-08-08T22:30:28.024116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:28.003562Z","title":"The first two encoder convolutional layers upsample the input dimensionality to the DV AE hidden dimension of 1024","venue":null,"work_id":"477112ba-8cd6-4b23-9ee4-4758ae30bcbb","year":null},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.220159Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:af5e99328d8608e9f7fe5d67a44c1ad283d0d41a46fc773d49373590cb2f27a5","observation_id":"2c692cd9-628e-45a2-97e9-f3fb3be45556","resolution":{"observed_at":"2026-08-08T22:30:28.008877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.988643Z","title":"The learned queries attends to all input frames, transforming them into fixed- length representations","venue":null,"work_id":"7248e20a-7e3c-42cd-870e-339cd6919c9b","year":null},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.225587Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:ec31fe3d4f2667a17382474cc921d59535dfe4f1bcb549fd0aba874c503bc9dd","observation_id":"a61af82e-6815-44e1-b56d-b39355c0d6b8","resolution":{"observed_at":"2026-08-08T22:30:27.993036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.974769Z","title":"1, 1.5, 2, 2.5, 3, 3.5, 4, 4.5 and 5 are allowed on the half-point scale","venue":null,"work_id":"18fc9c08-b0f2-4eea-b0bb-bce316838957","year":null},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.229649Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:040f722b14daedbddcfc1a20ed2b538c5033ced856ad240fe77e89a15b4575ba","observation_id":"b770d178-6fed-4271-937f-a964500f4b1f","resolution":{"observed_at":"2026-08-08T22:30:27.979268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.961418Z","title":null,"venue":null,"work_id":"c051e2f6-e5fb-48b4-b035-2be1493d48a2","year":null},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.234565Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:eb606ff4bd511c05f6fe061abcb7385392baef2a44661f1a0376762b6fd0841e","observation_id":"68f8817e-affe-45a1-81d0-288b84771820","resolution":{"observed_at":"2026-08-08T22:30:27.965523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.947333Z","title":null,"venue":null,"work_id":"c6615275-7de0-4ddb-ad21-5e6e218ad66d","year":null},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.238691Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:b9fa79988c98e6ff5e027bc3a94863eb56885aff0648000cb0dcd5b70daa9942","observation_id":"bcc41a1f-95d0-4356-8017-833399b18f64","resolution":{"observed_at":"2026-08-08T22:30:27.951564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.933117Z","title":null,"venue":null,"work_id":"001eb910-bcbf-4493-8525-7f689c0b9342","year":null},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.243255Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:c17acd50c368b12abe126f6e96dc9a20d7a3764796fad9f32fa9ae8725f54a05","observation_id":"2e924d13-7264-4f1f-a34e-8a8377acfc2b","resolution":{"observed_at":"2026-08-08T22:30:27.937513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.917920Z","title":null,"venue":null,"work_id":"cc6fdea1-45d5-4a3d-9650-bc682f18bba1","year":null},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.248147Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:95f75f55cf40725bbc5253440b476ef7582a8dc3b244c4b6a8f629dd86ca1eb2","observation_id":"9531351d-38d9-4636-9ab3-127abfa78418","resolution":{"observed_at":"2026-08-08T22:30:27.922807Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.902663Z","title":null,"venue":null,"work_id":"a62e36d6-44d1-4549-8190-c366ed735aed","year":null},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.252499Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:7239aef8a2dcd693c40a66df4f6721cc4fb744131a57c0d1ac30be3c777a09dd","observation_id":"d6f96f98-5b1f-4c1d-b957-4431079b99a0","resolution":{"observed_at":"2026-08-08T22:30:27.907383Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.885853Z","title":"Use a scale from 1 (Bad) to 5 (Excellent), with increments of 0.5","venue":null,"work_id":"f1c91e4f-0819-4f87-b540-6d4695eea3ad","year":null},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.256544Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:08b9d91a930f13cdee1877eb901568c733411c3ac8cea8ebd08f1850ecfbb911","observation_id":"0a08ca7b-02ba-4ae9-8f00-e10c947f5196","resolution":{"observed_at":"2026-08-08T22:30:27.891406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.869667Z","title":null,"venue":null,"work_id":"5f5c5869-6317-440f-a488-edd90c8e4bc0","year":null},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.260729Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:3d48f8bd84eca4d8b5068cef196cd26bec4098c9b8e2dde001f47dfb596bc884","observation_id":"c38cca02-6785-4edc-9958-72c691439cb4","resolution":{"observed_at":"2026-08-08T22:30:27.874432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.853792Z","title":"For example, the speakers may differ in gender or pitch (e.g., a high-pitched female voice vs","venue":null,"work_id":"088edcba-2fc5-4ed6-9f5d-7cb507b2393a","year":null},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.265152Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:5761837528dbfddcd310672da77d8e581f41d87370a0b98f7eee0f6cd591d36e","observation_id":"649cbab6-ba49-4ae5-9f27-1b4e48a71dfd","resolution":{"observed_at":"2026-08-08T22:30:27.858754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.835070Z","title":"It’s clear the speakers are the same gender, but their voices are distinctly different, and their speaking styles differ somewhat","venue":null,"work_id":"34b24797-f359-462d-bf1b-0795d23f844c","year":null},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.270024Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:8dc260feea988691533e9c601930638a38226f9e7bab9e5f4980099e2082c676","observation_id":"ec066b31-e376-4c15-a4a1-43c746ce1885","resolution":{"observed_at":"2026-08-08T22:30:27.841437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.819979Z","title":"The speaker voices are close, and the speaking styles largely match","venue":null,"work_id":"2c749e56-d3a4-4704-ba2d-099464983c3d","year":null},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.274365Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:d06c6c2ac926b6d6319a6351021f2a5b2fa910c71fed9c8922fe421073e3e856","observation_id":"ecda95be-b217-4955-b8f7-8c711b69230b","resolution":{"observed_at":"2026-08-08T22:30:27.824860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:30:27.802104Z","title":"The timbre of the speakers is the same, their speaking styles match perfectly, and the environmental background is similar, including any acoustic noise","venue":null,"work_id":"f5cd718f-f3a1-4a19-a413-a8551f8394bf","year":null},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:27.279088Z"},"links":{"citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:d4cc41e12328079a3f1c005e8ca30804120c12283f6c4d95917558b7b5f511c4","observation_id":"98c69fa1-f049-493a-a3cd-c5e23bbccbb9","resolution":{"observed_at":"2026-08-08T22:30:27.809162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":55},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 1 inbound Pith citation observation for arXiv:2502.04519."}