{"as_of":"2026-08-14T00:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb3c5cd033b058e227b6975ed142102ecedd6386eb1f77a5158ef1b824af000a","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:58:58.610208Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:31:12.289334Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16691","snapshot_observed_at":"2026-08-03T00:31:12.289334Z","title":"EZ-VC: Easy zero-shot any-to-any voice conversion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28770","last_updated":"2026-07-30T18:44:22Z","snapshot_observed_at":"2026-08-13T20:14:47.060017Z","submitted_at":"2026-07-30T18:44:22Z","title":"Cloned Voices, Real Consequences: Evaluating Bias in Political Deepfake Detection for Electoral Integrity in Brazil","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T00:31:12.289334Z"},"links":{"cited_paper":"/paper/2505.16691","citing_paper":"/paper/2607.28770"},"observation_digest":"sha256:64ca6e8a7346ee1fa63774a45db88f2f9ba22a29edb3610621498aca4f64c570","observation_id":"ca3a5311-a37c-4fe1-a337-b0f3b844df9c","resolution":{"observed_at":"2026-08-03T00:31:12.289334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16691/citation-record","integrity":"/paper/2505.16691/integrity","json":"/paper/2505.16691/citation-record.json","paper":"/paper/2505.16691"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.02418","last_updated":"2023-04-30T17:46:06Z","snapshot_observed_at":"2026-08-13T17:21:59.945902Z","submitted_at":"2021-12-04T19:50:29Z","title":"YourTTS: Towards Zero-Shot Multi-Speaker TTS and Zero-Shot Voice Conversion for everyone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.02418","snapshot_observed_at":"2026-08-07T14:58:56.253851Z","title":"Preprint, arXiv:2112.02418","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:56.253851Z"},"links":{"cited_paper":"/paper/2112.02418","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:86a3013ab88106d3b1b6bdec78fadd163402710541911dd3339bbd68df5f77c9","observation_id":"d0f6a7af-550c-4223-a65f-d92468978971","resolution":{"observed_at":"2026-08-07T14:58:56.253851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00837","last_updated":"2024-07-02T17:23:44Z","snapshot_observed_at":"2026-08-12T23:31:45.921591Z","submitted_at":"2024-06-30T21:40:26Z","title":"Towards Robust Speech Representation Learning for Thousands of Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00837","snapshot_observed_at":"2026-08-07T14:58:56.363483Z","title":"IEEE Journal of Se- lected Topics in Signal Processing, 16(6):1505–1518","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:56.363483Z"},"links":{"cited_paper":"/paper/2407.00837","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:e0d5247d291056687f793889421ee4166b151fb289338f70f2331b67317dce22","observation_id":"bf85f6d3-9313-4d5c-9dff-88dffc891119","resolution":{"observed_at":"2026-08-07T14:58:56.363483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04693","last_updated":"2023-11-08T14:02:53Z","snapshot_observed_at":"2026-08-13T08:30:31.885826Z","submitted_at":"2023-11-08T14:02:53Z","title":"Diff-HierVC: Diffusion-based Hierarchical Voice Conversion with Robust Pitch Generation and Masked Prior for Zero-shot Speaker Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04693","snapshot_observed_at":"2026-08-07T14:58:56.506395Z","title":"Preprint, arXiv:2311.04693","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:56.506395Z"},"links":{"cited_paper":"/paper/2311.04693","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:81b78762c913744ad99034082d31ff76f4b5ab283ebf8ddb163a1d74abacb9bc","observation_id":"13a8820e-17dd-4d1a-95bf-a9e3cef8c4c1","resolution":{"observed_at":"2026-08-07T14:58:56.506395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-08-13T10:29:31.823796Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-07T14:58:56.651626Z","title":"Preprint, arXiv:2308.11596","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:56.651626Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:3e65594914142b16bf1afe8cb5744c575ea4d76091a94e63f2c4ea2eccabb851","observation_id":"1adbc139-7c13-48a6-839f-2e209a6be972","resolution":{"observed_at":"2026-08-07T14:58:56.651626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-13T13:28:56.694752Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-07T14:58:56.747744Z","title":"arXiv preprint arXiv:2005.07143","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:56.747744Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:b91ed49dd882f757b01f4df35312c30d9ca82b54242b58e1c683050d2cc7653b","observation_id":"5ad2fdbb-073f-4f29-a04d-568c9628d2a4","resolution":{"observed_at":"2026-08-07T14:58:56.747744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-08-13T15:27:09.693765Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-07T14:58:57.060521Z","title":"Preprint, arXiv:2206.04658","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.060521Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:0e46daab706f8283482073baaecadd35695be2f31d35ac145121911c536ccf89","observation_id":"e23d19c3-e4d0-4c5b-9b03-a0f3341ab500","resolution":{"observed_at":"2026-08-07T14:58:57.060521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-13T17:07:37.405203Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-07T14:58:57.464868Z","title":"Preprint, arXiv:2306.15687","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.464868Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:14c58b8c54ea6bb4b0c024214b61c3dd98f1819d83c4b24ad4b3e1a34b7939e1","observation_id":"228b822e-6e8d-4a88-ad92-ce19c9c4def3","resolution":{"observed_at":"2026-08-07T14:58:57.464868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08676","last_updated":"2024-01-30T14:11:29Z","snapshot_observed_at":"2026-08-13T21:20:15.089172Z","submitted_at":"2023-12-14T06:26:55Z","title":"SEF-VC: Speaker Embedding Free Zero-Shot Voice Conversion with Cross Attention","version":2},"cited_work":{"arxiv_id":"2312.08676","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.08676","snapshot_observed_at":"2026-08-07T14:58:58.996725Z","title":"SEF-VC: Speaker Embedding Free Zero-Shot Voice Conversion with Cross Attention","venue":"cs.SD","work_id":"0fe684a8-aaf3-4707-939f-daddce5a85b2","year":2023},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.566166Z"},"links":{"cited_paper":"/paper/2312.08676","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:9dd7ce91bd17d92a2b77c8f789ddea86e6207e503df7cf776b13327c195f5c63","observation_id":"1c534e74-3d06-4aae-92a9-1ff10d953b22","resolution":{"observed_at":"2026-08-07T14:58:59.160738Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09943","last_updated":"2024-11-15T04:43:44Z","snapshot_observed_at":"2026-08-13T06:34:37.505459Z","submitted_at":"2024-11-15T04:43:44Z","title":"Zero-shot Voice Conversion with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09943","snapshot_observed_at":"2026-08-07T14:58:57.726231Z","title":"Preprint, arXiv:2411.09943","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.726231Z"},"links":{"cited_paper":"/paper/2411.09943","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:16055d61bfaf84731ce1df200ab0492e9de67192d7fad62704dcee24d131878c","observation_id":"0b9c0f93-9ca5-4759-9b6e-400d1b5d827d","resolution":{"observed_at":"2026-08-07T14:58:57.726231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:58:59.909131Z","title":"In ICASSP 2024-2024 IEEE Inter- national Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 13326–13330","venue":null,"work_id":"9cb04453-c60f-4030-b6cb-bde40947acd9","year":2024},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.886020Z"},"links":{"citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:1e59a2ac196158224ab563f4510d0ec1e6b27ecde4fa34bc64536c6e7ee59ea8","observation_id":"b0bae56f-0cdf-4a18-b815-56dfb596753d","resolution":{"observed_at":"2026-08-07T14:59:00.048756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13821","last_updated":"2022-08-04T10:25:40Z","snapshot_observed_at":"2026-08-10T09:42:49.853165Z","submitted_at":"2021-09-28T15:48:22Z","title":"Diffusion-Based Voice Conversion with Fast Maximum Likelihood Sampling Scheme","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13821","snapshot_observed_at":"2026-08-07T14:58:57.976936Z","title":"Preprint, arXiv:2109.13821","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.976936Z"},"links":{"cited_paper":"/paper/2109.13821","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:8b7d0676b2c84f2e0b8867142173ff692b46851065de7ee049c0a37d5fe196fb","observation_id":"47aa4c1a-aabe-44ef-9e16-7d104fc9573b","resolution":{"observed_at":"2026-08-07T14:58:57.976936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-13T16:08:20.566487Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-07T14:58:58.106744Z","title":"Changhan Wang, Morgane Rivière, Ann Lee, Anne Wu, Chaitanya Talnikar, Daniel Haziza, Mary Williamson, Juan Pino, and Emmanuel Dupoux","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:58.106744Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:003b3857707c93bf5d2cfc7711caaa7c845900d151955b34ea5f1b7d0056a080","observation_id":"e4d833d4-08ac-4fa7-8743-bdc62c644824","resolution":{"observed_at":"2026-08-07T14:58:58.106744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-09T19:09:23.880235Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-07T14:58:58.237399Z","title":"Preprint, arXiv:2101.00390","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:58.237399Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:8f5f87ed4efe05decd4643820423e40640cd8c6c50198746baf974ff6e3d0c78","observation_id":"ee506292-b81c-45b4-8312-f35493fea5df","resolution":{"observed_at":"2026-08-07T14:58:58.237399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04724","last_updated":"2024-12-10T05:52:28Z","snapshot_observed_at":"2026-08-11T21:16:54.403783Z","submitted_at":"2024-12-06T02:31:23Z","title":"StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04724","snapshot_observed_at":"2026-08-07T14:58:58.358652Z","title":"Preprint, arXiv:2412.04724","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:58.358652Z"},"links":{"cited_paper":"/paper/2412.04724","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:a19f39d1a762367b2ef560381eb68ede50d21c600bb7eb322cf2f65ceb106877","observation_id":"493a615c-a7b9-4057-bea5-f2569222ea15","resolution":{"observed_at":"2026-08-07T14:58:58.358652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-12T13:42:40.937264Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05471","snapshot_observed_at":"2026-08-07T14:58:58.610208Z","title":"Preprint, arXiv:2502.05471","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:58.610208Z"},"links":{"cited_paper":"/paper/2502.05471","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:3c68d7c7462088de72ae6f7ff6a9bfbed0abf64a16af723e5425ba94d55709bf","observation_id":"74f6896e-0381-4b69-8a07-941b1548c3bc","resolution":{"observed_at":"2026-08-07T14:58:58.610208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-10T09:39:47.608323Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-07T14:58:58.472965Z","title":"Preprint, arXiv:1904.02882","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:58.472965Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:0359c39ab5de11664e247186c1a01807c11426945f49db95cbae2ac29cbee660","observation_id":"495d6f42-2df5-42fd-a52b-50529f4c5772","resolution":{"observed_at":"2026-08-07T14:58:58.472965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T14:58:55.919987Z","title":"Preprint, arXiv:1912.06670","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:55.919987Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:728ed43964b0105d180aeb2b9365dc86bba1ef2bc0969689720369c26ba0c3bb","observation_id":"49016cc0-d922-442c-819a-db771d2bb707","resolution":{"observed_at":"2026-08-07T14:58:55.919987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07447","last_updated":"2021-06-14T14:14:28Z","snapshot_observed_at":"2026-08-08T09:38:45.288574Z","submitted_at":"2021-06-14T14:14:28Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07447","snapshot_observed_at":"2026-08-07T14:58:57.191969Z","title":"Preprint, arXiv:2106.07447","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.191969Z"},"links":{"cited_paper":"/paper/2106.07447","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:1b76511f2819f1908d56716708bbaa0c267177d31a82171d9c6266a728b6b484","observation_id":"3efc365d-704a-4714-8d27-54e70b726133","resolution":{"observed_at":"2026-08-07T14:58:57.191969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.12666","last_updated":"2022-08-26T13:37:45Z","snapshot_observed_at":"2026-08-13T14:38:26.703765Z","submitted_at":"2022-08-26T13:37:45Z","title":"Effectiveness of Mining Audio and Text Pairs from Public Data for Improving ASR Systems for Low-Resource Languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.12666","snapshot_observed_at":"2026-08-07T14:58:56.149069Z","title":"Preprint, arXiv:2208.12666","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:56.149069Z"},"links":{"cited_paper":"/paper/2208.12666","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:425e2aa6e7de8842c3e0c0a7893f49f9f996ced8979282c71b5e9461bba5d670","observation_id":"8ffef98b-e581-4b4d-b210-3f777faee46b","resolution":{"observed_at":"2026-08-07T14:58:56.149069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18975","last_updated":"2023-05-30T12:19:07Z","snapshot_observed_at":"2026-08-13T11:29:32.390064Z","submitted_at":"2023-05-30T12:19:07Z","title":"Voice Conversion With Just Nearest Neighbors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18975","snapshot_observed_at":"2026-08-07T14:58:56.015567Z","title":"Preprint, arXiv:2305.18975","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:56.015567Z"},"links":{"cited_paper":"/paper/2305.18975","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:de73d78d9c99eb0db1102772bc5f793e84634acb98af2cb1ed285cc403776c8d","observation_id":"ba9d2b6d-03b8-49d0-ad90-c6c82a1dff5c","resolution":{"observed_at":"2026-08-07T14:58:56.015567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18009","last_updated":"2024-09-12T17:45:37Z","snapshot_observed_at":"2026-08-12T23:34:52.090775Z","submitted_at":"2024-06-26T01:38:37Z","title":"E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18009","snapshot_observed_at":"2026-08-07T14:58:56.891964Z","title":"Preprint, arXiv:2406.18009","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:56.891964Z"},"links":{"cited_paper":"/paper/2406.18009","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:413bcd32e19a3467b13454185d88a2b4181ce5339b7ebe03c1ce7bbd079e31e4","observation_id":"56111811-5b5e-4c57-af0d-eb834e641a8d","resolution":{"observed_at":"2026-08-07T14:58:56.891964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"cited_work":{"arxiv_id":"2501.01347","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.01347","snapshot_observed_at":"2026-08-07T14:58:59.365883Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","venue":"cs.SD","work_id":"8cf20ece-cad0-43e4-a364-1fc9c1dac78f","year":2025},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.316479Z"},"links":{"cited_paper":"/paper/2501.01347","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:1cec1a742b214ff62c50a5ccb82374d252ad7fd197e6465843912b24e36ae99a","observation_id":"27f11978-8d2c-4b53-bb74-d756d3c3387b","resolution":{"observed_at":"2026-08-07T14:58:59.436990Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 1 inbound Pith citation observation for arXiv:2505.16691."}