{"as_of":"2026-08-08T22:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7411eab5a52cc653508fd5785936fe4dccc6f8432c42a615a7093fe0fe46ef23","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:56:27.059279Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.01039/citation-record","integrity":"/paper/2506.01039/integrity","json":"/paper/2506.01039/citation-record.json","paper":"/paper/2506.01039"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:24.465301Z","title":"Dddm-vc: Decoupled denoising diffusion models with disentangled representation and prior mixup for verified robust voice conversion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.465301Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:212206d2dddd3d9097f35bd57172693eaea84c915ea9d40acaaabf6e13a9cde2","observation_id":"ec237109-970f-47f6-b7dd-e23055e5d808","resolution":{"observed_at":"2026-08-07T11:56:24.465301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:24.555184Z","title":"Freevc: Towards high-quality text-free one-shot voice conversion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.555184Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:f9736cc23216481516e9224259d43c737ac002a5e4521df0b5f81ea62e8d8b24","observation_id":"aa799c4c-0577-429c-b2e1-c1f83bcb40d4","resolution":{"observed_at":"2026-08-07T11:56:24.555184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:29.143175Z","title":"Phoneme hallucinator: One-shot voice conversion via set expansion,","venue":null,"work_id":"2f4b140a-5f00-4df8-acbb-c29339819a8f","year":2024},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.694732Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:5a09b69936304d0cceddc299c8f57f87c22995580bb685810a6f36c08fb75fd9","observation_id":"2cf0268e-ad31-4557-aaf9-845817045e3f","resolution":{"observed_at":"2026-08-07T11:56:29.188342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18975","last_updated":"2023-05-30T12:19:07Z","snapshot_observed_at":"2026-07-06T15:35:22.185803Z","submitted_at":"2023-05-30T12:19:07Z","title":"Voice Conversion With Just Nearest Neighbors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18975","snapshot_observed_at":"2026-08-07T11:56:24.801370Z","title":"V oice conversion with just nearest neighbors,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.801370Z"},"links":{"cited_paper":"/paper/2305.18975","citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:d7b65d0726b7d0193a45045a36103dca8fa100e4a25209dee523110974668280","observation_id":"21ed0170-26d5-4d1e-99ae-844419eef796","resolution":{"observed_at":"2026-08-07T11:56:24.801370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:24.880991Z","title":"Yourtts: Towards zero-shot multi-speaker tts and zero-shot voice conversion for everyone,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.880991Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:374245c7a91b48fa3a23cd47bb6148b3b6d0d523f7e33f679403bc01a1080abd","observation_id":"a841bcd7-b621-497f-bb70-fedf9f440417","resolution":{"observed_at":"2026-08-07T11:56:24.880991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.998061Z","title":"Gr0: Self-supervised global representation learning for zero-shot voice conversion,","venue":null,"work_id":"2e56dd68-098b-4928-b404-6d7b6de609c8","year":2024},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:24.953021Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:1240f058c8fc0dbc2d5cc025d68130fd8d8e7767dcb37e882f7d3940865cb900","observation_id":"6c9caed6-2b3e-4319-a1ad-1ae03efe49d1","resolution":{"observed_at":"2026-08-07T11:56:29.045835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.11293","last_updated":"2017-12-20T14:27:33Z","snapshot_observed_at":"2026-07-06T06:12:00.680441Z","submitted_at":"2017-11-30T09:57:19Z","title":"Parallel-Data-Free Voice Conversion Using Cycle-Consistent Adversarial Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.11293","snapshot_observed_at":"2026-08-07T11:56:25.030407Z","title":"Parallel-data-free voice conver- sion using cycle-consistent adversarial networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.030407Z"},"links":{"cited_paper":"/paper/1711.11293","citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:aa731994dfd4648a7c988942966736175b95886d5cd1bcb6b73c66f522686ac3","observation_id":"e618572b-d283-4f48-b92b-599cf5aeef00","resolution":{"observed_at":"2026-08-07T11:56:25.030407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.863182Z","title":"Average modeling approach to voice conversion with non-parallel data","venue":null,"work_id":"53f5ee03-adf7-48ab-8037-4116c433fb87","year":2018},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.106397Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:99f3acec6d5a71d5678d421fe8d4c5adbcb22cbd5d4dd2b48ae5565c60a05890","observation_id":"bb01ac4e-1e61-4f83-b227-f6c69dc99d1c","resolution":{"observed_at":"2026-08-07T11:56:28.923320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.04262","last_updated":"2018-04-12T00:14:10Z","snapshot_observed_at":"2026-07-06T06:33:01.922458Z","submitted_at":"2018-04-12T00:14:10Z","title":"The Voice Conversion Challenge 2018: Promoting Development of Parallel and Nonparallel Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.04262","snapshot_observed_at":"2026-08-07T11:56:25.228067Z","title":"The voice conversion challenge 2018: Promoting development of parallel and nonparallel methods,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.228067Z"},"links":{"cited_paper":"/paper/1804.04262","citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:a87e4f317a98f2b0fd1ffb660053b52338a571a5b2946ee379807bb3e4eaeb08","observation_id":"a74ab71f-29cb-4ccd-be8e-e7bead416de7","resolution":{"observed_at":"2026-08-07T11:56:25.228067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:25.301193Z","title":"Unsupervised speech decomposition via triple information bottleneck,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.301193Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:04785d7e67aa7e873776cd1eea258ecdd4ccf83fb7ca55401d8dd045e1c2a37a","observation_id":"9fa78162-ec8f-4773-aadc-9d3c006be38f","resolution":{"observed_at":"2026-08-07T11:56:25.301193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:25.377373Z","title":"Speech- split2. 0: Unsupervised speech disentanglement for voice conversion without tuning autoencoder bottlenecks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.377373Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:ff4b90dfce0d95dec963b4e1187118962aff0c49d0412d76115c055d8d39476b","observation_id":"97e3dbdf-0d66-4d08-8000-2dc26cc546ef","resolution":{"observed_at":"2026-08-07T11:56:25.377373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.710567Z","title":"Neural analysis and synthesis: Reconstructing speech from self-supervised representations,","venue":null,"work_id":"94f9a16f-7123-4400-8e92-51a45486f813","year":2021},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.467236Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:dca4e32ed55762af3b1b4b047a4cfd03612760573a48cc5462561ef303b8f0bc","observation_id":"a5368fe6-2c6d-4ebf-b3b4-33d07480cc49","resolution":{"observed_at":"2026-08-07T11:56:28.751386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:25.566949Z","title":"Scheduled sampling for sequence prediction with recurrent neural networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.566949Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:b65abaedbf91692164eab2db94aa8115cbdf3b4a7547818ed7c7a32ca7252338","observation_id":"df2a8189-7adf-417e-b903-49b0e5261b38","resolution":{"observed_at":"2026-08-07T11:56:25.566949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.542363Z","title":"V ocal tract length perturbation (vtlp) improves speech recognition,","venue":null,"work_id":"e94ae333-09c4-4461-8fb6-226a9da90f84","year":2013},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.652713Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:1c4e0df53acc98e40be005d40ceadef7f2288599e41614e5a55ff66e87ea66c6","observation_id":"c9f1e1dc-efae-458e-9cf7-1d534460606f","resolution":{"observed_at":"2026-08-07T11:56:28.625637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:25.744123Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.744123Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:7d726e09223231f4faafb9c20f7a9e7bccdac8ca5295ad019de6bc1789659d77","observation_id":"b002e381-9818-43ce-b6d0-d9d18d099d60","resolution":{"observed_at":"2026-08-07T11:56:25.744123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:25.836802Z","title":"Variational inference with normalizing flows,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.836802Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:eb3a37c6ae6551a35da29c492393711680f9431f223721ee249b59f2481602c4","observation_id":"62a9ee90-5550-4369-9c00-725b8d1d1534","resolution":{"observed_at":"2026-08-07T11:56:25.836802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.374462Z","title":"Any-to-many voice conversion with location-relative sequence-to-sequence modeling,","venue":null,"work_id":"5f201268-7401-4424-b97c-3d706ef2f620","year":2021},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.901957Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:46915216eb6e15d8146601bc9f5b8618eae15d67aab5634f0e63dfd331cbbb84","observation_id":"51ee43f1-27b0-473e-a4d8-c6a8dd2f530b","resolution":{"observed_at":"2026-08-07T11:56:28.437664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.208556Z","title":"Waveglow: A flow-based generative network for speech synthesis,","venue":null,"work_id":"c3ee1fbe-07e5-4ebc-b7e9-07b1c658b65f","year":2019},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:25.978705Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:9272d956b06ad1371f2181ef5e693bfaf0924938c75395434d56a2c4773672fb","observation_id":"82763542-df3f-45d8-9c7f-415dd85f4828","resolution":{"observed_at":"2026-08-07T11:56:28.271208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:26.046923Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.046923Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:95b09bb40b300b0ef96785844aaa8964b30bedb58192278cf13875be119a26a0","observation_id":"018c4897-5729-4d45-9073-8c49d6e41fa2","resolution":{"observed_at":"2026-08-07T11:56:26.046923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:28.003456Z","title":"Least squares generative adversarial networks,","venue":null,"work_id":"b8d2a5c8-924c-4e5f-8e15-c79fcd4e1d3c","year":2017},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.123139Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:e0504359bd3f6dbbf8f37fa14b1e30841050d787ea00edae2fd85958c738ce3a","observation_id":"42de39c4-66c9-45cd-84c8-42a95ff22337","resolution":{"observed_at":"2026-08-07T11:56:28.096705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:27.878602Z","title":"Autoencoding beyond pixels using a learned similarity metric,","venue":null,"work_id":"e9a1179a-d50a-47f0-8a53-d95ad1fa9e07","year":2016},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.218072Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:c036229ca72d3684a509cbd16843af14e0556d6bab154d272e102e4fba09f6ee","observation_id":"de7abcd3-82cd-4cfc-afd7-1e13eafb2ca4","resolution":{"observed_at":"2026-08-07T11:56:27.925838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:26.312898Z","title":"Fixmatch: Simplifying semi- supervised learning with consistency and confidence,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.312898Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:9edfe441838827e1a07e5814a427225362d58681c0f9f761c818bc1a9d919486","observation_id":"fd45b1a7-e236-41df-b5c3-1a57c3102ecc","resolution":{"observed_at":"2026-08-07T11:56:26.312898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08189","last_updated":"2022-06-27T09:30:43Z","snapshot_observed_at":"2026-08-06T05:48:12.927254Z","submitted_at":"2022-06-16T14:02:20Z","title":"Censer: Curriculum Semi-supervised Learning for Speech Recognition Based on Self-supervised Pre-training","version":2},"cited_work":{"arxiv_id":"2206.08189","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.08189","snapshot_observed_at":"2026-08-07T11:56:27.219662Z","title":"Censer: Curriculum Semi-supervised Learning for Speech Recognition Based on Self-supervised Pre-training","venue":"cs.SD","work_id":"3bb781a0-1500-416a-b1c9-b2d64fb262e5","year":2022},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.384058Z"},"links":{"cited_paper":"/paper/2206.08189","citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:f6c655749cb813024a0a093049d77b154bc9a4119a083b6b7ab1c64b06690592","observation_id":"309723d9-36fc-4ac3-a246-1c2e29ef50bf","resolution":{"observed_at":"2026-08-07T11:56:27.291844Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:27.695536Z","title":"Pseudo-labeling and confirmation bias in deep semi-supervised learn- ing,","venue":null,"work_id":"d0781fd0-ed01-4d68-bda0-45a3a8fdb584","year":2020},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.464619Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:c3e921a561c69f2bf5bfe321b7f506aa679b53958ccddda8dd8acf2e0c4aaab8","observation_id":"554fc953-cfb4-4876-b665-384c0db07d8f","resolution":{"observed_at":"2026-08-07T11:56:27.765446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:27.569954Z","title":"Cstr vctk corpus: English multi-speaker corpus for cstr voice cloning toolkit,","venue":null,"work_id":"0031d4ba-e23e-4482-90e8-7e9d803dc286","year":2017},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.558249Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:c621e5454053023284bfcd351fc7dae93efb6ab15447ccc016bce5d8b90747e6","observation_id":"76ba54b3-3367-45a6-a649-d74185514532","resolution":{"observed_at":"2026-08-07T11:56:27.625854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-07T11:56:26.654340Z","title":"Libritts: A corpus derived from librispeech for text-to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.654340Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:0439b4706ec513f68466e96d0484df914908331737b528c6e3fe21f0d74b6c68","observation_id":"46b180ff-2452-4051-9bfd-b5c6ee81e47e","resolution":{"observed_at":"2026-08-07T11:56:26.654340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09911","last_updated":"2024-09-16T11:35:38Z","snapshot_observed_at":"2026-08-02T06:29:19.825166Z","submitted_at":"2023-12-15T16:23:21Z","title":"Amphion: An Open-Source Audio, Music and Speech Generation Toolkit","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09911","snapshot_observed_at":"2026-08-07T11:56:26.750676Z","title":"Amphion: An open-source audio, music and speech generation toolkit,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.750676Z"},"links":{"cited_paper":"/paper/2312.09911","citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:d78179c52a9b8cf69218e144a8f002410d288383bb656c62d3e7fda69fe76fc8","observation_id":"8cc886d8-07ab-4b03-b08c-7f4964580c39","resolution":{"observed_at":"2026-08-07T11:56:26.750676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:26.847623Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.847623Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:72bf4db352b1c37772d52da1275ba8e4074916ac348b8eff9e84a8c312a9c06b","observation_id":"a0fad8fe-4b1f-4c91-9637-8faa99945396","resolution":{"observed_at":"2026-08-07T11:56:26.847623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:27.434364Z","title":"Generalized end-to-end loss for speaker verification,","venue":null,"work_id":"c919b9e8-e35b-447c-a037-c4931fc411cf","year":2018},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:26.968831Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:3f191172bbaaba82fa6d2ae7038d6017c8ffaa623388c6ea52462c5222151dc4","observation_id":"482ae3e6-2175-434e-9ced-f39c711f6f46","resolution":{"observed_at":"2026-08-07T11:56:27.486257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:56:27.059279Z","title":"Visualizing data using t-sne","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:27.059279Z"},"links":{"citing_paper":"/paper/2506.01039"},"observation_digest":"sha256:6623b9af66d12050ba34101899bd1e3d2f30766ffb557a2edc75cf8a3038bc4f","observation_id":"fa5ba85e-aa72-48dd-a113-b57147d68185","resolution":{"observed_at":"2026-08-07T11:56:27.059279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01039","last_updated":"2025-06-01T14:46:26Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T11:50:07.241680Z","submitted_at":"2025-06-01T14:46:26Z","title":"PseudoVC: Improving One-shot Voice Conversion with Pseudo Paired Data"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2506.01039."}