{"as_of":"2026-08-15T02:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:35bca7c927836d3ab10f5f1480051985d28de7bfe4b8f502f1984b96ead84849","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:32:08.660181Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:58:57.316479Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:58:59.365883Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"cited_work":{"arxiv_id":"2501.01347","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.01347","snapshot_observed_at":"2026-08-07T14:58:59.365883Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","venue":"cs.SD","work_id":"8cf20ece-cad0-43e4-a364-1fc9c1dac78f","year":2025},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.316479Z"},"links":{"cited_paper":"/paper/2501.01347","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:b83f33da84181597550e13ddf8c9a9ddf1def798bdfd0586f338c307c488a317","observation_id":"27f11978-8d2c-4b53-bb74-d756d3c3387b","resolution":{"observed_at":"2026-08-07T14:58:59.436990Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.01347/citation-record","integrity":"/paper/2501.01347/integrity","json":"/paper/2501.01347/citation-record.json","paper":"/paper/2501.01347"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:09.073135Z","title":"YourTTS: Towards Zero-Shot Multi-Speaker TTS and Zero-Shot V oice Conversion for Everyone,","venue":null,"work_id":"eb05d51d-69b9-432d-9878-36acd0e86d93","year":2022},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.539695Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:549fd711ad5a63feb5e2a0bba830bccf82f04b02587cd894fe20a91584dfa8c1","observation_id":"11e42ab7-8975-4600-828b-2c1cc1443d8d","resolution":{"observed_at":"2026-08-10T22:32:09.076780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:09.062389Z","title":"V oiceMixer: Adver- sarial V oice Style Mixup,","venue":null,"work_id":"67564c40-e8e5-4522-b30f-e188121bc5db","year":2021},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.544182Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:6615a9a81814f7e6e8db84d600109f24e1d3db1c7e4d16b214cf34155cd40fd7","observation_id":"f41780ba-810c-4ad0-99cc-25131e7210bd","resolution":{"observed_at":"2026-08-10T22:32:09.066407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:09.050690Z","title":"Disentangled Speech Representation Learning for One-Shot Cross-Lingual V oice Con- version Using ß-V AE,","venue":null,"work_id":"0adfcce7-6a87-44a6-b823-b946c0c52871","year":null},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.548572Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:2d1a68723ce0b89c425687894a166f510790f9e270f36c86e4c026a55962ea9c","observation_id":"3336ab0f-d308-4a79-8242-a397dfc59bf6","resolution":{"observed_at":"2026-08-10T22:32:09.055261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:09.032359Z","title":"AutoVC: Zero-Shot V oice Style Transfer with Only Autoencoder Loss,","venue":null,"work_id":"db05430d-10a3-4de6-88e3-06a976c08042","year":2019},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.552734Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:7d4dc587c7ee4727af0ad9ad4184f45363b46ff6e939ab341fa909d333202e9c","observation_id":"f4b02921-3778-4621-b8d7-e14f9e169a54","resolution":{"observed_at":"2026-08-10T22:32:09.036329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:09.020845Z","title":"F0- Consistent Many-To-Many Non-Parallel V oice Conversion Via Condi- tional Autoencoder,","venue":null,"work_id":"ec2c6fda-1d32-44b3-85f3-1cab4d177b65","year":2020},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.556784Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:781f510516cb22cf7f32b064aa710668fe2a4bad74b5a9eabc94f5c5db56915c","observation_id":"6955bc28-b3a3-4cd5-9449-ad7cd8f3fb16","resolution":{"observed_at":"2026-08-10T22:32:09.024871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:09.008513Z","title":"Diffusion-Based V oice Conversion with Fast Maximum Likelihood Sampling Scheme,","venue":null,"work_id":"207c4dab-1fd1-47eb-9c50-9b4a32a5f5be","year":2022},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.560704Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:e550834133fc1a548bf68a0d384a64c1a162478b6c9a034918fab1fa18fe568c","observation_id":"c3599bad-5dd3-4634-a707-d47dd1c9a956","resolution":{"observed_at":"2026-08-10T22:32:09.012250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.996975Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units,","venue":null,"work_id":"82291d83-563b-4659-a39f-01c0c791cbdc","year":2021},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.564650Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:e7d7eb803eb114a818b1675a47227cdbcad541e192712a500a1d85c3e6e026b9","observation_id":"449f9003-e370-413b-b811-8c905c9f3776","resolution":{"observed_at":"2026-08-10T22:32:09.000834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.986358Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations,","venue":null,"work_id":"2b6c0147-18dc-4bb8-9b69-631c739b2a9d","year":2020},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.568495Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:fde7b98e8b9bdad412b57e17ed3ebb52cfbcac52da0e0a8545647c231e89bacc","observation_id":"a45c91ad-42ae-4fc8-8897-8210ccfadbc2","resolution":{"observed_at":"2026-08-10T22:32:08.990139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.974966Z","title":"WavLM: Large-Scale Self-Supervised Pre- Training for Full Stack Speech Processing,","venue":null,"work_id":"9a2013cd-2d21-4e2c-9e72-ad88bfb102e8","year":2022},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.572058Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:30ed795b517a9cf57e3b8d01df64ca1b29397d592d2980b3bb5b1594b53d515e","observation_id":"d369cb48-7d98-40fb-9e40-a3d088f116c3","resolution":{"observed_at":"2026-08-10T22:32:08.978929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.961542Z","title":"XLS-R: Self-Supervised Cross-Lingual Speech Representation Learning at Scale,","venue":null,"work_id":"432f8532-83af-4517-863b-def4febf7881","year":2021},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.575602Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:eed1855789dc0f78609cc2a9ef623a0586e05ad82b77765380ffb76543de36aa","observation_id":"81c8c8a1-5adb-4bce-9cd0-2423803c682c","resolution":{"observed_at":"2026-08-10T22:32:08.966036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.949775Z","title":"Neural Analysis and Synthesis: Reconstructing Speech from Self-Supervised Representations,","venue":null,"work_id":"0b7e3e6e-635f-4489-a390-17ae18f6f23f","year":2021},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.579282Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:55c5ff3b3f76541254f16061b3b493be1f80c685206544cb2aa738d89bcc3734","observation_id":"b79fcec7-1d32-436c-88b3-4f86e80c55e3","resolution":{"observed_at":"2026-08-10T22:32:08.954165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.936743Z","title":"DDDM-VC: Decoupled De- noising Diffusion Models with Disentangled Representation and Prior Mixup for Verified Robust V oice Conversion,","venue":null,"work_id":"b8de6f07-bc7a-487e-90d3-ca06ffff7cb2","year":2024},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.582787Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:4da46caa2bda4d2eedbf9d40f317d2bc276e9b2a69fdd4e66fd85bc99cb06fd8","observation_id":"a5373a40-8034-44b5-a693-1dccec89c382","resolution":{"observed_at":"2026-08-10T22:32:08.941707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.923516Z","title":"V oice Conversion With Just Nearest Neighbors,","venue":null,"work_id":"3c8b7062-ac69-4ea5-b46f-88e166f5a8c2","year":2023},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.587162Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:81d59a5399737d2de8b13b5cda12f3eae60211d564b62c7243fe8a2dca19ac2d","observation_id":"f1c389cc-9598-40ed-8d82-f2eebb7e643e","resolution":{"observed_at":"2026-08-10T22:32:08.928498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.911084Z","title":"Parameter-Efficient Transfer Learning for NLP,","venue":null,"work_id":"8070cbed-dc44-46f8-894d-60cb3d8cdfd7","year":2019},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.590380Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:85fe534af18664431ccf7ac4056fde3473587302ceb8b09c4acbc84b0fa7e577","observation_id":"e81b3056-a667-4b89-aee9-dbb35a4876bc","resolution":{"observed_at":"2026-08-10T22:32:08.915447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.899795Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":"1fc1b2c5-e208-4cde-ad12-36cf2a93597a","year":2022},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.593640Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:961b78bf2e134608a7d4b8eac39a069899b02ff855aa9c5c949c2ccf215271ca","observation_id":"2c0ce393-0131-45f4-87fb-4ae98468ab89","resolution":{"observed_at":"2026-08-10T22:32:08.903734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.888573Z","title":"AdapterHub: A framework for adapting transformers,","venue":null,"work_id":"23c80343-ddec-4290-9eb1-3352f1d02e29","year":2020},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.597545Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:352d73eb6b5b5c5b22b8bc3ec928e5656c0e614eeb3fce007e298a41997d2d3a","observation_id":"383b5d74-ffce-405b-ab99-90dec5741aa9","resolution":{"observed_at":"2026-08-10T22:32:08.892548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.877327Z","title":"Flow Matching for Generative Modeling,","venue":null,"work_id":"75e30db0-835e-46de-8dda-44c42e100f22","year":2023},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.601093Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:cd72383113016f176cf8a0584a3216a06caf6f5e0341aede2d2635a2ec213c3e","observation_id":"b55923be-f1b6-4401-acf2-87b61680c04a","resolution":{"observed_at":"2026-08-10T22:32:08.881359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.866216Z","title":"Vector-Quantized Image Modeling with Improved VQGAN,","venue":null,"work_id":"8e99db13-7958-46ff-8349-9824f90fb385","year":2022},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.604565Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:40ff22dc8fe9dd37f7a777c6df0b26390b64b4c23806c3d21d628137e49ad3b0","observation_id":"fd88f2f3-1540-40e8-bfea-99ae34423a63","resolution":{"observed_at":"2026-08-10T22:32:08.870239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.854893Z","title":"Neural discrete representation learning,","venue":null,"work_id":"5b172705-ab46-48e3-856e-e64a852418e2","year":2017},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.607999Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:ad6eafc4aa67d359c485af74eeab0adf174a8515d6288f7f5ba4bb4307541c64","observation_id":"20e8c294-2567-450f-b992-139104296180","resolution":{"observed_at":"2026-08-10T22:32:08.858934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.843802Z","title":"NANSY++: Unified V oice Synthesis with Neural Analysis and Synthesis,","venue":null,"work_id":"a0ba4d22-bc7f-4b57-9ceb-92bce2e4d64b","year":2023},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.611593Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:57b850e42c696a6d53f189c8e4ca6d69da554f2a123abc7e2cd7d09d302d95f3","observation_id":"788981d7-f485-4784-9f91-3dcc0b3e0082","resolution":{"observed_at":"2026-08-10T22:32:08.847933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.831362Z","title":"Encoding Speaker-Specific Latent Speech Feature for Speech Synthesis,","venue":null,"work_id":"3fe67729-7bc8-47dc-9b14-2d2de7e68927","year":2024},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.615349Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:b26ef1d344e3281d2827726f44d13a0d06b5eefbf88f63c839e141b04b7f4fe9","observation_id":"37207da7-0c39-4be2-a524-8825ed9e0261","resolution":{"observed_at":"2026-08-10T22:32:08.835762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.820767Z","title":"Matcha- TTS: A fast TTS architecture with conditional flow matching,","venue":null,"work_id":"97b2b571-4542-4107-bb65-7e233fe41a72","year":2024},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.618903Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:5472b8ad6002d73dc37b1618f05395bc79431a74561af78b189ade706fb89726","observation_id":"ff80f673-5806-41ec-a0d0-5f51439dda8d","resolution":{"observed_at":"2026-08-10T22:32:08.824702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.809109Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":"9b490789-65ed-4a32-a261-5952a3d9f37b","year":null},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.622176Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:b3f6c9270e7dd02f36085d6768872b10569059ed02988d5c93ea4980ac0ab207","observation_id":"6ada6186-fff6-4585-b681-203347a2a8e7","resolution":{"observed_at":"2026-08-10T22:32:08.813325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.796392Z","title":"Grad- tts: A diffusion probabilistic model for text-to-speech,","venue":null,"work_id":"f09d6ec4-3ae5-4dff-affa-2b2e0a1009be","year":null},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.625719Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:7cde208edc7fcf6906b35a8c3e9af3ebb0bfc4334809f3a85c18d4eb6a68b171","observation_id":"c7cf5a04-2ba6-4491-81d4-74e096cce908","resolution":{"observed_at":"2026-08-10T22:32:08.800465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.785302Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text- to-Speech,","venue":null,"work_id":"0ac2d58d-2f0c-4c5e-bc5e-108b8519fab3","year":2019},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.629261Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:273639c333857666183e419e8e7d94823ee02e161fab7420d392ef22b6a1ba93","observation_id":"76d06023-77e9-452a-9390-f096a25a679b","resolution":{"observed_at":"2026-08-10T22:32:08.789172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.773438Z","title":"Cstr vctk corpus: English multi-speaker corpus for cstr voice cloning toolkit,","venue":null,"work_id":"7292e70f-65f6-4694-96bd-527eaad473fa","year":2017},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.632878Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:8cda6c16a57ea443b92606a1174abfc28789a68b1b94f3c3ff1c5d92813ebf4f","observation_id":"5734044a-39b8-4ad2-984a-c0261bcb2eeb","resolution":{"observed_at":"2026-08-10T22:32:08.777837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.762154Z","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis,","venue":null,"work_id":"49532e60-3b2c-4490-ba45-41fb8e0a0d43","year":null},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.636597Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:3a6369549bce0d63042acad00d24c545fb0a10cc179e295483df6ced5bc7d670","observation_id":"fb2694b4-8e12-4949-8742-8d1c9717985b","resolution":{"observed_at":"2026-08-10T22:32:08.766075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.750305Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":"04d50c53-7a4d-4f69-a4e8-fa3a01a42a7e","year":2022},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.640458Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:4911c370e2167ba218c19db260a7d67421c5a9983f899839dea9560e6ecf3686","observation_id":"d20cd8e6-af6c-44eb-8f2b-8a6fa3ab9697","resolution":{"observed_at":"2026-08-10T22:32:08.754427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.737312Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":"8192e98d-7263-4928-b105-39d645025734","year":2023},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.644115Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:0a4f8cc140c60b2ebd56794f200180571505f681e5a7e7243a2144458c1c0888","observation_id":"ca8c3ba0-f25f-4370-bb77-3655dd2ab65f","resolution":{"observed_at":"2026-08-10T22:32:08.742033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.726040Z","title":"Generalized end-to-end loss for speaker verification,","venue":null,"work_id":"b65068e0-9b0d-4016-9bbf-a83902914134","year":2018},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.648235Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:ebcf4cb49472de802be74f8ef7dcdffc626f5e32e2c311f70e33748be23050da","observation_id":"42e26c2d-3826-458d-894d-97171ce4ed5c","resolution":{"observed_at":"2026-08-10T22:32:08.730091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.714223Z","title":"Noise-Robust Zero-Shot Text-to-Speech Synthesis Condi- tioned on Self-Supervised Speech-Representation Model with Adapters,","venue":null,"work_id":"7c914874-e6e6-4da4-963a-a4b2237c0f63","year":2024},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.652212Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:81c99fffa9f1b55575e38d6a8f2d9fe91b37ed2ce417f2e380c84f691b02b163","observation_id":"2d303b80-4cb1-4655-adee-74ddc0e70936","resolution":{"observed_at":"2026-08-10T22:32:08.718426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08402","last_updated":"2024-05-14T07:55:37Z","snapshot_observed_at":"2026-08-15T01:53:30.599060Z","submitted_at":"2024-05-14T07:55:37Z","title":"Investigating the 'Autoencoder Behavior' in Speech Self-Supervised Models: a focus on HuBERT's Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08402","snapshot_observed_at":"2026-08-10T22:32:08.655806Z","title":"Investigating the’Autoencoder Behavior’in Speech Self- Supervised Models: a focus on HuBERT’s Pretraining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.655806Z"},"links":{"cited_paper":"/paper/2405.08402","citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:01ba59d4dc2a8e38c4947f256204c9ee54a116f2a899add93a169bd266dea8ac","observation_id":"5e9ee40c-5938-4300-b0fd-5e190401d54f","resolution":{"observed_at":"2026-08-10T22:32:08.655806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:32:08.699402Z","title":"Meta-stylespeech : Multi- speaker adaptive text-to-speech generation,","venue":null,"work_id":"8453cc6e-a41f-4fc9-847d-c7bcfad54612","year":2021},"citing_paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:08.660181Z"},"links":{"citing_paper":"/paper/2501.01347"},"observation_digest":"sha256:18018a82320452b20310e75974ed5a3c6705f4a8af214ef3da5ba1aacfb71dce","observation_id":"3b8de3b8-38c4-4828-87d0-46cf9d56ca64","resolution":{"observed_at":"2026-08-10T22:32:08.705729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.01347","last_updated":"2025-01-14T11:36:42Z","latest_version":4,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T23:45:04.994591Z","submitted_at":"2025-01-02T16:54:08Z","title":"AdaptVC: High Quality Voice Conversion with Adaptive Learning"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2501.01347."}