{"as_of":"2026-08-09T17:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4decc9dc1f9870edb3d9b3f048e6f8c206722c4c41916daa301a284724f69ca9","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:43:55.149647Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:43:48.766757Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T19:43:55.756459Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"cited_work":{"arxiv_id":"2507.04817","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.04817","snapshot_observed_at":"2026-08-06T19:43:55.756459Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","venue":"cs.SD","work_id":"56c170b2-309d-4bc5-881f-3105326bcfc7","year":2025},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.766757Z"},"links":{"cited_paper":"/paper/2507.04817","citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:5cccd47d559f91c8a63659167c3d6853771cbedf3b3f9a3a69677edbd0e4ccec","observation_id":"af0842b0-1efd-4025-a815-8962edf87243","resolution":{"observed_at":"2026-08-06T19:43:55.831971Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04817/citation-record","integrity":"/paper/2507.04817/integrity","json":"/paper/2507.04817/citation-record.json","paper":"/paper/2507.04817"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:06.781691Z","title":"By definition, this task requires altering vocal identity, which raises fundamental questions about what features define a speaker’s voice and how they should be manipulated","venue":null,"work_id":"b1b139f3-4774-49fb-b44d-f452d1ceb5ea","year":null},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.665446Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:c051a9e5566917361f3b5797b6c1f05723a931256092a556ce07704eca9aeb15","observation_id":"e6271d0e-93ee-4447-8e9c-8c940bdfcb62","resolution":{"observed_at":"2026-08-06T19:44:06.837152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"cited_work":{"arxiv_id":"2507.04817","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.04817","snapshot_observed_at":"2026-08-06T19:43:55.756459Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","venue":"cs.SD","work_id":"56c170b2-309d-4bc5-881f-3105326bcfc7","year":2025},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.766757Z"},"links":{"cited_paper":"/paper/2507.04817","citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:5cccd47d559f91c8a63659167c3d6853771cbedf3b3f9a3a69677edbd0e4ccec","observation_id":"af0842b0-1efd-4025-a815-8962edf87243","resolution":{"observed_at":"2026-08-06T19:43:55.831971Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:06.646662Z","title":"Our goal is to design a model capable of transferring a specific utterance from one speaker to another speaker’s timbre, while relying on high-level control features","venue":null,"work_id":"874274ee-cc98-4f0f-8faf-3d3b47894195","year":null},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.860480Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:88db39fb1b3cc1421e83ce038e52e4165120e2fbfee91bce962b860e638b1d40","observation_id":"3d809919-9110-41b1-8965-7d414d95e58d","resolution":{"observed_at":"2026-08-06T19:44:06.710310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:06.468504Z","title":null,"venue":null,"work_id":"4da30c09-84af-47f8-a7b9-0afe6716b4bd","year":null},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:48.923877Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:64fddb8012461bb82e7359a98b0eab7a60589e4210074d5d81e16c8ddb789628","observation_id":"5bac2929-86b9-45a4-8c98-876e6f352e73","resolution":{"observed_at":"2026-08-06T19:44:06.565441Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:06.314586Z","title":null,"venue":null,"work_id":"31f138f4-913d-4fdc-ae99-62504da50032","year":null},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.013694Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:ca174d1471abc8c41cbf4019a17ec568a5ffe5f4bc147826f2c4934613064c51","observation_id":"cbab6189-76ce-48c5-9706-8e8947ce2591","resolution":{"observed_at":"2026-08-06T19:44:06.399057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:06.174334Z","title":null,"venue":null,"work_id":"4b11d1b5-8fd7-4976-b4cd-7de50976143e","year":null},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.150687Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:fed1e7f2d4e05af870dd55a1ca50b6687a11f3e35632c48a6e964d127f71f711","observation_id":"0b3ff3e5-3473-4fef-b0c0-fcdacb0eda78","resolution":{"observed_at":"2026-08-06T19:44:06.240199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:06.025131Z","title":null,"venue":null,"work_id":"f14556b2-19b1-45fb-9b49-152f8e9518c8","year":2025},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.284738Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:e71640a91ee26da40627fbe4d34b5a006eb50cb1ae2c2df17bd87abec78dd029","observation_id":"437f8c07-19d0-4473-bfe4-3d61edf5dffb","resolution":{"observed_at":"2026-08-06T19:44:06.102820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:05.715418Z","title":"Reimagining speech: a scoping review of deep learning-based methods for non-parallel voice conversion,","venue":null,"work_id":"d6a52b1a-fe2f-4422-9c27-4dce7357e7ec","year":2024},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.410056Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:fc580f490bbc69d3026b58e0ac461c8ba9f91fa367962f548af6ac8f6392d757","observation_id":"95a59a38-4f86-4122-a4c7-4d10a4ae5ab3","resolution":{"observed_at":"2026-08-06T19:44:05.908966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:05.342858Z","title":"An Overview of V oice Conversion and Its Challenges: From Statistical Modeling to Deep Learning,","venue":null,"work_id":"aa9372bc-826d-4fe0-91ff-5e892138340f","year":2020},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.518760Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:6fe07f0cbfb4d2a02df276e77f3d5578ec890f857a25a6c8bf1203dfcf6d53ef","observation_id":"d7d73e5b-8e83-44d4-8210-022251f1fe94","resolution":{"observed_at":"2026-08-06T19:44:05.580677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:05.107458Z","title":"AutoVC: Zero-Shot V oice Style Transfer with Only Autoencoder Loss,","venue":null,"work_id":"36b1dfb8-5f03-4781-af61-eeff06bf70a9","year":2019},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.670563Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:4ca7d5b05b60b752896af391d4c4b4fc088c6a4fe70e72b89be4ff2972771f7b","observation_id":"560a9be0-a592-4f2d-b285-b52b400aab9c","resolution":{"observed_at":"2026-08-06T19:44:05.225196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:04.840369Z","title":"Diffusion-Based V oice Conversion with Fast Maximum Likelihood Sampling Scheme,","venue":null,"work_id":"b2f14daf-76eb-45cf-b356-af9970c47476","year":2022},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.755966Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:cbc2ffe21481f8ab181cf905a6d69de9a76aa4c36437bba189201a27adabbfd1","observation_id":"89d3a7b5-142d-435a-abdc-0d35f6409880","resolution":{"observed_at":"2026-08-06T19:44:04.979665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:04.592793Z","title":"QUICKVC: A Lightweight VITS- Based Any-to-Many V oice Conversion Model using ISTFT for Faster Conversion,","venue":null,"work_id":"7751d449-845e-4b25-99ae-c61c77493add","year":2023},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:49.868443Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:3b24e0761b56fefab3e5f083975dce7e34a6355140120e57e475562023d930c2","observation_id":"e86c7ebd-20a4-4642-b691-73c56d2b0396","resolution":{"observed_at":"2026-08-06T19:44:04.719525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:04.383933Z","title":"V oice Reenactment with F0 and timing constraints and adversarial learning of conversions,","venue":null,"work_id":"13b831a5-6bc1-4b39-b424-7c9eddbebfab","year":2022},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.027088Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:8fab6bd9da8911c713ba2c5aa0f4493ee2f6fd46b4cdb566757762e6b709dd5f","observation_id":"690b77c8-df77-41cf-9365-382baaf5fd1c","resolution":{"observed_at":"2026-08-06T19:44:04.494351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03364","last_updated":"2023-09-06T21:16:58Z","snapshot_observed_at":"2026-07-06T16:15:27.717075Z","submitted_at":"2023-09-06T21:16:58Z","title":"Highly Controllable Diffusion-based Any-to-Any Voice Conversion Model with Frame-level Prosody Feature","version":1},"cited_work":{"arxiv_id":"2309.03364","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.03364","snapshot_observed_at":"2026-08-06T19:43:55.583534Z","title":"Highly Controllable Diffusion-based Any-to-Any Voice Conversion Model with Frame-level Prosody Feature","venue":"cs.SD","work_id":"9744f03a-31ff-44f4-8cef-a1f0b5094824","year":2023},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.141700Z"},"links":{"cited_paper":"/paper/2309.03364","citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:3ebbc1f6c3a297210b1a6b48bb1f207851e0c5c4131e1a116087a93644c60b68","observation_id":"4a413726-2ec9-4443-b062-9c9673b49b8e","resolution":{"observed_at":"2026-08-06T19:43:55.676440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:04.156280Z","title":"HiFi-VC: High Quality ASR-based V oice Conversion,","venue":null,"work_id":"345904dd-a90b-4ad5-895f-31c251adb99a","year":2023},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.212871Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:0b139c8dcfc8717fd19485cb48e95ebb8d0f3cda4af0765a966b868fcd643b7a","observation_id":"2ca0df46-f346-4ee6-934f-f85cc1210acc","resolution":{"observed_at":"2026-08-06T19:44:04.262943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:03.880488Z","title":"ControlVC: Zero-Shot V oice Conversion with Time-Varying Controls on Pitch and Speed,","venue":null,"work_id":"3cefcb37-8f5c-4294-a382-334b2ba6d16a","year":2023},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.286968Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:516b61bfc4666c1b48e58112ceaa0e8a94d040bc46ac1b2526a53eb3ed7fc78a","observation_id":"d64400bf-cf12-4034-9d6e-a852eb9626a6","resolution":{"observed_at":"2026-08-06T19:44:04.043763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:03.817745Z","title":"V oice quality: the 4th prosodic dimension,","venue":null,"work_id":"a1b2bb50-5a71-4173-b1d0-e5899722a21a","year":2003},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.373858Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:f5a183610e2659df78a55b0ed98b1c6d9bf4a7d448ca882593c4adad616c0f44","observation_id":"34c55e29-a92e-441e-8630-627cadf2147f","resolution":{"observed_at":"2026-08-06T19:44:03.843020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:03.523267Z","title":"Manipulating V oice Attributes by Adversarial Learning of Structured Disentangled Representations,","venue":null,"work_id":"d6e4cd38-8074-480f-bec9-0f3ff9d4a7b0","year":2023},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.452282Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:41f61013e43e2a879b30bb565287325ad8368bf922376d82c1c632272f94600b","observation_id":"e42942e3-7a45-4dc4-8cc6-7d8c88527247","resolution":{"observed_at":"2026-08-06T19:44:03.683411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:03.259055Z","title":"End-to-End Adversarial Text-to-Speech,","venue":null,"work_id":"d55ce72d-c167-418e-b891-307f8a63d5ba","year":2021},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.544792Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:8c251b068c72610f870fa27db9e694ce3f0403a01547ea0b4410b0a0c7256823","observation_id":"ca9d93d8-185c-46a6-8b20-e3225999ea28","resolution":{"observed_at":"2026-08-06T19:44:03.391963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:02.993437Z","title":"Disentangling prosody and timbre embeddings via voice conversion,","venue":null,"work_id":"739b9eab-8ee4-4524-87c8-ac4eb7259057","year":2024},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.704602Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:86ceb98fc6ef7c7c80b6e314fb7166115b1154ac06056c8157c551d9ccbfa790","observation_id":"65a90cea-3f05-4e5a-bf15-1b3c9eb80515","resolution":{"observed_at":"2026-08-06T19:44:03.134353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:02.679795Z","title":"Learning Expressive Disentangled Speech Representations with Soft Speech Units and Adversarial Style Augmentation,","venue":null,"work_id":"0ee45b12-9140-4d8f-a748-1aae02e31847","year":2024},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.827672Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:75a510ff81325802d4cffe5ea1fa67f774e5746b052e47b21f9a1790adf02e90","observation_id":"67ac75a4-6da6-4e52-a106-d14451ebe706","resolution":{"observed_at":"2026-08-06T19:44:02.856291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:02.344926Z","title":"Disentangling prosody representations with unsupervised speech reconstruction,","venue":null,"work_id":"0c9ac9a0-b98c-487d-8cde-dbd0b6468efd","year":2023},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:50.976593Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:5174a583de4a2ea7e71872e858213ea540b3770dd47f363c33322fb7fcdbd8bb","observation_id":"a859b182-4552-4fbc-8f88-89c84b9a373c","resolution":{"observed_at":"2026-08-06T19:44:02.496682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.04730","last_updated":"2021-11-07T08:52:04Z","snapshot_observed_at":"2026-07-06T12:06:38.623845Z","submitted_at":"2021-11-07T08:52:04Z","title":"Emotional Prosody Control for Speech Generation","version":1},"cited_work":{"arxiv_id":"2111.04730","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.04730","snapshot_observed_at":"2026-08-06T19:43:55.459660Z","title":"Emotional Prosody Control for Speech Generation","venue":"eess.AS","work_id":"a818d9f2-725c-418d-a2ba-8059928a2945","year":2021},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:51.104126Z"},"links":{"cited_paper":"/paper/2111.04730","citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:4f02fb9111adbaf1778b3ed99bddb48f044130dc4f250fa9d5a52594c5de6055","observation_id":"e237feee-9d18-4493-900b-38c5941f2db3","resolution":{"observed_at":"2026-08-06T19:43:55.504763Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:02.082302Z","title":"Advancements in real- time voice conversion technologies: A comprehensive analysis of techniques,","venue":null,"work_id":"58d19fd1-d8fc-4b06-8827-75ce7aa8149c","year":2024},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:51.195942Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:aeb2cd2264e853ebc91f0abb9c4ac7a23bf64f601a4727c5df9153bd6e65d0cc","observation_id":"c4d2fdc4-709c-4532-8fe7-c1b85a7fa4c7","resolution":{"observed_at":"2026-08-06T19:44:02.210081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:01.831005Z","title":"Robust and fine-grained prosody control of end-to-end speech synthesis,","venue":null,"work_id":"8e9e926e-2890-4f94-a635-fd71cacc8ce2","year":2019},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:51.307336Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:5e25bc260339098e0f2001a84fa92227643df4c56b429170eae59d11c41f1690","observation_id":"a9ad8fee-aa76-441d-b646-2580fbc5cfc4","resolution":{"observed_at":"2026-08-06T19:44:01.980137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.12973","last_updated":"2021-06-20T04:01:15Z","snapshot_observed_at":"2026-08-02T08:54:24.831703Z","submitted_at":"2020-10-24T20:16:03Z","title":"Unsupervised Learning of Disentangled Speech Content and Style Representation","version":2},"cited_work":{"arxiv_id":"2010.12973","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.12973","snapshot_observed_at":"2026-08-06T19:43:55.324808Z","title":"Unsupervised Learning of Disentangled Speech Content and Style Representation","venue":"cs.CL","work_id":"08b6c7b9-5826-4b6b-a606-33331c908aaf","year":2020},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:51.424641Z"},"links":{"cited_paper":"/paper/2010.12973","citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:5e66e322d3219f5e1c70adf952f86f58a211ed8ca60a68018d9aa85bd4b7e870","observation_id":"3738cc29-7e58-4f12-a887-f8ec3f871cf5","resolution":{"observed_at":"2026-08-06T19:43:55.384498Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01678","last_updated":"2021-06-17T12:50:49Z","snapshot_observed_at":"2026-08-03T12:31:04.097299Z","submitted_at":"2020-11-03T13:08:53Z","title":"Learning Explicit Prosody Models and Deep Speaker Embeddings for Atypical Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01678","snapshot_observed_at":"2026-08-06T19:43:51.566419Z","title":"Learning explicit prosody models and deep speaker embeddings for atypical voice conversion,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:51.566419Z"},"links":{"cited_paper":"/paper/2011.01678","citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:e1554ce8965974381a8c63132c79df17b03bdfd20ac1dbe9be3b97820bf8cc1f","observation_id":"256ae7b8-ff57-43fc-97e6-081df197c138","resolution":{"observed_at":"2026-08-06T19:43:51.566419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:01.633382Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition,","venue":null,"work_id":"9719e2c8-a1e7-4ec0-b289-b49cdcfc2a63","year":2020},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:51.704968Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:d3ae2bdf83d20e1395efc7148fa15521e91bd66ea6e11745ace084648704fb61","observation_id":"584013d7-8e97-4a90-a1ee-c099686efcf3","resolution":{"observed_at":"2026-08-06T19:44:01.710075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:01.294193Z","title":"WORLD: A V ocoder-Based High-Quality Speech Synthesis System for Real- Time Applications,","venue":null,"work_id":"d679738c-19da-40ff-b6b6-10fd9c69818c","year":2016},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:51.825059Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:1d5474a802574d2e0d6991bac88822c372b26f43ea04ee16ae8b83af230d9dc8","observation_id":"f348eb57-9108-4ad0-b18b-269a84f920fd","resolution":{"observed_at":"2026-08-06T19:44:01.468987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:00.965727Z","title":"How far are we from robust voice conversion: A survey,","venue":null,"work_id":"bb8826a0-202e-48e5-b635-8a6a4d81adbf","year":2021},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:51.942770Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:2f280188cb58be9817fb1eadbcf886d7f5219382596272e6eda96bbaaca0e4e4","observation_id":"ed1deacd-7751-4fee-8a9a-98ea0b036e5d","resolution":{"observed_at":"2026-08-06T19:44:01.128481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:00.656611Z","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis,","venue":null,"work_id":"9e8ae91d-ae5a-402d-a1a5-08a137786810","year":2020},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:52.101576Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:d03d0fd6aaad26cf903187b6fd05f38a9cc8392712353af3116a825aae1fc146","observation_id":"a11979b3-da0b-4465-9b24-b7f1b589dec4","resolution":{"observed_at":"2026-08-06T19:44:00.785700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.10326","last_updated":"2022-07-21T05:10:48Z","snapshot_observed_at":"2026-08-05T01:15:39.596807Z","submitted_at":"2021-10-20T00:49:02Z","title":"Disentanglement of Emotional Style and Speaker Identity for Expressive Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.10326","snapshot_observed_at":"2026-08-06T19:43:52.224133Z","title":"Disentanglement of emotional style and speaker identity for expressive voice conversion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:52.224133Z"},"links":{"cited_paper":"/paper/2110.10326","citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:ef877441595b14b05d6bc96cf117e4b16c7c6909eaca927fff0a6a7533a372eb","observation_id":"37ae0da2-80fa-4e81-8382-fab7ed6cb300","resolution":{"observed_at":"2026-08-06T19:43:52.224133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:00.353174Z","title":"Diphone synthesis using an overlap-add technique for speech waveforms concatenation,","venue":null,"work_id":"8e1c10cc-19b9-4654-8a0e-6c5577051609","year":1986},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:52.359505Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:e2b294609d6988864626cf7893a812df682eed0cd6b59bf6388d9dcfe9a18eda","observation_id":"b3c78abe-0557-433d-9f8d-ab6101cb3bc8","resolution":{"observed_at":"2026-08-06T19:44:00.477323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:44:00.074377Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units,","venue":null,"work_id":"0ad549b3-599b-4266-a5a4-ebb27718dc3b","year":2021},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:52.455359Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:ae9de011185cb1c8d635e232dd87c71f384fae6c4ca851baac431737b801b695","observation_id":"adae3760-e952-47c1-a19d-904b61801227","resolution":{"observed_at":"2026-08-06T19:44:00.206739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:52.553201Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:52.553201Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:9033c7de2e62ed19d6c1b902f62a6e92aa322c9a95ed43b3aa81f5e323b2180d","observation_id":"b79f8883-801b-4f8b-8ca0-63b19592220a","resolution":{"observed_at":"2026-08-06T19:43:52.553201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:59.865850Z","title":"Fast and reliable f0 estimation method based on the period extraction of vocal fold vibration of singing voice and speech,","venue":null,"work_id":"eeffbf24-a05c-4daf-ba98-2d69d3cc74fd","year":2009},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:52.678658Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:cc405210ca359d5faae006d4770cf1d256161f49fbdf716689e7e2329f1f9e70","observation_id":"6cca6754-7fab-41b3-ad2c-51e73feb035e","resolution":{"observed_at":"2026-08-06T19:43:59.968267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:59.630288Z","title":"Crepe: A Convolutional Representation for Pitch Estimation,","venue":null,"work_id":"46aa5c24-5007-46ec-b681-916cff8023c3","year":2018},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:52.822915Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:acd8d4d3cfbde7055c4256e7ec8d4bc88c2d4cb39a725e49ca908d0f7dd7e701","observation_id":"58df1813-5279-4d0c-a85a-b523ae72d9d7","resolution":{"observed_at":"2026-08-06T19:43:59.739962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:59.399039Z","title":"Fully-Convolutional Network for Pitch Estimation of Speech Signals,","venue":null,"work_id":"c8c9b05e-85ad-45c7-9d1e-3b6a02ef1301","year":2019},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:52.944813Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:c9e4a36044a3bbf251ed5d5da0aa4f45d8b78150eb6237cc7c5844f39011853f","observation_id":"e07c0bb8-b61a-4ee7-ae28-7ab7f58b05a9","resolution":{"observed_at":"2026-08-06T19:43:59.551423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:59.107685Z","title":"Parallel-Data-Free V oice Conversion Using Cycle-Consistent Adversarial Networks,","venue":null,"work_id":"24c65729-e4b7-48f8-87d9-738c5269da2d","year":2017},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:53.057287Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:d41d72c725e2db0dc95fa08989c5dc9f3d33e910eb3dc3107b14b0af312b2616","observation_id":"a1ce2f2b-048c-46d7-b26a-a87c1df6d51c","resolution":{"observed_at":"2026-08-06T19:43:59.215285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:58.888168Z","title":"CycleGAN V oice Conversion of Spectral Envelopes using Adversarial Weights,","venue":null,"work_id":"f2a3e718-c320-4691-a273-1215bbf083b5","year":2020},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:53.165721Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:dfaa1b6685063ff838e706d681976fe30ef672f74da78b3578f9514842e26a1b","observation_id":"c33e7b2e-e94d-4817-8fbf-a2a7d87de339","resolution":{"observed_at":"2026-08-06T19:43:59.021455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:58.667781Z","title":"StarGAN-VC: Non-parallel many- to-many voice conversion using star generative adversarial networks,","venue":null,"work_id":"cb37f282-59ac-49f9-98d1-3417fe0829be","year":2019},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:53.291405Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:56a6bfc0591b7faaff331db222cf0f70bd57d7f6d5d7c718d0186437b9d9ee86","observation_id":"afa3d4e4-ed9d-453d-bca3-09dd40fd29fd","resolution":{"observed_at":"2026-08-06T19:43:58.780887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:58.473192Z","title":"StarGAN-VC2: Rethinking conditional methods for stargan-based voice conversion,","venue":null,"work_id":"fde2d5e3-47ed-4e46-bacb-2451fca25f1b","year":2019},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:53.434800Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:bb2cc61687e094371fdee3c47a77ca757a2312adb37da4f20fa05f4ddc38c373","observation_id":"74b8b7af-12e2-4549-bbfe-d8fa8cd42606","resolution":{"observed_at":"2026-08-06T19:43:58.567884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:58.253570Z","title":"Nvc-net: End-to-end adversarial voice conversion,","venue":null,"work_id":"946a483d-bbe0-449e-b54e-4d12939633ff","year":2022},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:53.576804Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:cd6fe8bca576015058a984061cd0022d477c9b3964720fa6fb6c300b0b87e73c","observation_id":"a96cc1b0-cf41-42f6-88fa-9955e9982843","resolution":{"observed_at":"2026-08-06T19:43:58.362880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.951273Z","title":"Avqvc: One-shot voice conversion by vector quantization with applying contrastive learning,","venue":null,"work_id":"96ce1adf-24f1-42e0-be4b-5ad19c4e325f","year":2022},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:53.692366Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:defb54cf3572f944db288837924f5b61ca8d8a6d63975a05be78941dcea3fa67","observation_id":"da8c866d-87e4-475e-b11b-fd9d3b7c4535","resolution":{"observed_at":"2026-08-06T19:43:58.120965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.713765Z","title":"Grad-TTS: A Diffusion Probabilistic Model for Text-to-Speech,","venue":null,"work_id":"18c9d40d-bbb7-4741-ba41-39b529c1c0d4","year":2021},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:53.855605Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:df71413d00602849b1820b7cc0d2137c8937b0735676aee35b323ab83db90b90","observation_id":"c857043d-300d-4972-b513-066c7130b297","resolution":{"observed_at":"2026-08-06T19:43:57.825406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.387149Z","title":"DDDM-VC: Decoupled Denoising Diffusion Models with Disentangled Representation and Prior Mixup for Verified Robust V oice Conversion,","venue":null,"work_id":"b14dfe43-1183-4e28-b611-e3a668258c55","year":2024},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:53.979278Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:b676250d1d7c157381f6a72ca9d92aa1fba00b4f0b16d23502283e0cdc3e7a28","observation_id":"364c84bd-56c3-4de2-b9ef-0051c4559976","resolution":{"observed_at":"2026-08-06T19:43:57.533601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.151503Z","title":"Neural V ocoding for Singing and Speaking V oices with the Multi-Band Excited WaveNet,","venue":null,"work_id":"23f271ca-b5d2-4e4d-a256-6514b48c0cf3","year":2022},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:54.094452Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:5ae92f9875886bc6dfbed797731bcbd80f4ff8c33959a599a256a155eac31d39","observation_id":"67904853-c112-45f9-bf9d-2afbc5cd2bb2","resolution":{"observed_at":"2026-08-06T19:43:57.217083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:57.039641Z","title":"Revisiting Over- Smoothness in Text to Speech,","venue":null,"work_id":"3f34f0b8-f472-44a6-abe9-c408249f7b66","year":2022},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:54.196067Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:b8e4088a89eb9be9a2e5b80e1dd6cd0da1b344f2d66f5fa7e1bb0c59e1fbf029","observation_id":"b3746af1-f5fc-446f-8e52-ae36e5fdb0c5","resolution":{"observed_at":"2026-08-06T19:43:57.091318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.894272Z","title":"On temporal constraints for deep neural voice alignment,","venue":null,"work_id":"66c0a894-0e8b-429f-bc51-a4562ef230c3","year":2023},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:54.308464Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:21564d407aa1a3f2e61cd2835493614fed2e80ebad183194fdcdf0275ecc5f37","observation_id":"e28989d2-8a53-47af-9f1b-184d800c612a","resolution":{"observed_at":"2026-08-06T19:43:56.953867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.751320Z","title":"Festival speech synthesis system: system documentation (1.1. 1),","venue":null,"work_id":"13818a2d-6379-4103-8a92-75f64c1b13a4","year":1997},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:54.430243Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:e892661b4fc0e66d9be66a4e2c5b78581f26c914c715bf494855b0f318cd07e8","observation_id":"e9140faf-69ab-42d4-baa8-2b65c86dcafa","resolution":{"observed_at":"2026-08-06T19:43:56.821804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.623524Z","title":"LIA—PHON: Un syst `eme complet de phon ´etisation de textes,","venue":null,"work_id":"7b2b938a-d1d0-461a-83c0-72d9aa2a6832","year":2001},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:54.528990Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:e03cbea1fa65b031eee8a8122dcfd96fc4bf73f1eb314fd6935796f3440d451a","observation_id":"cc897052-b2c6-4b4b-a68c-2c4d2b2cffd3","resolution":{"observed_at":"2026-08-06T19:43:56.680698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.492650Z","title":"CSTR VCTK Corpus: English multi-speaker corpus for CSTR voice cloning toolkit (version 0.92),","venue":null,"work_id":"c0185eee-7c98-4e42-b873-76fa69673108","year":2019},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:54.621506Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:6d75d0709b4ebf879608b4918dbf2148710d0276ca347f1bbef77af30d58ea4d","observation_id":"fc158ba4-00be-4bec-b29a-1f02963eae5e","resolution":{"observed_at":"2026-08-06T19:43:56.567096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.367163Z","title":"EXPRESSO: A Benchmark and Analysis of Discrete Expressive Speech Resynthesis,","venue":null,"work_id":"0fa0ea02-17b0-429e-96fc-381d962bb010","year":2023},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:54.746080Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:efe3e0698a2b4a3ad05ea4fa921ca7b37855de3862efab07e0643d75418d787c","observation_id":"adfd286b-ff4a-4705-ac36-3bc217e514ec","resolution":{"observed_at":"2026-08-06T19:43:56.424226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.210094Z","title":"Speech Synthesis with Mixed Emotions,","venue":null,"work_id":"57e789a9-1d6a-47f0-abf1-63292937b7df","year":2022},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:54.910644Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:109e6c3aa7060c530899f2d56b6602e6993e6ea954dd38415c1bf82984db3f2d","observation_id":"d6bc563d-2349-447a-bc8c-bcf0cbf2d8a2","resolution":{"observed_at":"2026-08-06T19:43:56.274757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:56.042599Z","title":"Seen and unseen emotional style transfer for voice conversion with a new emotional speech dataset,","venue":null,"work_id":"604e61c8-033b-413c-a02f-d02efbb62fcc","year":2021},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:55.007663Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:41f10b7d4715627628889bfde9eac80fdacd04bc1a26edacfe3edb4a9e487035","observation_id":"a0b1a794-6b15-4fdf-ba98-645d325cf3c2","resolution":{"observed_at":"2026-08-06T19:43:56.108651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:43:55.911491Z","title":"Sequence-to-Sequence Moelling OF F0 For Speech Emotion Conversion,","venue":null,"work_id":"3387a1b3-a79d-48fe-b45c-3d4fb19a3cf6","year":2019},"citing_paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:43:55.149647Z"},"links":{"citing_paper":"/paper/2507.04817"},"observation_digest":"sha256:c0211964cad4e2f148ac6ad890b220b4c2a192fd20af69e60723671d0aaccf12","observation_id":"58f9026d-b06a-4b57-b1fe-a0b5f942f944","resolution":{"observed_at":"2026-08-06T19:43:55.983227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04817","last_updated":"2025-07-07T09:36:00Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T19:36:25.673760Z","submitted_at":"2025-07-07T09:36:00Z","title":"Fast-VGAN: Lightweight Voice Conversion with Explicit Control of F0 and Duration Parameters"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":7,"verified_exact":3,"verified_fuzzy":45},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 1 inbound Pith citation observation for arXiv:2507.04817."}