{"id":"4fe19d68-b669-4695-a52b-100225fe2c85","arxiv_id":"2504.12005","paper_version":1,"verdict":"CONDITIONAL","confidence":"MODERATE","novelty_score":4.0,"correctness_risk":"medium","formal_verification":"none","parameter_count":2,"one_line_summary":"A conditional variational autoencoder with inverse autoregressive flow generates diverse intonations in voice conversion by sampling a latent style vector conditioned on phoneme posteriorgrams.","lead":"This paper proposes a voice conversion model that can generate a single spoken sentence in many different intonations. It uses a conditional variational autoencoder to sample random style variations while keeping the spoken words intact.","discovery_kind":"extension","skeptic_critique":null,"referee_report":null,"author_rebuttal":null,"desk_editor":null,"rs_alignment":null,"lean_confirmation":null,"pith_extraction":null,"created_at":"2026-08-16T12:39:52.405290+00:00","model_set":{"reader":"deepseek-v4-flash"},"falsifier":null,"supporting_citations":[],"review_version":1}