{"as_of":"2026-08-10T00:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a11011186f0621222933a1c9beca8a3bbeea20b99423fbad891ddc2e3090724c","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:55:20.365775Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:55:20.110093Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T19:07:18.246563Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04013","snapshot_observed_at":"2026-08-07T10:55:20.110093Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.110093Z"},"links":{"cited_paper":"/paper/2506.04013","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:1c01aa916e3853174ea9a3dc6530799585d5d49d2ae4fc49c24616e76a70584e","observation_id":"ba314579-786e-4c6b-a2b0-691e19b159d0","resolution":{"observed_at":"2026-08-07T10:55:20.110093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"cited_work":{"arxiv_id":"2506.04013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04013","snapshot_observed_at":"2026-07-02T19:07:18.246563Z","title":"N., and Waibel, A","venue":null,"work_id":"3ad73415-6202-4d0f-b638-1349573ccafa","year":2025},"citing_paper":{"arxiv_id":"2605.03039","last_updated":"2026-05-04T18:06:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T18:06:17Z","title":"Mixed-Precision Information Bottlenecks for On-Device Trait-State Disentanglement in Bipolar Agitation Detection","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-08T19:11:30.638672Z"},"links":{"cited_paper":"/paper/2506.04013","citing_paper":"/paper/2605.03039"},"observation_digest":"sha256:28816ab9819cfecb1781e152fb939f7575ffba6f574609863b53918074ef6c0e","observation_id":"ca35d848-c3ba-4ab9-bd33-71cd9388e510","resolution":{"observed_at":"2026-05-09T06:00:36.608042Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"cited_work":{"arxiv_id":"2506.04013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04013","snapshot_observed_at":"2026-07-02T19:07:18.246563Z","title":"N., and Waibel, A","venue":null,"work_id":"3ad73415-6202-4d0f-b638-1349573ccafa","year":2025},"citing_paper":{"arxiv_id":"2606.07240","last_updated":"2026-06-05T13:09:21Z","snapshot_observed_at":"2026-08-08T05:23:18.196980Z","submitted_at":"2026-06-05T13:09:21Z","title":"KIT's Submission to Cross-Lingual Voice Cloning in IWSLT 2026","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T21:39:11.265338Z"},"links":{"cited_paper":"/paper/2506.04013","citing_paper":"/paper/2606.07240"},"observation_digest":"sha256:2c962a7359025dc5c633c95a1d67e175d7d7234743b69d279ac1da0c12051c87","observation_id":"ad6d5a5a-38a2-4068-a167-03f84c166bfe","resolution":{"observed_at":"2026-07-02T19:07:18.248088Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04013/citation-record","integrity":"/paper/2506.04013/integrity","json":"/paper/2506.04013/citation-record.json","paper":"/paper/2506.04013"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.851403Z","title":"Conventional VC models perform well in replicating speaker identity but struggle when the target speech is highly expressive","venue":null,"work_id":"60652f79-ccea-4ac5-9129-57e4709a4dff","year":null},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.100974Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:a2b4459aaed38f36cf06f532ace59bbc5c343fac8d0350fbfff9704f2e0a3d0e","observation_id":"73dae815-3c55-4526-84c8-912be14e0f2d","resolution":{"observed_at":"2026-08-07T10:55:20.855135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.842733Z","title":"These models typically required text supervi- sion","venue":null,"work_id":"77c5a489-6d93-478d-8d4b-0164db04efd9","year":null},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.105713Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:d70f8377e7bb647c9913df28dc4fe3c42e5d7bd642bf4b6885e872532f4d06de","observation_id":"60d15bb1-2e4b-439f-9dfc-c7c6aa33ce69","resolution":{"observed_at":"2026-08-07T10:55:20.845772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.831249Z","title":null,"venue":null,"work_id":"543fda8b-b7c3-4ebf-ac84-56395daa1a2a","year":null},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.113786Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:d2b83c4994f8178f3f13553ba713afbe5c256b8d9ea00f99402b2a8f0dcec435","observation_id":"2b05af34-6da4-4dab-be57-1f5d46dc096c","resolution":{"observed_at":"2026-08-07T10:55:20.837000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.822040Z","title":"All datasets are English and total duration is around 228 hours with more than 920 speakers","venue":null,"work_id":"b31bd260-b9bb-48cb-9ce7-4101b7bdc0b5","year":null},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.117679Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:334933bee5b4bb34ce81e56a039df7747d8e1d677721e548e047376bbbb7db1f","observation_id":"d66535c6-1087-46f6-aa49-3738da5f3ba0","resolution":{"observed_at":"2026-08-07T10:55:20.825514Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.812217Z","title":null,"venue":null,"work_id":"266c787c-3808-4867-a8d4-13abe47b98f8","year":null},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.121966Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:a4e7a79cdd26a74d3d8b67a737af0a4ed758660d61240a9554fa4d85b71ae204","observation_id":"89c442f2-6f5c-4f5a-8dd8-d074ee68083e","resolution":{"observed_at":"2026-08-07T10:55:20.816313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.802667Z","title":null,"venue":null,"work_id":"7a2f661f-d87a-4196-8684-6ef9622c9cae","year":null},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.125796Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:e81200e4ac32881d2bd02d4bf232d2f269f43858c8aaa614ac5670d406ef69fe","observation_id":"e262b5f6-fc04-414b-a4fc-43b864e1852d","resolution":{"observed_at":"2026-08-07T10:55:20.805968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.756823Z","title":"Styles2st: Zero-shot style transfer for direct speech-to- speech translation,","venue":null,"work_id":"fd9b1103-c9e2-43be-bac2-2bf2f1c32984","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.151933Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:24021ee2c2ecfef786e5b4f3a98c4d914918387d13b4ef5d06e641168ae97551","observation_id":"92367e0f-9cda-4004-997d-3c19c61642e7","resolution":{"observed_at":"2026-08-07T10:55:20.760631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.793661Z","title":"Chil: Computers in the human interaction loop,","venue":null,"work_id":"a6eb5aee-7047-4d6b-8ad5-83b583fba1c1","year":2005},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.129443Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:2e22e796172e6f3a672b8f05dc4cb5dde84f1d68afa4ec92ecbb648d5811c06c","observation_id":"c660e27c-596c-48f2-9e38-a14f95eef46e","resolution":{"observed_at":"2026-08-07T10:55:20.796781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.784835Z","title":"Towards an open-domain social dialog system,","venue":null,"work_id":"5d5a555d-e18c-4686-82e9-5c9195e4f2b9","year":2017},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.132609Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:75157ebd6d6672dc3e933192f7d44576b618d25fc510fca79f1efecdba61e873","observation_id":"ad0ef1ef-5d7f-465f-b9f1-e912a536f3a0","resolution":{"observed_at":"2026-08-07T10:55:20.788033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.775808Z","title":"Face-dubbing++: Lip-synchronous, voice preserv- ing translation of videos,","venue":null,"work_id":"6867449e-2d71-4326-b33d-ac886daa9065","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.136544Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:1246de811c0e8c8ee621003e9cce76ff9e84012c7fdc9c6e5695d1adcc5508f9","observation_id":"25550670-15b0-48b7-9b2b-280828d1941b","resolution":{"observed_at":"2026-08-07T10:55:20.779015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05088","last_updated":"2024-11-07T19:11:55Z","snapshot_observed_at":"2026-08-02T01:14:23.877587Z","submitted_at":"2024-11-07T19:11:55Z","title":"Findings of the IWSLT 2024 Evaluation Campaign","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05088","snapshot_observed_at":"2026-08-07T10:55:20.139760Z","title":"Findings of the iwslt 2024 evaluation campaign,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.139760Z"},"links":{"cited_paper":"/paper/2411.05088","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:e3f7c2ffde818da55570bb2b93a10bdc2a5de79e58637e7925840cf83254de44","observation_id":"c9a77ed3-3ba0-4d54-8e9e-3620d532acd9","resolution":{"observed_at":"2026-08-07T10:55:20.139760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04013","snapshot_observed_at":"2026-08-07T10:55:20.110093Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.110093Z"},"links":{"cited_paper":"/paper/2506.04013","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:1c01aa916e3853174ea9a3dc6530799585d5d49d2ae4fc49c24616e76a70584e","observation_id":"ba314579-786e-4c6b-a2b0-691e19b159d0","resolution":{"observed_at":"2026-08-07T10:55:20.110093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.766635Z","title":"Simultaneous translation of open do- main lectures and speeches,","venue":null,"work_id":"c3f041f4-4f90-4e48-9a8d-293fd5813912","year":2012},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.144697Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:60bd21a806cd80f17fefb96987d49192484d33a25ee672a6d645c171bbb09114","observation_id":"0ab7ae64-8fa2-4efe-ba84-aec402de6f5e","resolution":{"observed_at":"2026-08-07T10:55:20.770020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-07T10:55:20.148186Z","title":"Seamless: Multilingual expressive and streaming speech translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.148186Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:4590101d46fd41bab7a108628418e4ac6d505543d4e5b91b5fb598d59d3d2272","observation_id":"c9f3b311-7eea-48d9-9bb0-b849850a81b0","resolution":{"observed_at":"2026-08-07T10:55:20.148186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.746899Z","title":"Limited data emotional voice conversion leveraging text-to-speech: Two-stage sequence-to- sequence training,","venue":null,"work_id":"5f3a0f1a-327c-487d-8aed-13d46b91bed9","year":2021},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.155032Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:aa794ef70c21c6bb24fb1710252a268b43e2b1847fcd181d48fef2564ac28959","observation_id":"5a98814b-9b96-409e-8a88-75df122dd784","resolution":{"observed_at":"2026-08-07T10:55:20.750351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.737143Z","title":"Nonparallel emotional speech conversion,","venue":null,"work_id":"0c03371f-2bcf-41b4-a240-fefb11ae4b11","year":2019},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.158385Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:6c43f03509ca76c2f8e5b1c3ddb4ce2292d7644ae94920d182fe5a92722f07dd","observation_id":"28febc5b-ccf0-467a-95d5-5131f4e549e8","resolution":{"observed_at":"2026-08-07T10:55:20.740558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.727592Z","title":"Nonpar- allel emotional speech conversion using vae-gan","venue":null,"work_id":"239e5cbb-4216-4d6d-b955-c216aafd3e16","year":2020},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.161449Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:ec04ec4b7b8eca27d611eaee6e8ad5713d46ff1e7be74c688b958e927b40d912","observation_id":"c9294002-d084-43b3-b41f-78731dc9f955","resolution":{"observed_at":"2026-08-07T10:55:20.730923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.717810Z","title":"Textless speech emotion conversion using discrete and decom- posed representations,","venue":null,"work_id":"8c5bc130-3b7b-45a7-a3e7-9ea96610472a","year":2022},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.165248Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:cfa8df5c8989482080dd44e11a7fec3bd4a8b0adabede7aa87f41cc47372c269","observation_id":"90cacd4e-433b-4991-b40f-d1fb14fc9821","resolution":{"observed_at":"2026-08-07T10:55:20.721511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.708088Z","title":"Hiervst: Hierar- chical adaptive zero-shot voice style transfer,","venue":null,"work_id":"cef718d2-61bf-4213-8395-0bd5516badf5","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.168157Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:9450f0aab3e479cec10cfa4cfd9223df45a6a3ac91837bbb0f31b9eca27e6e2c","observation_id":"3e6b91b7-04d0-456e-8398-c26d7a5e7f41","resolution":{"observed_at":"2026-08-07T10:55:20.711516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.697565Z","title":"Expressive-vc: Highly expressive voice conversion with attention fusion of bottleneck and perturbation features,","venue":null,"work_id":"1cd7b2af-e850-417b-b222-c2e5fdeaba7d","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.172054Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:097e12ed1afaa1c082ecafbc6b4926f7114ad49b9346e86f69e8b6b0cfd9bca4","observation_id":"c5850056-bcc9-495f-af8a-9b5d27e67111","resolution":{"observed_at":"2026-08-07T10:55:20.701184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.686673Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":"1c61f5be-da3c-4f85-a269-b136bae60b35","year":2021},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.176032Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:de6f7458ff9c21c2cce2db79061b97b4ffbedcfd3f6b834ad7aeba0cf63cdbc4","observation_id":"aec52e0c-9e09-44f4-8d98-c38be0db8dcc","resolution":{"observed_at":"2026-08-07T10:55:20.690149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.677091Z","title":"Freevc: Towards high-quality text-free one-shot voice conversion,","venue":null,"work_id":"2f841114-c003-4c50-9cbf-e03cdf84265f","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.179658Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:64f3cb6cc55d9af9f5172d7124993ee4e43f821144e72b96bff1988c7b837b32","observation_id":"da85ec13-5aee-4693-b038-fcfb0199455f","resolution":{"observed_at":"2026-08-07T10:55:20.680603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.667550Z","title":"mhubert-147: A compact multilingual hubert model,","venue":null,"work_id":"3b7168cf-1436-468a-81ee-b9de30c75daa","year":2024},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.183562Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:469b352e449bbdf5a999d93a062973750d9e10f8c6597f8b54caf33ab66c486b","observation_id":"c3e35a3f-36c7-449b-b665-11c3fdf4c2da","resolution":{"observed_at":"2026-08-07T10:55:20.670869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.657857Z","title":"V oice privacy- investigating voice conversion architecture with different bottle- neck features,","venue":null,"work_id":"ffac3617-089a-45ae-a718-7d9e65b12535","year":2024},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.186998Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:3abefa3281d0f9ef70d2af92e66920b22ce8357f07eb2192a19ad46914483f8c","observation_id":"10c8d12d-7494-4972-a593-9ecf7d8b2fb6","resolution":{"observed_at":"2026-08-07T10:55:20.661268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.648125Z","title":"Generspeech: Towards style transfer for generalizable out-of-domain text-to- speech,","venue":null,"work_id":"5fa37322-cf01-4ac8-ad67-45f3ec286a66","year":2022},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.190765Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:f15dc244ee7df4ac9dec9a414f8110535dee31b323b2636bc633b986dee24d4c","observation_id":"92ec07ed-625a-468a-9f3f-fbd34e7cb781","resolution":{"observed_at":"2026-08-07T10:55:20.651408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.194507Z","title":"Ecapa-tdnn: Emphasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.194507Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:6c40945a235e4e83d54f6af05399cb32ccfca3db1c7f292d1e0b0f959dc0a92c","observation_id":"4d272469-5516-4d6f-8533-831cf5137352","resolution":{"observed_at":"2026-08-07T10:55:20.194507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.633549Z","title":"Emotion intensity and its control for emotional voice conversion,","venue":null,"work_id":"8233273c-6ab1-4119-a9bf-44ff43a20c71","year":2022},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.197913Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:b98bc9894bc47c33afe4529d802889f2e178734362801c3bbeae5dd7def1c4bf","observation_id":"5910ef84-2008-41a0-a9c6-2d41bbdbac57","resolution":{"observed_at":"2026-08-07T10:55:20.636704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.623577Z","title":"Accent conversion using pre-trained model and synthesized data from voice conver- sion","venue":null,"work_id":"867a2e53-c66c-45ce-b823-ab97d98ceb10","year":2022},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.294744Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:13b4add05aeae1c8048a8a119e2fb6d3d6ae532a8fa1dbaeaedcc74acdc63f18","observation_id":"20b2f702-bbf1-430c-b7e3-baaee31197d3","resolution":{"observed_at":"2026-08-07T10:55:20.627065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.613568Z","title":"Improving pronunciation and accent conversion through knowledge distilla- tion and synthetic ground-truth from native tts,","venue":null,"work_id":"d5f98631-50ca-4595-9228-2ca3b0604f34","year":2025},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.298990Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:4e9748e05bb64aaa1eb4b2cabf0aaf75d1750688c23f2c2c03d3ea26c0842f65","observation_id":"2e0dc039-9d98-47b0-96f2-9f98dbf965b3","resolution":{"observed_at":"2026-08-07T10:55:20.616973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.603712Z","title":"Stargan for emo- tional speech conversion: Validated by data augmentation of end- to-end emotion recognition,","venue":null,"work_id":"809a9735-bc8f-41dc-829e-47f96be1e2f3","year":2020},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.302169Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:ddcebd6c425aa3e83c988e44b580a0b6ca6089da008a605c82a7a8a846894bfb","observation_id":"e8cf2831-0a5b-4443-aa8a-5b00fb0bde59","resolution":{"observed_at":"2026-08-07T10:55:20.607359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05695","last_updated":"2021-01-14T16:18:53Z","snapshot_observed_at":"2026-08-04T20:19:13.714500Z","submitted_at":"2021-01-14T16:18:53Z","title":"EmoCat: Language-agnostic Emotional Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05695","snapshot_observed_at":"2026-08-07T10:55:20.306160Z","title":"Emocat: Language-agnostic emotional voice conver- sion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.306160Z"},"links":{"cited_paper":"/paper/2101.05695","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:79dec1c6bda83ff6b37fe1aaee0fcf6035076d2c303a4539ffb9062f0bad0ad4","observation_id":"9d68f57f-7d99-40b1-9cb3-0fcb5d3b92f9","resolution":{"observed_at":"2026-08-07T10:55:20.306160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.594157Z","title":"V oice conversion with just nearest neighbors,","venue":null,"work_id":"4105e0a7-d699-4a6d-8d97-b17dffbc2e8d","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.309572Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:255764aaddf7eba00b920359d0f61a886c6f4109665c1b152938863b3f492aa2","observation_id":"95c0fc03-f874-48e2-8517-fe0d1d91aed8","resolution":{"observed_at":"2026-08-07T10:55:20.597489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.584486Z","title":"Disentangling prosody representations with unsupervised speech reconstruction,","venue":null,"work_id":"834e9f27-1cb1-422d-a644-05a9a00e6245","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.312653Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:c938b8f88e3921061227ae32e391d7b73c70e29be57a9c5264728dabe6ec870a","observation_id":"03777a17-2dc4-4fa3-8d3d-4eb9d74b8b6a","resolution":{"observed_at":"2026-08-07T10:55:20.587981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.573905Z","title":"Using joint train- ing speaker encoder with consistency loss to achieve cross-lingual voice conversion and expressive voice conversion,","venue":null,"work_id":"77c4c4e3-4e7a-4726-b754-0466c428bb19","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.315921Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:d091e1771f4e1823614e7ce5895bb96794c7c543e4952d9958d01c8e46c854bb","observation_id":"b804b6f8-c9b6-4dea-a3cf-412b9b014202","resolution":{"observed_at":"2026-08-07T10:55:20.577501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.562947Z","title":"X-e-speech: Joint training framework of non- autoregressive cross-lingual emotional text-to-speech and voice conversion,","venue":null,"work_id":"e89753d8-83db-4108-9945-611dab0ae0ea","year":2024},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.319244Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:ce36142d3e6e2424865f1809bb27417efb27d5c57992747d7f9a7ab21ccf48aa","observation_id":"70f5d6af-002d-4d63-b689-720df816fb73","resolution":{"observed_at":"2026-08-07T10:55:20.566994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.552631Z","title":"Zse-vits: A zero-shot expressive voice cloning method based on vits,","venue":null,"work_id":"684b0ec4-937c-496d-92b9-573b3a8f9591","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.322515Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:4e1e48b81471b83bb8537d108ade662833efd9a823690f33491ab0698fe64a50","observation_id":"2613bdb2-d8e8-4fd1-acf3-8c897598eabc","resolution":{"observed_at":"2026-08-07T10:55:20.556372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12454","last_updated":"2023-11-27T12:26:32Z","snapshot_observed_at":"2026-07-06T16:50:26.807430Z","submitted_at":"2023-11-21T09:07:11Z","title":"HierSpeech++: Bridging the Gap between Semantic and Acoustic Representation of Speech by Hierarchical Variational Inference for Zero-shot Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12454","snapshot_observed_at":"2026-08-07T10:55:20.325815Z","title":"Hierspeech++: Bridging the gap between semantic and acoustic representation of speech by hierarchical variational inference for zero-shot speech synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.325815Z"},"links":{"cited_paper":"/paper/2311.12454","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:ee3400b2f44bc9c0f58a241217d2fa321d5b23cca0b2ed3404e0b51b5d77cb73","observation_id":"465a0c8c-bb1e-4e75-8021-eb5edcc90a2c","resolution":{"observed_at":"2026-08-07T10:55:20.325815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16430","last_updated":"2023-07-31T06:36:44Z","snapshot_observed_at":"2026-08-09T11:42:46.034296Z","submitted_at":"2023-07-31T06:36:44Z","title":"VITS2: Improving Quality and Efficiency of Single-Stage Text-to-Speech with Adversarial Learning and Architecture Design","version":1},"cited_work":{"arxiv_id":"2307.16430","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16430","snapshot_observed_at":"2026-08-07T10:55:20.422366Z","title":"VITS2: Improving Quality and Efficiency of Single-Stage Text-to-Speech with Adversarial Learning and Architecture Design","venue":"cs.SD","work_id":"78356ef2-b015-4d0e-ab2e-1b7f016963f2","year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.329181Z"},"links":{"cited_paper":"/paper/2307.16430","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:c7ff40da728f8db4d539d6005139320d92a25a888bdd046ebd8f99db9482c32a","observation_id":"da1d2bd3-e7b9-4952-b276-cfb28b0a60f6","resolution":{"observed_at":"2026-08-07T10:55:20.427901Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.541714Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":"976c2cbf-bf36-455c-a4d9-31145ea196f1","year":2020},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.333182Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:c4700a5742bb2033ac343ba4f6d5694dd91e71808b646aeaca714390b63c8b6b","observation_id":"cdd4abe5-1b3c-4335-b5e3-418d8ea4ea1a","resolution":{"observed_at":"2026-08-07T10:55:20.545193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.531378Z","title":"Libritts: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":"eb89528d-7c9b-43a8-a9e5-b6b6522218ee","year":2019},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.336222Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:9adb88928337530973a2d3ed427235054911de75f1a574df09a031cd961e9780","observation_id":"2f69c47b-1579-421b-8de8-6ab66a58c7f5","resolution":{"observed_at":"2026-08-07T10:55:20.534957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.521074Z","title":"Seen and unseen emo- tional style transfer for voice conversion with a new emotional speech dataset,","venue":null,"work_id":"67682305-76c3-4d73-9e77-476a24a29f3f","year":2021},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.339190Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:2db4ca20c848dbde3dd2ad2946fa5136f17bf3bf5b4940314fede8e0fe48d228","observation_id":"fe8a54c9-162f-4886-a27f-b26498b66e42","resolution":{"observed_at":"2026-08-07T10:55:20.524960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-09T08:32:43.969496Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T10:55:20.342184Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.342184Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:c32dcec72a62dd2d7734e913a0afcbb59408854a7c8f980b1fe3e51fda17b323","observation_id":"b1d1b093-dbc2-468e-83ea-b92226d3d12a","resolution":{"observed_at":"2026-08-07T10:55:20.342184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05725","last_updated":"2023-08-10T17:41:19Z","snapshot_observed_at":"2026-07-06T16:04:58.235073Z","submitted_at":"2023-08-10T17:41:19Z","title":"EXPRESSO: A Benchmark and Analysis of Discrete Expressive Speech Resynthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05725","snapshot_observed_at":"2026-08-07T10:55:20.345371Z","title":"Ex- presso: A benchmark and analysis of discrete expressive speech resynthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.345371Z"},"links":{"cited_paper":"/paper/2308.05725","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:8e929c9fa1010c9ea44638b9bbf7d096f32e67e73f50fea976d3cdad1416e4c7","observation_id":"a5e2b151-c0e1-4e2c-beb8-922275a56e54","resolution":{"observed_at":"2026-08-07T10:55:20.345371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.349892Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.349892Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:47a488f1d05375e8fc3fe6f1353b71e5624fefbc56bfbcc974dcecf88d1dc83a","observation_id":"76475748-f2ec-45c9-b57d-617c56837d54","resolution":{"observed_at":"2026-08-07T10:55:20.349892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-07T10:55:20.353059Z","title":"Emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.353059Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:a8644d3224cec53f61935f3690826b5ce9b2d2849a56d1a5d1d7b84da9e18b42","observation_id":"2c0e4eed-aa8b-4d57-84ec-3030fd4b73d1","resolution":{"observed_at":"2026-08-07T10:55:20.353059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.505141Z","title":"The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, multimodal set of facial and vocal expressions in north american english,","venue":null,"work_id":"cf8e9785-ab41-4499-b5e9-b7ba5f8b4437","year":2018},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.356312Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:04c9d1604c8fd8638951a12fedfd3a176c45af70eae26672b3a1fb7ed0c94b05","observation_id":"4933fb26-7b1b-41ba-a702-96cae9263b1a","resolution":{"observed_at":"2026-08-07T10:55:20.508696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.494762Z","title":"A comparison of discrete and soft speech units for improved voice conversion,","venue":null,"work_id":"a1f833ad-5b42-4088-a48f-13cdbd0a1b79","year":2022},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.359499Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:1a57b9f85a62850176fddd728c36a99025787a5c245969b00f85b93798ec6ef6","observation_id":"90739c25-a623-4060-a345-6fcf22a17a06","resolution":{"observed_at":"2026-08-07T10:55:20.498394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.362733Z","title":"Scaling speech technology to 1,000+ languages,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.362733Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:fa807d53e99517b35a36baf14a89242175c47d1c8e0f733da7196f44a33aa589","observation_id":"48e54d4e-5efa-4b12-8455-e53b9a662115","resolution":{"observed_at":"2026-08-07T10:55:20.362733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:20.479317Z","title":"A database of german emotional speech","venue":null,"work_id":"5faa4573-3edd-40a9-8227-24534cab6a03","year":2005},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.365775Z"},"links":{"citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:8410807c64fe5eb319991d5b3e4ab289f39b07578465b42610c362b939118b57","observation_id":"f0698fca-027e-419d-a48e-4d851c7edf2b","resolution":{"observed_at":"2026-08-07T10:55:20.482825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":33},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 3 inbound Pith citation observations for arXiv:2506.04013."}