{"as_of":"2026-08-16T23:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:78ab00e9b8a8f71dd70d0edf5b3996d065d6d996541709f280ec4fe0b908dbee","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:13:46.876521Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:13:45.498553Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T20:13:47.342474Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"cited_work":{"arxiv_id":"2505.13805","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13805","snapshot_observed_at":"2026-08-15T20:13:47.342474Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","venue":"cs.SD","work_id":"78e7950c-23e9-4308-859c-63ad0abb50b0","year":2025},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:45.498553Z"},"links":{"cited_paper":"/paper/2505.13805","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:561dfa9083d126782c356a5bcfd113a585a8cf63ac016cc66a18f9e030d9e7a6","observation_id":"18ec0fb6-68be-4911-9794-c4920a1846e6","resolution":{"observed_at":"2026-08-15T20:13:47.399807Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13805/citation-record","integrity":"/paper/2505.13805/integrity","json":"/paper/2505.13805/citation-record.json","paper":"/paper/2505.13805"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:48.507292Z","title":null,"venue":null,"work_id":"ea884f68-9b47-49b9-bae2-ab4166094576","year":null},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:45.442385Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:d820055d32a1ba309e2cbf282f64b462c685789547a731626686f77745a01504","observation_id":"e225211b-9720-4903-aab3-b578015a7cea","resolution":{"observed_at":"2026-08-15T20:13:48.512929Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:48.429715Z","title":"System Overview As illustrated in Fig","venue":null,"work_id":"2ffc1eb9-60d4-4dcc-8240-4b95aee88769","year":null},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:45.493913Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:a451da9749df8d74b9337e82552242f424b8660a812cc47ab98e62cfbf4b074c","observation_id":"a5221266-f0da-4dd7-afef-5fb8a4d37a81","resolution":{"observed_at":"2026-08-15T20:13:48.462992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:48.339528Z","title":"Experimental Setups 3.1.1","venue":null,"work_id":"73929cf7-bbf6-4415-84ba-18575dbfdfcd","year":null},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:45.503785Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:1f73010bc01422cf5d5fd767db77483fe24602972572fe2608b2fbc0f58828e2","observation_id":"9b5b0957-6312-44d7-835a-56e2f64bd8fc","resolution":{"observed_at":"2026-08-15T20:13:48.345570Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:48.197670Z","title":"Specifically, the proposed ClapFM-EVC initially employs EVC-CLAP to extract and align emotional elements across audio-text modalities","venue":null,"work_id":"d7eccea3-ca3b-4398-9b17-a8406f711724","year":null},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:45.586564Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:d40ac8745d8b52d59e826c16f58a98d4ab35afa7aaa09c9b9596059fa9ab4453","observation_id":"36356220-d537-4e83-90ae-d44eec721d11","resolution":{"observed_at":"2026-08-15T20:13:48.210044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04025","last_updated":"2024-03-22T14:49:31Z","snapshot_observed_at":"2026-08-16T20:09:02.726357Z","submitted_at":"2023-08-08T03:43:24Z","title":"MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition","version":3},"cited_work":{"arxiv_id":"2308.04025","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.04025","snapshot_observed_at":"2026-08-15T20:13:47.233999Z","title":"MSAC: Multiple Speech Attribute Control Method for Reliable Speech Emotion Recognition","venue":"cs.SD","work_id":"4a4c51d1-f647-44f6-979c-d6fa02f9f4e2","year":2023},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:45.799903Z"},"links":{"cited_paper":"/paper/2308.04025","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:ece57a04a797401222a51bfa25fd2b94bdd2264f3d62cd7cb4d824690e9199e9","observation_id":"dcc29f3a-ab75-4dee-9b30-7d87e0617701","resolution":{"observed_at":"2026-08-15T20:13:47.287643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:48.005611Z","title":"Mixed emotion mod- elling for emotional voice conversion,","venue":null,"work_id":"61ccf06f-3558-4f64-b496-ea85cc753699","year":2022},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:45.591330Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:a1ac8917753b3874a61874e06636fb5f8a56190052ec9cd4511124e5f9fe9a9e","observation_id":"4f8ee533-e6dc-4821-9b95-67253c353882","resolution":{"observed_at":"2026-08-15T20:13:48.065329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:47.989350Z","title":"A pre-training based personalized dialogue generation model with persona- sparse data,","venue":null,"work_id":"503b03c5-7646-40c8-abdf-f0706714cd34","year":2020},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:45.596315Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:cec482add8bad019f523283446de5fb5261c9bfb6aaf2a34b0ff41e97ca5f690","observation_id":"7f36b60e-55e2-4bf2-99c5-ad443aaa2219","resolution":{"observed_at":"2026-08-15T20:13:47.995333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12139","last_updated":"2024-09-24T02:00:54Z","snapshot_observed_at":"2026-08-16T13:17:25.841214Z","submitted_at":"2024-09-18T17:03:12Z","title":"Takin: A Cohort of Superior Quality Zero-shot Speech Generation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12139","snapshot_observed_at":"2026-08-15T20:13:45.693164Z","title":"Takin: A cohort of superior quality zero-shot speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:45.693164Z"},"links":{"cited_paper":"/paper/2409.12139","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:ab0cf7dba8cbaa5b84867b5a8a8f2f501791edadc310cdfb800100c30fc7d213","observation_id":"572cb274-12a8-4bd3-a3cf-a6a90c9fb3b1","resolution":{"observed_at":"2026-08-15T20:13:45.693164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:45.699418Z","title":"From speaker to dubber: movie dubbing with prosody and duration consistency learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:45.699418Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:f8bfda69666fb9a98d999e637a44e76470165d7172563f0db3a01d8629fc05ef","observation_id":"db7f7ba3-305b-40c8-9e01-dd72d1ae1960","resolution":{"observed_at":"2026-08-15T20:13:45.699418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:46.039171Z","title":"Promptvc: Flexible stylistic voice conversion in latent space driven by natural language prompts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.039171Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:a05a3d72128de2b816283b7e71bbc38dd8fbfc8f6e09b9806a993abd8b337c2b","observation_id":"d27ae634-a04c-4d92-9f2e-e31d9bb82bb5","resolution":{"observed_at":"2026-08-15T20:13:46.039171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02151","last_updated":"2024-09-23T12:32:11Z","snapshot_observed_at":"2026-08-16T13:55:36.342833Z","submitted_at":"2024-05-03T14:58:46Z","title":"GMP-TL: Gender-augmented Multi-scale Pseudo-label Enhanced Transfer Learning for Speech Emotion Recognition","version":3},"cited_work":{"arxiv_id":"2405.02151","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.02151","snapshot_observed_at":"2026-08-15T20:13:47.190181Z","title":"GMP-TL: Gender-augmented Multi-scale Pseudo-label Enhanced Transfer Learning for Speech Emotion Recognition","venue":"cs.SD","work_id":"c9b4b0a6-ea69-46e6-9a98-04003b07a167","year":2024},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:45.805882Z"},"links":{"cited_paper":"/paper/2405.02151","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:924a0e7b82b387d92be983d03fc2ba59171ce0af3867d955af9c1f825abe7962","observation_id":"343f80d5-8607-47fd-bba7-895e25f00d8b","resolution":{"observed_at":"2026-08-15T20:13:47.217133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-15T20:13:45.889714Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:45.889714Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:51ea2ef7ede0200c91e03515790f0301c16af69fcac1ed59dcd8473fcf85ea39","observation_id":"9cb69022-47e4-49ed-ad31-9af27db019a2","resolution":{"observed_at":"2026-08-15T20:13:45.889714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:47.921513Z","title":"Squeezeformer: An effi- cient transformer for automatic speech recognition,","venue":null,"work_id":"56043ee9-31df-4c4f-955b-5d0ba88de6c2","year":2022},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:45.895867Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:57aae3958497e5a1eab46a9d2e5f2a520b9c59679e713d7b5d330ccab659a936","observation_id":"67282a1e-8bc9-4ff5-be50-1f12d0dd59d3","resolution":{"observed_at":"2026-08-15T20:13:47.969688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-16T15:51:49.152928Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-15T20:13:45.900121Z","title":"Cam++: A fast and efficient network for speaker verification using context- aware masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:45.900121Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:b7e1b4a83902f2b56b31c47a284d0b311b0aa391c211883cc91d7bb8be0df3a2","observation_id":"77fcd420-0f8a-4bde-86a8-049a87d4ebe4","resolution":{"observed_at":"2026-08-15T20:13:45.900121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:47.692364Z","title":"One-shot emotional voice conversion based on feature separa- tion,","venue":null,"work_id":"8765d5cb-257c-40b5-8238-a77b26255cb4","year":2022},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.160856Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:e23c0877f3b13a2c21573b566c98b0384d2f180ec56468576b4118f7b10a334c","observation_id":"de513d13-5a8a-4c4e-9746-049ca636d280","resolution":{"observed_at":"2026-08-15T20:13:47.702923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:47.896436Z","title":"Stargan for emo- tional speech conversion: Validated by data augmentation of end- to-end emotion recognition,","venue":null,"work_id":"b5769096-14a5-4c48-b880-b0f243ec3bd5","year":2020},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.044411Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:3eeaab6ca77d91ca9a8d7b58ce75520bc5a909d5a952ea1aaf0aff0949a8cf2d","observation_id":"71042821-bd59-4101-8f0e-e8a89c26795d","resolution":{"observed_at":"2026-08-15T20:13:47.901699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.00198","last_updated":"2020-10-24T06:37:42Z","snapshot_observed_at":"2026-08-09T04:48:32.580994Z","submitted_at":"2020-02-01T12:36:55Z","title":"Transforming Spectrum and Prosody for Emotional Voice Conversion with Non-Parallel Training Data","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.00198","snapshot_observed_at":"2026-08-15T20:13:46.049395Z","title":"Transforming spectrum and prosody for emotional voice conversion with non-parallel train- ing data,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.049395Z"},"links":{"cited_paper":"/paper/2002.00198","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:b50b11ad258241516622993e822411aa69f7bc8bd2f00c6467b04be708c9a1f8","observation_id":"a43d34f8-1843-4420-a877-dd568f13b7dc","resolution":{"observed_at":"2026-08-15T20:13:46.049395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.12932","last_updated":"2020-08-10T19:20:44Z","snapshot_observed_at":"2026-08-13T22:02:06.174751Z","submitted_at":"2020-07-25T13:50:00Z","title":"Non-parallel Emotion Conversion using a Deep-Generative Hybrid Network and an Adversarial Pair Discriminator","version":2},"cited_work":{"arxiv_id":"2007.12932","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.12932","snapshot_observed_at":"2026-08-15T20:13:47.129221Z","title":"Non-parallel Emotion Conversion using a Deep-Generative Hybrid Network and an Adversarial Pair Discriminator","venue":"eess.AS","work_id":"14cfb8d6-ec1c-4163-a246-3d12a2b6fc54","year":2020},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.107143Z"},"links":{"cited_paper":"/paper/2007.12932","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:71fd4394efe6aeccf665685fca5eb400b83f16b208e2873b35de8894c7320211","observation_id":"7f5725d5-c7bf-41ee-bc3f-4253e987efec","resolution":{"observed_at":"2026-08-15T20:13:47.135146Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:47.805213Z","title":"Emotional voice conversion using multitask learning with text-to-speech,","venue":null,"work_id":"be9416c1-e56b-474f-969c-c2113500fbb3","year":2020},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.156042Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:20b8fe4e3bca60abfcf2aa202ed77ed8d98d1538758a39fed1c12a67b0f63c9c","observation_id":"c66c6c6c-e88d-401a-be4f-c386f049d6e6","resolution":{"observed_at":"2026-08-15T20:13:47.886352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"cited_work":{"arxiv_id":"2505.13805","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13805","snapshot_observed_at":"2026-08-15T20:13:47.342474Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","venue":"cs.SD","work_id":"78e7950c-23e9-4308-859c-63ad0abb50b0","year":2025},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:45.498553Z"},"links":{"cited_paper":"/paper/2505.13805","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:561dfa9083d126782c356a5bcfd113a585a8cf63ac016cc66a18f9e030d9e7a6","observation_id":"18ec0fb6-68be-4911-9794-c4920a1846e6","resolution":{"observed_at":"2026-08-15T20:13:47.399807Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17508","last_updated":"2023-12-29T08:06:45Z","snapshot_observed_at":"2026-08-16T14:30:58.451122Z","submitted_at":"2023-12-29T08:06:45Z","title":"Attention-based Interactive Disentangling Network for Instance-level Emotional Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17508","snapshot_observed_at":"2026-08-15T20:13:46.218658Z","title":"Attention- based interactive disentangling network for instance-level emo- tional voice conversion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.218658Z"},"links":{"cited_paper":"/paper/2312.17508","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:5b2af307d1ca6b9f63ce0209db02ccf74035ce46b7c347f2ffd8c94530b81ea2","observation_id":"ee0fd1e1-347e-4c0a-96a4-1581b67766f6","resolution":{"observed_at":"2026-08-15T20:13:46.218658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14800","last_updated":"2024-07-20T08:13:58Z","snapshot_observed_at":"2026-08-16T13:32:31.819529Z","submitted_at":"2024-07-20T08:13:58Z","title":"Towards Realistic Emotional Voice Conversion using Controllable Emotional Intensity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14800","snapshot_observed_at":"2026-08-15T20:13:46.229017Z","title":"Towards realistic emotional voice conversion using controllable emotional intensity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.229017Z"},"links":{"cited_paper":"/paper/2407.14800","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:e3b979bff01f5e2baae41b2958feec03524f08fb8fee3c4df332d1163c4656b3","observation_id":"9d556e4e-b33c-4914-a42e-bdf1427f02a9","resolution":{"observed_at":"2026-08-15T20:13:46.229017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:46.316657Z","title":"Emotion intensity and its control for emotional voice conversion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.316657Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:ba343abe0c371dbdc4798ff970aed7c9bb5e5b4b589c105fae45d2704ca7309c","observation_id":"eda8fe2d-6d4e-47e0-a564-abf7164d6c1a","resolution":{"observed_at":"2026-08-15T20:13:46.316657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:46.337942Z","title":"To- ward any-to-any emotion voice conversion using disentangled dif- fusion framework,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.337942Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:a2e1d9a7f542d2f26d412a335f9cdb82dd5b05e9f021c72467da345997099be2","observation_id":"de4f306b-fbef-4b9d-b260-a03ce487a8d3","resolution":{"observed_at":"2026-08-15T20:13:46.337942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:47.639651Z","title":"Hybridformer: Improving squeezeformer with hybrid attention and nsr mecha- nism,","venue":null,"work_id":"2c14fcce-d875-4383-887e-a47f993b1b30","year":2023},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.342987Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:926941905cb615d62258b600084ea2ae5b42bae6d9c42201f9b55c758bc48b41","observation_id":"87b908d3-bc05-4ccb-92a5-a7a781e46890","resolution":{"observed_at":"2026-08-15T20:13:47.672151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04724","last_updated":"2024-12-10T05:52:28Z","snapshot_observed_at":"2026-08-16T13:00:31.714279Z","submitted_at":"2024-12-06T02:31:23Z","title":"StableVC: Style Controllable Zero-Shot Voice Conversion with Conditional Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04724","snapshot_observed_at":"2026-08-15T20:13:46.346843Z","title":"Sta- blevc: Style controllable zero-shot voice conversion with condi- tional flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.346843Z"},"links":{"cited_paper":"/paper/2412.04724","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:8d8033567bbb60669fcb0915aeb0a5bcd42bf8f478e82be361f0db3fc8425dae","observation_id":"3f78e272-81a0-4e33-a8ec-0120324f6373","resolution":{"observed_at":"2026-08-15T20:13:46.346843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02026","last_updated":"2025-08-10T04:48:33Z","snapshot_observed_at":"2026-08-16T13:03:12.968462Z","submitted_at":"2024-11-04T12:23:17Z","title":"Zero-Shot Voice Conversion via Content-Aware Timbre Ensemble and Conditional Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02026","snapshot_observed_at":"2026-08-15T20:13:46.457188Z","title":"Ctefm-vc: Zero-shot voice conversion based on content-aware timbre ensemble modeling and flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.457188Z"},"links":{"cited_paper":"/paper/2411.02026","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:21bf0775499698650c51c2a54214a751ef7f1b4f44bcbfc45b38a750031040d7","observation_id":"fcac195d-39af-48a9-8470-e423da9c24ec","resolution":{"observed_at":"2026-08-15T20:13:46.457188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-08-16T16:54:06.083594Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-15T20:13:46.462263Z","title":"Bigvgan: A universal neural vocoder with large-scale training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.462263Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:a44a9e9a8a3871b878159d811d28b3096f41bc127186055fdfb2d42a51a67f50","observation_id":"d8a77d93-ae6d-4436-84ee-fd87dfd2d419","resolution":{"observed_at":"2026-08-15T20:13:46.462263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:46.466574Z","title":"Clap learning audio concepts from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.466574Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:de8f2527fa1701703c238c157730bbcdb64e578abf56c4bba9ada3f7c3935a74","observation_id":"60b06010-5f73-406b-9a45-8a5e76942f93","resolution":{"observed_at":"2026-08-15T20:13:46.466574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:46.471290Z","title":"Gemo-clap: Gender-attribute-enhanced contrastive language- audio pretraining for accurate speech emotion recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.471290Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:719ee7e79f559bbcba8b6c116b7349023c92276ab564e010afaeacf1a0b5f975","observation_id":"f47d558e-0cda-4286-a880-dbe20b5016da","resolution":{"observed_at":"2026-08-15T20:13:46.471290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:46.569730Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.569730Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:b9c269a5a42053cc5b2de1c874659cdfa19c24574b9d849a8bf586687621bcdc","observation_id":"f8a13fed-b1f9-425f-958a-f2e2de5e6900","resolution":{"observed_at":"2026-08-15T20:13:46.569730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02116","last_updated":"2020-04-08T01:02:17Z","snapshot_observed_at":"2026-08-16T12:39:33.749100Z","submitted_at":"2019-11-05T22:42:00Z","title":"Unsupervised Cross-lingual Representation Learning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02116","snapshot_observed_at":"2026-08-15T20:13:46.608629Z","title":"Unsupervised cross-lingual representation learning at scale,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.608629Z"},"links":{"cited_paper":"/paper/1911.02116","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:8ea6504364ff143530b9f2f08437f13d2e3e9b3afe9e086c1c1d690b3274a198","observation_id":"25d12f18-ecc6-4787-bf02-9ed03b3b20d3","resolution":{"observed_at":"2026-08-15T20:13:46.608629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:47.545852Z","title":"Meta-stylespeech: Multi-speaker adaptive text-to-speech generation,","venue":null,"work_id":"aaf306fb-b9ce-4005-9886-677630a31a93","year":2021},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.613085Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:6e3a1c24cdcaf55ff91b4910fbe613b2f0f9e445cf3721177ac718d4e2affc5d","observation_id":"f7039d9a-33ef-4008-b2bc-6cc3986e72e5","resolution":{"observed_at":"2026-08-15T20:13:47.601158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:46.618221Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.618221Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:acf1babac778e6fc0a5add11f801d465712155bf8beedfd2de3ae00f39b46102","observation_id":"86b80600-f4a1-4adf-9fba-e1b2b416a31e","resolution":{"observed_at":"2026-08-15T20:13:46.618221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:46.750931Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.750931Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:17c2a800c776b9a75d08019f4c9f277945ca3d6d15e5af4543b65f1b213b6e26","observation_id":"1a256fe6-cb64-4b85-96aa-17964e925c52","resolution":{"observed_at":"2026-08-15T20:13:46.750931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:46.815744Z","title":"Film: Visual reasoning with a general conditioning layer,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.815744Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:886acbe640a8c46359ce186882d91672f74b44194c145ab719c7c175451db9b5","observation_id":"bd721654-28f8-4062-9e97-d1991f8419f9","resolution":{"observed_at":"2026-08-15T20:13:46.815744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01350","last_updated":"2025-01-10T05:35:32Z","snapshot_observed_at":"2026-08-16T13:13:27.200443Z","submitted_at":"2024-10-02T09:07:33Z","title":"Takin-VC: Expressive Zero-Shot Voice Conversion via Adaptive Hybrid Content Encoding and Enhanced Timbre Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01350","snapshot_observed_at":"2026-08-15T20:13:46.821102Z","title":"Takin-vc: Zero-shot voice conversion via jointly hy- brid content and memory-augmented context-aware timbre mod- eling,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.821102Z"},"links":{"cited_paper":"/paper/2410.01350","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:627ca4af3363b7eed2239ed558d8c2e40d477593185bc5f78b8d8ed18dea1931","observation_id":"895f996a-c5b1-4561-95c8-0133e93f0769","resolution":{"observed_at":"2026-08-15T20:13:46.821102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-16T20:32:52.299526Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-15T20:13:46.850108Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.850108Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:501b3d5bd832cbf3798e8b7a18f2f8aa4dbaa2a85b67aeb2928c9ec7b65132d4","observation_id":"4211e738-a583-401c-b5d9-771ac1f3df12","resolution":{"observed_at":"2026-08-15T20:13:46.850108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.16809","last_updated":"2021-06-09T05:17:55Z","snapshot_observed_at":"2026-08-16T18:34:56.899790Z","submitted_at":"2021-03-31T04:56:14Z","title":"Limited Data Emotional Voice Conversion Leveraging Text-to-Speech: Two-stage Sequence-to-Sequence Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.16809","snapshot_observed_at":"2026-08-15T20:13:46.872351Z","title":"Limited data emotional voice conversion leveraging text-to-speech: Two-stage sequence-to- sequence training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.872351Z"},"links":{"cited_paper":"/paper/2103.16809","citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:908faa9b7560936ce987ab65999ef301b8a6ca46e6b6c2cb1f0b73e6b4083d56","observation_id":"24ecd4be-fbc1-45e2-8776-e81bf6a49384","resolution":{"observed_at":"2026-08-15T20:13:46.872351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:13:47.424740Z","title":"Speech synthesis with mixed emotions,","venue":null,"work_id":"a5ad97ea-983f-4792-bddb-c91edf0fb87a","year":2022},"citing_paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:13:46.876521Z"},"links":{"citing_paper":"/paper/2505.13805"},"observation_digest":"sha256:4fec513313d82abd0cf932624b18002758aea6fcb9081d7a269fc9ccb5c3e5d3","observation_id":"ad3a691b-9d2c-41b3-9bd8-35d457b16ff0","resolution":{"observed_at":"2026-08-15T20:13:47.459852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.13805","last_updated":"2025-05-20T01:34:29Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T08:44:51.413799Z","submitted_at":"2025-05-20T01:34:29Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional Voice Conversion with Dual Control from Natural Language and Speech"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":4,"verified_fuzzy":11},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2505.13805."}