{"as_of":"2026-08-20T14:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:774ab9df277851902839814b0fcaf3809a86a1776813d26ce256299eb26a7991","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:34:43.671787Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T15:21:28.848595Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T09:11:27.116919Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"cited_work":{"arxiv_id":"2508.06890","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06890","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maestro-evc: Control- lable emotional voice conversion guided by references and explicit prosody","venue":null,"work_id":"22423099-a7f7-4f79-b5da-58c03cdc5b1b","year":2025},"citing_paper":{"arxiv_id":"2604.26347","last_updated":"2026-07-22T04:43:04Z","snapshot_observed_at":"2026-08-11T14:30:40.389564Z","submitted_at":"2026-04-29T06:59:48Z","title":"The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-07T12:34:40.888089Z"},"links":{"cited_paper":"/paper/2508.06890","citing_paper":"/paper/2604.26347"},"observation_digest":"sha256:72b079b074c10adb3180a8773dd43665e40f4d7a1771802b828f4f51a87a0e50","observation_id":"eddc379d-1f05-4fca-a08a-7a160911202c","resolution":{"observed_at":"2026-05-12T09:11:27.119312Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06890","snapshot_observed_at":"2026-08-02T15:21:28.848595Z","title":"Maestro-evc: Control- lable emotional voice conversion guided by references and explicit prosody,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26347","last_updated":"2026-07-22T04:43:04Z","snapshot_observed_at":"2026-08-11T14:30:40.389564Z","submitted_at":"2026-04-29T06:59:48Z","title":"The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T15:21:28.848595Z"},"links":{"cited_paper":"/paper/2508.06890","citing_paper":"/paper/2604.26347"},"observation_digest":"sha256:5ff5fcebc74b1ec53082f0f51546d1d424678ab8715f03788a5b8f206be32a3c","observation_id":"0bae5d3c-20b9-4be2-9f76-b6bed6dfe19f","resolution":{"observed_at":"2026-08-02T15:21:28.848595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.06890/citation-record","integrity":"/paper/2508.06890/integrity","json":"/paper/2508.06890/citation-record.json","paper":"/paper/2508.06890"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:47.449314Z","title":"Emotional voice conversion: Theory, databases and esd,","venue":null,"work_id":"fa576abb-e83f-4e94-a623-caa764f7da11","year":2022},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.120573Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:22cc2439651b4580f69d11d4cf1978e04edf78d6d1a0fad97379910a7e2357cf","observation_id":"20926e1c-a02b-4a11-8558-dec56b9999a8","resolution":{"observed_at":"2026-08-05T22:34:47.562774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:47.223551Z","title":"Training socially engaging robots: Modeling backchannel behaviors with batch reinforce- ment learning,","venue":null,"work_id":"348d0423-3e83-4476-9fe6-86b3f30ea2bc","year":2022},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.210040Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:bc7d7c9188e0bd8949523f57fb8fec8f8e2ea7912d9bdaa417ca36f8ccb62625","observation_id":"9875e92b-cf54-4384-84e3-fa3d1fe0ddf1","resolution":{"observed_at":"2026-08-05T22:34:47.302187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:47.044124Z","title":"Real-time speech emotion analysis for smart home assistants,","venue":null,"work_id":"f2af7018-0d4a-4037-aa2e-9fe957f8bff6","year":2021},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.279725Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:2982c74b407215df518114cc51b5aebedfedf5dab3a5f163decc5995e3689afd","observation_id":"569bbde1-c154-4d48-a233-e9dd585397c9","resolution":{"observed_at":"2026-08-05T22:34:47.140382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:46.829855Z","title":"Pittermann, A","venue":null,"work_id":"f8001ea9-4af0-42b2-a71b-e7c240f68f88","year":2010},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.356713Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:2fcf04940c086422bb058aab7b5dc25738ecab909e1db02153edbb37113b874b","observation_id":"799fd7fa-82b8-47cf-bfe5-052bae3554bf","resolution":{"observed_at":"2026-08-05T22:34:46.934170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:46.615315Z","title":"Toward artificial emotional intelligence for cooperative social human–machine interaction,","venue":null,"work_id":"3287cc7a-45ac-40e3-81de-184c271c8589","year":2019},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.416266Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:9994d33b9805ad21cc5d7660234ac5d7ce4f98685a464ae8fcbf3d708801f474","observation_id":"8056ebe5-a7fe-434a-88d9-2bf869e08d2b","resolution":{"observed_at":"2026-08-05T22:34:46.714801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:46.432182Z","title":"Pavits: Exploring prosody-aware vits for end-to-end emotional voice conversion,","venue":null,"work_id":"c6153727-09aa-4e50-ad13-9eac660f1bfc","year":2024},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.491550Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:de8e786fbb395b98616dc204d7c97b3d80fa1eeeadffbe3eed3404aba376fb8a","observation_id":"d084a43a-46cc-4540-9571-8507a4873817","resolution":{"observed_at":"2026-08-05T22:34:46.519963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07025","last_updated":"2020-10-13T06:07:16Z","snapshot_observed_at":"2026-08-18T12:16:59.316216Z","submitted_at":"2020-05-13T13:36:34Z","title":"Converting Anyone's Emotion: Towards Speaker-Independent Emotional Voice Conversion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07025","snapshot_observed_at":"2026-08-05T22:34:41.548368Z","title":"Converting anyone’s emotion: Towards speaker-independent emotional voice conversion,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.548368Z"},"links":{"cited_paper":"/paper/2005.07025","citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:64bb5d595bed5f78a71b0e7b640a7af959b2cc9fa863e0125315ea76261174d6","observation_id":"96917dc9-93b3-41d0-8a24-bdb7d82010c2","resolution":{"observed_at":"2026-08-05T22:34:41.548368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.16809","last_updated":"2021-06-09T05:17:55Z","snapshot_observed_at":"2026-08-16T18:34:56.899790Z","submitted_at":"2021-03-31T04:56:14Z","title":"Limited Data Emotional Voice Conversion Leveraging Text-to-Speech: Two-stage Sequence-to-Sequence Training","version":2},"cited_work":{"arxiv_id":"2103.16809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.16809","snapshot_observed_at":"2026-08-05T22:34:43.980348Z","title":"Limited Data Emotional Voice Conversion Leveraging Text-to-Speech: Two-stage Sequence-to-Sequence Training","venue":"cs.CL","work_id":"72259b49-1df0-443e-976f-3f4b4a551323","year":2021},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.607221Z"},"links":{"cited_paper":"/paper/2103.16809","citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:53468bd6bcd3a54fef2d216eeb0a645e806cdb185171a77f9e15c77ab4fea237","observation_id":"ad683cd8-97c3-4caa-a811-83c1199a57a7","resolution":{"observed_at":"2026-08-05T22:34:44.023541Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:46.265583Z","title":"Emotion inten- sity and its control for emotional voice conversion,","venue":null,"work_id":"4ced290d-3c10-4e97-965f-0c704bdab580","year":2022},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.694838Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:32dbb31b4540e04dbde608ade6922bf7e14b5a9b16d47ab004443455fed9d4e1","observation_id":"aad03414-d5f0-44cd-9fcf-45afb8ed88bf","resolution":{"observed_at":"2026-08-05T22:34:46.358372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:46.132504Z","title":"Seen and unseen emotional style transfer for voice conversion with a new emotional speech dataset,","venue":null,"work_id":"5419a400-365c-4acc-af3c-06e1cf60409e","year":2021},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.760599Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:b16ae07ad8323564a36d041696573d82a7db38ec70c96556f782db388286b49d","observation_id":"6b2b43b0-48cb-49d9-9acc-10fe9346ae3e","resolution":{"observed_at":"2026-08-05T22:34:46.193432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:45.923402Z","title":"Emotional voice conversion with semi-supervised generative modeling,","venue":null,"work_id":"4dde3828-8c48-48af-9a21-4627205036f2","year":2023},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.783931Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:6a2b09f1ae6a325ae0c59ea9fdbbd5dee0621be6070ac84479720126556761f7","observation_id":"211ee3b7-2bc4-4751-9f7a-1e7d739a6f16","resolution":{"observed_at":"2026-08-05T22:34:46.024775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:45.768100Z","title":"Speaker-independent emotional voice conversion via disentangled rep- resentations,","venue":null,"work_id":"b4ba684a-c848-4dac-8eb2-dc68b103dee3","year":2022},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.859084Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:8845e452479aeeb3749edcc5dd36f7cad02f0476f411698aa0b7dac7fc56b632","observation_id":"7bd4e329-4d2b-4c5a-909d-00d088e033f0","resolution":{"observed_at":"2026-08-05T22:34:45.844240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:45.573074Z","title":"Nonparallel emotional voice conversion for unseen speaker-emotion pairs using dual domain adversarial network & virtual domain pairing,","venue":null,"work_id":"eb9a8f6a-b7c3-43f5-9bec-cc870e7cf725","year":2023},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.941417Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:0470222b6cb17d1723d734c25086f63d466b4e516743603568d01584abc399fd","observation_id":"e9bc8915-48d1-43f4-8959-3a690a7847f4","resolution":{"observed_at":"2026-08-05T22:34:45.664702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:45.376774Z","title":"Enhancing zero- shot emotional voice conversion via speaker adaptation and duration prediction,","venue":null,"work_id":"d6274dc7-1144-477c-9300-9ae13b07114b","year":2025},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.000189Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:33b1ee91bbdc16f1cf899bf81f2c4b47256b0c280fa3c42617f15789ce4bd17c","observation_id":"ba414906-ff95-4c66-8f02-5c0bf5a27a81","resolution":{"observed_at":"2026-08-05T22:34:45.493477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:45.123529Z","title":"Zero shot audio to audio emotion trans- fer with speaker disentanglement,","venue":null,"work_id":"27fae8dc-8283-4cca-a1f9-2b272c1c0b14","year":2024},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.115007Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:be9ec702cc84c43ccf7945a539ff2a12552273472bfc5b7f6ff9aeff2322157d","observation_id":"20bdcbc9-46bd-41a1-b92b-881aaaa60d92","resolution":{"observed_at":"2026-08-05T22:34:45.240270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:44.915319Z","title":"Multi-speaker emotional speech synthesis with fine-grained prosody modeling,","venue":null,"work_id":"0200c187-9104-4963-819c-d241929ff831","year":2021},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.182480Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:3c2703aa24d3b473f6c38bcc8a8f9b2a3a76758222607536f01535d966087bc6","observation_id":"100315df-b02e-4db2-aff9-654018ffebb6","resolution":{"observed_at":"2026-08-05T22:34:45.027825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:42.258853Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.258853Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:6ba59eab17fed1aa2e639503b67f922cf6e59e454f03bdc608103ad620f3e199","observation_id":"9f1cda4b-3ec9-4fe2-86f8-a70cf40257b4","resolution":{"observed_at":"2026-08-05T22:34:42.258853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:42.325027Z","title":"Unsupervised domain adaptation by back- propagation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.325027Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:d78d5d3c58cf3f7f022cbd74ffc0c2a586f19291d8fe8577b16dc9a3489d5bf8","observation_id":"a11c8ce5-6338-410c-bcf9-cee006ee5a8a","resolution":{"observed_at":"2026-08-05T22:34:42.325027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:42.391019Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.391019Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:3e5ce346a066e41120e4827946b1add2a4c7e6178408ea54136a0c0ecaaba4f9","observation_id":"bf6675bf-e40a-4b2a-8e66-d8c90f8f04e5","resolution":{"observed_at":"2026-08-05T22:34:42.391019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:44.732342Z","title":"Sef-vc: Speaker embedding free zero-shot voice conversion with cross attention,","venue":null,"work_id":"07cb163e-57d9-416d-b48a-5097cd17e7e2","year":2024},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.453515Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:97ebac4e9727390a35649f1f47ce232e787a645d297659ad03c249751fee485f","observation_id":"801da7cb-fa6c-41af-8f11-f25e6968e1ea","resolution":{"observed_at":"2026-08-05T22:34:44.833308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07402","last_updated":"2022-12-13T14:12:02Z","snapshot_observed_at":"2026-08-18T20:20:15.374358Z","submitted_at":"2021-11-14T18:16:42Z","title":"Textless Speech Emotion Conversion using Discrete and Decomposed Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07402","snapshot_observed_at":"2026-08-05T22:34:42.520181Z","title":"Textless speech emotion conversion using discrete and decomposed representations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.520181Z"},"links":{"cited_paper":"/paper/2111.07402","citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:ab20fc4aab28b77a19580fb12104549e557f31d8b4d1f17e5ef7216ba6fed149","observation_id":"be03c332-48be-41df-aaaf-f72c62f3b4fe","resolution":{"observed_at":"2026-08-05T22:34:42.520181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:42.593208Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.593208Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:db59d989920f0e289f0b7ac04689f88b0cb8d8a400677f613f17b60325dd8cd0","observation_id":"fb2b3f2e-cacf-44d5-b267-4036f96cc59d","resolution":{"observed_at":"2026-08-05T22:34:42.593208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:44.544544Z","title":"Speech emotion diarization: Which emotion appears when?","venue":null,"work_id":"562b8436-5a96-4f32-95fa-ccac6abc9e51","year":2023},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.701389Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:43ebb4a93eef3437d7f7a69cd130c0b092c5dbc7cb4c92ce46f54b2d1a3b1e02","observation_id":"00cac1e2-1a7e-484f-9e59-5dc1273d5a1d","resolution":{"observed_at":"2026-08-05T22:34:44.612588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:44.467693Z","title":"Smoothing and differentiation of data by simplified least squares procedures","venue":null,"work_id":"07167e6d-3648-451a-a3f9-0678be818a51","year":1964},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.785584Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:5f367da3024f8198fdfcdbc495f4f855cd15d37b55c0de011214963a0d7a679d","observation_id":"4643191f-1620-45d5-be46-ab5cccd2a862","resolution":{"observed_at":"2026-08-05T22:34:44.501286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.10326","last_updated":"2022-07-21T05:10:48Z","snapshot_observed_at":"2026-08-16T17:48:00.738437Z","submitted_at":"2021-10-20T00:49:02Z","title":"Disentanglement of Emotional Style and Speaker Identity for Expressive Voice Conversion","version":2},"cited_work":{"arxiv_id":"2110.10326","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.10326","snapshot_observed_at":"2026-08-05T22:34:43.796835Z","title":"Disentanglement of Emotional Style and Speaker Identity for Expressive Voice Conversion","venue":"eess.AS","work_id":"4b925393-4c97-46c0-bd15-1ccc08117e51","year":2021},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.870526Z"},"links":{"cited_paper":"/paper/2110.10326","citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:45169b32a7bdd9f086230c1166b04275ec77973c070fd488d92cb4b179f9f4ab","observation_id":"9b6dc289-b4f0-4549-9aa6-dc52a1638dda","resolution":{"observed_at":"2026-08-05T22:34:43.870586Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-16T12:49:35.884517Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-05T22:34:42.929455Z","title":"Ecapa-tdnn: Em- phasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.929455Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:2f76ca50e80e568f88cad59bb54ec254f5a86425b3d6c30cf7caeab61ef4213b","observation_id":"a65bb56f-2d89-4a1d-acc0-5cc8eac11491","resolution":{"observed_at":"2026-08-05T22:34:42.929455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:42.988717Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.988717Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:6a4c1475fa3f2ae2aaa3d1102fa347af8f565a02015de872327dbc8fc2789c99","observation_id":"0a3eed7f-de8c-4bad-a880-dc9c14addb56","resolution":{"observed_at":"2026-08-05T22:34:42.988717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-18T23:33:12.915054Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-08-05T22:34:43.077499Z","title":"V oxceleb: a large-scale speaker identification dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.077499Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:cae2aa56eb3b252f0157323d84cd7cdfdf1952086ca0d2a5da66234e674bfcad","observation_id":"8194931f-49f6-4562-b8c8-9f7815849fbf","resolution":{"observed_at":"2026-08-05T22:34:43.077499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:43.132364Z","title":"World: a vocoder-based high-quality speech synthesis system for real-time applications,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.132364Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:d2c5366cfb04614a8797c18bea03793214a6b510577dd6e444bbebe1223fc010","observation_id":"e316a941-445a-4437-aca8-b5ff72e5b0ce","resolution":{"observed_at":"2026-08-05T22:34:43.132364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:44.312862Z","title":"CSTR VCTK Corpus: English multi-speaker corpus for CSTR voice cloning toolkit,","venue":null,"work_id":"2dd08430-b755-4328-be93-2f2b5848be81","year":2017},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.226294Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:c4d81aad4caa9af4968dcf9eda5d9c5a6e67fdbc6323c600033a6cbad7f00cb8","observation_id":"8545e167-d0ec-48e0-8495-0f55808c1266","resolution":{"observed_at":"2026-08-05T22:34:44.378234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:43.313933Z","title":"Crema-d: Crowd-sourced emotional multimodal actors dataset,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.313933Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:99502558e614f1440fa9fdc1ecc4c74b364215195c58a270265fd6d34e2f244b","observation_id":"6e0497cd-f0cf-4150-acd0-997ad90397e5","resolution":{"observed_at":"2026-08-05T22:34:43.313933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:43.377951Z","title":"Iemocap: Interactive emotional dyadic motion capture database,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.377951Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:2d5961464552f6108fa69fc51a18107041a3772aaf883275da176cc8550e0339","observation_id":"f8e74ea5-68c6-46db-b60d-59dcc73f5f55","resolution":{"observed_at":"2026-08-05T22:34:43.377951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:43.467839Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.467839Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:ebf09982603c7c0cdc9abb8506a3f5ec9acab4567591883c1fb0da849be11fd0","observation_id":"76398b06-ef06-4cd6-8449-401c4d65e55c","resolution":{"observed_at":"2026-08-05T22:34:43.467839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-18T15:57:37.984685Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-05T22:34:43.524538Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.524538Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:5f7bf5fc5b21122456c20593629c303a1a5f01d02649f7972c80091c87623128","observation_id":"f5dcc674-87c2-4a7e-a7b8-417df35ec02d","resolution":{"observed_at":"2026-08-05T22:34:43.524538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:43.593809Z","title":"Pearson correlation coefficient,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.593809Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:2d1f3930cbcaa8b9aecc260823ad62977cb263b94c7f72aec270326e9b06a4b4","observation_id":"806a96a9-e1d7-4f86-9e2e-4f1b10d5b70f","resolution":{"observed_at":"2026-08-05T22:34:43.593809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:44.144966Z","title":"Dynamic time warping,","venue":null,"work_id":"756bd6ab-d09b-4c52-bba9-6288afe63606","year":2007},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.671787Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:77e981c83e1dcc46549d79da4db3700575d90e22caca03aae8d2198e3c8369bd","observation_id":"b15cd2ad-0f72-4282-99ab-f5e65f92e585","resolution":{"observed_at":"2026-08-05T22:34:44.198017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T04:59:12.556698Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":2,"verified_fuzzy":19},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 2 inbound Pith citation observations for arXiv:2508.06890."}