{"as_of":"2026-08-12T07:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3398bb39edf2987b35aa1631f94b9750e86f1a30cf9fe52da3291b7df521199b","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:06:08.843002Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T19:32:24.055265Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:21:12.229573Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12498","snapshot_observed_at":"2026-08-11T19:32:24.055265Z","title":"arXiv preprint arXiv:2412.12498","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2412.06602","last_updated":"2025-08-25T07:30:54Z","snapshot_observed_at":"2026-08-11T19:26:50.636660Z","submitted_at":"2024-12-09T15:50:25Z","title":"Towards Controllable Speech Synthesis in the Era of Large Language Models: A Systematic Survey","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T19:32:24.055265Z"},"links":{"cited_paper":"/paper/2412.12498","citing_paper":"/paper/2412.06602"},"observation_digest":"sha256:4bb32d0c930c7d19534f6e3e96bf27cb6e086355acfb6a38468d1afb5eba5559","observation_id":"99ae3806-5571-4a12-a529-2c9c05b018ec","resolution":{"observed_at":"2026-08-11T19:32:24.055265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"cited_work":{"arxiv_id":"2412.12498","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.12498","snapshot_observed_at":"2026-08-07T11:21:12.229573Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","venue":"cs.SD","work_id":"7e93314b-8382-4d9f-8a27-cb4427e71650","year":2024},"citing_paper":{"arxiv_id":"2506.02742","last_updated":"2025-06-03T10:59:22Z","snapshot_observed_at":"2026-08-11T02:46:58.961268Z","submitted_at":"2025-06-03T10:59:22Z","title":"Prompt-Unseen-Emotion: Zero-shot Expressive Speech Synthesis with Prompt-LLM Contextual Knowledge for Mixed Emotions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:21:09.698405Z"},"links":{"cited_paper":"/paper/2412.12498","citing_paper":"/paper/2506.02742"},"observation_digest":"sha256:5c24905805d8f340b64357e66daa0312653ddf099731eaddcd2820cb47ee003c","observation_id":"4473eeaa-47f2-4a02-bada-4098ec1aec00","resolution":{"observed_at":"2026-08-07T11:21:12.319458Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.12498/citation-record","integrity":"/paper/2412.12498/integrity","json":"/paper/2412.12498/citation-record.json","paper":"/paper/2412.12498"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.529362Z","title":"An overview of affective speech synthesis and conversion in the deep learning era,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.529362Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:51477ed09f81f1330ac3d8994960db5bd774ef39ecf60e32245b9633b80623e6","observation_id":"08d3e8ac-5307-4189-8835-5b7965c3d74e","resolution":{"observed_at":"2026-08-11T14:06:08.529362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.534138Z","title":"The age of artificial emotional intelligence,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.534138Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:517bd31ddcf908c64258027f3e2b840ee64beb264ea283aa650f6985acd9ccb8","observation_id":"7ea42af2-61d1-49a6-a472-6ccc45c4f23b","resolution":{"observed_at":"2026-08-11T14:06:08.534138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.537992Z","title":"Pittermann, A","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.537992Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:3cf4f14f4a7fbe3103f0e85658a43765d0a157d67aa345f893b8d380c84a4b3a","observation_id":"f5a65bdb-402c-4b67-8377-f3a677b3e779","resolution":{"observed_at":"2026-08-11T14:06:08.537992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.542142Z","title":"Emotion modelling for speech generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.542142Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:8a156c769b21261a2def50fe958aa94268f529a932f1e70c882b61595688f45a","observation_id":"de745932-fa9b-48d9-8ed3-98cb491f9fe0","resolution":{"observed_at":"2026-08-11T14:06:08.542142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.545989Z","title":"An overview of affective speech synthesis and conversion in the deep learning era,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.545989Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:1765c58a49bb6e156e9ac4466b8d047a2f674eb5981e095d5a779654794cbb6d","observation_id":"d8e9decb-2849-4676-b019-2d95944d4b8d","resolution":{"observed_at":"2026-08-11T14:06:08.545989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.554067Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.554067Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:ad7e6d272650520864c3f3a456f442280598cebc10de8d4d3b9b50a89ace7407","observation_id":"bbb3fce4-6774-4428-86de-191eef892933","resolution":{"observed_at":"2026-08-11T14:06:08.554067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.736287Z","title":"Phonetic enhanced language modeling for text-to-speech synthesis,","venue":null,"work_id":"96db5701-8f3c-425a-864a-85a3137e65a3","year":2024},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.557786Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:843ac51ff6ad599c54e1115a27b0c1e8fafe45d35de5187306872fd162e15bad","observation_id":"8566ab21-8c13-4f2a-8c06-cf4144af8221","resolution":{"observed_at":"2026-08-11T14:06:09.740594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.724902Z","title":"Text-to-speech for low-resource agglutinative language with morphology-aware language model pre-training,","venue":null,"work_id":"4c86c331-c0d5-4424-a3bc-2782f7eda4fe","year":2024},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.561903Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:b485ca60443e8fbe5db7d6cea56177d14456dc0a3866779180d28cf6d2e94a21","observation_id":"a7099819-e79b-4cad-a1d3-31fbe54e0631","resolution":{"observed_at":"2026-08-11T14:06:09.729060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.713053Z","title":"Emotional speech synthesis: A review,","venue":null,"work_id":"91c54757-07ce-4ca8-95ab-437655c41e3c","year":2001},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.565933Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:55d07847c0a369ca6a7d26a4a1c1cbdafcf2747cd7f1d250e4fd596a8465e76e","observation_id":"2bb81916-c203-42e1-9bbb-fdd053892d84","resolution":{"observed_at":"2026-08-11T14:06:09.718028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15561","last_updated":"2021-07-23T12:32:52Z","snapshot_observed_at":"2026-08-08T12:28:23.489422Z","submitted_at":"2021-06-29T16:50:51Z","title":"A Survey on Neural Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.15561","snapshot_observed_at":"2026-08-11T14:06:08.569719Z","title":"A survey on neural speech synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.569719Z"},"links":{"cited_paper":"/paper/2106.15561","citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:f4d887a15e130d6c82fe8550f9e25b4ed21e2abb36e4ff6004b42853aa863c35","observation_id":"1251d4f1-acd2-460b-87af-466245531d99","resolution":{"observed_at":"2026-08-11T14:06:08.569719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.701440Z","title":"Pragmatics and intonation,","venue":null,"work_id":"70675b14-c9c4-44f5-a9fa-d8c177932862","year":2004},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.574210Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:53c9543de5a380910a2a55e855014b0a4c8be906cbb8c828016ca5c130d3167b","observation_id":"d8e301cf-7f52-4092-9ec3-5cf01d6801e8","resolution":{"observed_at":"2026-08-11T14:06:09.705759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.688497Z","title":"Perception of affective and linguistic prosody: an ale meta-analysis of neuroimaging studies,","venue":null,"work_id":"715754a0-300e-4621-9285-e556cc5ba53b","year":2014},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.577953Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:71d47a92953de47849a380fd1da57b82ec70f620bffa3208d912c9633f023a5a","observation_id":"72648521-38b0-47c5-afc8-d4598095268d","resolution":{"observed_at":"2026-08-11T14:06:09.693377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.581669Z","title":"Laukka,Vocal Communication of Emotion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.581669Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:76b6dbab4d502f87c5d8f5353f5361fb4275d7ac6ca81e54fba898918c9356e1","observation_id":"0940779d-18ad-40c5-9d9c-a35dededc153","resolution":{"observed_at":"2026-08-11T14:06:08.581669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.677047Z","title":"Vaw-gan for disentanglement and recomposition of emotional elements in speech,","venue":null,"work_id":"f9c22f39-a644-46e2-b3f1-a42265e08da9","year":2021},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.585131Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:3f1af7e76b2ebb1122f40234368e0e6095f23ce67a76f4a35ab9195e73027978","observation_id":"553e88ce-f7e0-4a08-8928-aaea88dd6c48","resolution":{"observed_at":"2026-08-11T14:06:09.681139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.665636Z","title":"Converting anyone’s emotion: Towards speaker-independent emotional voice conversion,","venue":null,"work_id":"721dc700-96b6-4a90-bca5-7f7953a0ba34","year":2020},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.588437Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:7c6109297c1f648356abb6403cc2eb0e1f039fe7e8590496909f32100e47c1a5","observation_id":"86230675-45ef-4fb5-aef9-c97c60873202","resolution":{"observed_at":"2026-08-11T14:06:09.669949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.654211Z","title":"opensmile – the munich versatile and fast open-source audio feature extractor,","venue":null,"work_id":"97793b7b-4a27-4401-a519-0230227b7061","year":2010},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.591916Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:654f3fd5cc2af3ce3b2d67c7d822ef8651ac63be61da0b3297a98afbb747aa36","observation_id":"5cf6d6f2-b8ca-4c5c-b2c8-ae8e739f3d18","resolution":{"observed_at":"2026-08-11T14:06:09.658229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.643527Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation,","venue":null,"work_id":"07fcc3af-d6aa-4a6e-b57a-5d5c37e3a63c","year":2023},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.595316Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:4c57933e06af2fdd6a41dccd8b2e30b9d24e5c4f1212a41a59156aaef0cb5003","observation_id":"af631296-ce47-423f-8982-1fb9d22ec81a","resolution":{"observed_at":"2026-08-11T14:06:09.647402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.631496Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"56e6dd63-7c3c-40b4-9681-b2b5a3e233bb","year":2021},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.598849Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:207426368dc987b5ce3b566dcfdb35c688885c6a565c72824639d384da303ab0","observation_id":"f375cf66-d0ae-4c25-bd10-e11b0e70e90c","resolution":{"observed_at":"2026-08-11T14:06:09.636109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.619082Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"6ab0f4cd-196c-466f-881d-fae2e5742474","year":2021},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.602516Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:11c43f973098f2bccba0b5b3fa980d41e1843583bcd7ed9c1de7344e6d9ae857","observation_id":"6b3de789-6f1f-46f8-9513-141b08bd1b1d","resolution":{"observed_at":"2026-08-11T14:06:09.624187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.607317Z","title":"Emotion controllable speech synthesis using emotion-unlabeled dataset with the assistance of cross-domain speech emotion recognition,","venue":null,"work_id":"37462d45-bd76-4fac-90a0-bc0d8a75f209","year":2021},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.606036Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:db78f8f4bb01f8ce4cfc5a8945f39163e6eba39c3ca060cb1f32b99ae274b698","observation_id":"51bc479e-69e0-4c27-9e2d-5146282bcce9","resolution":{"observed_at":"2026-08-11T14:06:09.611419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.595592Z","title":"End-to-end emotional speech synthesis using style tokens and semi-supervised training,","venue":null,"work_id":"afa35f9b-3433-4f0c-af5f-c9daeadc51b6","year":2019},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.609465Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:cb7e94124bc979e23dae6bcaa8ec7532c6343fd0d660ebbd0ca088d3f45da351","observation_id":"b4b56386-85af-455d-b678-41e89379a2d3","resolution":{"observed_at":"2026-08-11T14:06:09.599773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.583457Z","title":"Controllable emotion transfer for end-to-end speech synthesis,","venue":null,"work_id":"0dcb9844-4e23-45e5-8f78-76a74b5677b7","year":2020},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.613031Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:d0548f0a51d959944f73347ad966f10ac1c436002ea6caff204e4e681b3db418","observation_id":"9e75c06d-5f43-4436-9fad-9df94ae907c3","resolution":{"observed_at":"2026-08-11T14:06:09.587506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.571934Z","title":"Semi-supervised learning for contin- uous emotional intensity controllable speech synthesis with disentangled representations,","venue":null,"work_id":"62b0db06-5e74-410d-9feb-6887eb1a1ab7","year":2023},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.616553Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:892def37fc991ef95d3ce593e204ac58f8ba9a0b0205971b4a1cc68ee05a09cb","observation_id":"fbf80c48-966e-4927-9fe7-771385373f4e","resolution":{"observed_at":"2026-08-11T14:06:09.576093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.559386Z","title":"iemotts: Toward robust cross-speaker emotion transfer and control for speech synthesis based on disentanglement between prosody and timbre,","venue":null,"work_id":"d299a06c-2fd5-4ab9-86f7-32c56b99dceb","year":2023},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.620007Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:41c03cfc32a82b5924877ef0e26a6558d4b1f5b455be389d85537c57077abc9f","observation_id":"58483e6a-fdcb-424b-8ea5-20ef5f380240","resolution":{"observed_at":"2026-08-11T14:06:09.563496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.547765Z","title":"Cross-speaker emotion disentangling and transfer for end-to-end speech synthesis,","venue":null,"work_id":"ab218eaf-4ff7-4d0c-8a41-a5f6bc98cab1","year":2022},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.623521Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:d6ab8b8e1140dffa0297a803692006128c5b1401782cef870cb341b9fb37a796","observation_id":"df59d7bb-c414-461c-930c-afd84cc6d1fb","resolution":{"observed_at":"2026-08-11T14:06:09.551617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.536590Z","title":"Relative attributes,","venue":null,"work_id":"ad47f7a9-1ac6-49c2-912d-0f3943778429","year":2011},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.626913Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:30af0f68a0695f967e5f9c877a0b5699e713f6a6342b97f2ebbd112f0ce96b50","observation_id":"1bd9a0a4-7126-4814-98ee-cc77c2016b49","resolution":{"observed_at":"2026-08-11T14:06:09.540602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.525308Z","title":"Emotion inten- sity and its control for emotional voice conversion,","venue":null,"work_id":"fb768466-89a7-450f-89e6-84ecd17f7391","year":2023},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.630492Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:846de6c37abfc1add54e474f50c5f757a911d6aef276cf70f32718f9edaa96d3","observation_id":"e53eaca7-7203-4ded-ae55-c3c69f3a4bfe","resolution":{"observed_at":"2026-08-11T14:06:09.529277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.512808Z","title":"Controlling emotion strength with relative attribute for end-to-end speech synthesis,","venue":null,"work_id":"8f3e4899-0678-45d4-87ed-6123a9b4cd05","year":2019},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.633927Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:8d7b33686fc1c0e22e6fdc4b30ce9e792addac79d9938af02c485f5891fbab4e","observation_id":"007f184e-c906-4cc2-8aea-4c71f99e0347","resolution":{"observed_at":"2026-08-11T14:06:09.517716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.501540Z","title":"Speech synthe- sis with mixed emotions,","venue":null,"work_id":"c52a9a8e-44a3-47d0-bcc2-b75dc37ffaf7","year":2023},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.637550Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:d04c81200b296106edb1ff31972ec9c257e54653a52214fe71d94c49ca5e8fd3","observation_id":"62d61b50-b565-476d-9b3f-ee3540482272","resolution":{"observed_at":"2026-08-11T14:06:09.505413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.489993Z","title":"Msemotts: Multi-scale emotion transfer, prediction, and control for emotional speech synthesis,","venue":null,"work_id":"337e01c3-cd1b-4110-b722-641ad64f7f88","year":2022},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.641090Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:cf9269f12d75d69cc7a0e042e46314f44937256ea68ad98ebf49782ad7289eb6","observation_id":"a7917f73-2356-4f6a-951d-d65bd4af3bd7","resolution":{"observed_at":"2026-08-11T14:06:09.494097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.478355Z","title":"Hierarchical emotion prediction and control in text-to-speech synthesis,","venue":null,"work_id":"d2fba5bc-759b-4103-ac84-2540f8a56d75","year":2024},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.644651Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:c5f5baec7c6f7d3da4a7d3d9a980fcf80bd6ffdfeb45af2e3386fe5b503c3b16","observation_id":"bd28a430-d85f-4c44-a79f-783e1804141a","resolution":{"observed_at":"2026-08-11T14:06:09.482373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.466085Z","title":"Fine-grained quantitative emotion editing for speech generation,","venue":null,"work_id":"2c49c804-cfa5-4ed1-a185-2da0bf80a0a0","year":null},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.648316Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:62ada28f772813d92cd687a573dc0249e5a34e6a7e5dc211e001cd4d4cc2ec23","observation_id":"29abbc49-652d-41bf-8193-ac8a04c500ec","resolution":{"observed_at":"2026-08-11T14:06:09.470470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-1-4614-5143-3","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.893554Z","title":null,"venue":null,"work_id":"9041b67f-287e-4dbf-ab17-b77f37ce1953","year":2013},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.656176Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:adf449e3837cd044a1678e1a236884c984369e760a96804ec57ea67bb94c9798","observation_id":"c6ec9f19-999d-4bc1-a840-16411c1d93cf","resolution":{"observed_at":"2026-08-11T14:06:08.897451Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.453956Z","title":"Transforming spectrum and prosody for emotional voice conversion with non-parallel training data,","venue":null,"work_id":"66ee20de-6242-473e-9459-255c69896dc0","year":2020},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.660221Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:ac77cc327551874cf37efec525e3e6b75604d3d7036852c726d751dd10d9cdfa","observation_id":"49a28819-f679-415d-a143-4435751171f9","resolution":{"observed_at":"2026-08-11T14:06:09.458206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.442176Z","title":"Intonation and emotion: Influence of pitch levels and contour type on creating emotions,","venue":null,"work_id":"2cb76b29-1b76-48c7-ae6f-3063a0b3e584","year":2011},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.664011Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:6ace4e593a457dc7e99fe6b263c2cf0bf293286a2038edcae3388a974c898eba","observation_id":"4e76db84-c4fc-481c-bb83-acf416247de6","resolution":{"observed_at":"2026-08-11T14:06:09.446239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.430282Z","title":"Norms of valence, arousal, and dominance for 13,915 english lemmas,","venue":null,"work_id":"09c0b694-5475-4c44-9a92-e4c9bd148c79","year":2013},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.667486Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:19a23f69360a2025410608a9daf44087daef691c86c25e55cd6cc8d3dbef8c4f","observation_id":"d171ff62-628a-42d7-a24d-56491c56f374","resolution":{"observed_at":"2026-08-11T14:06:09.434523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.417299Z","title":"The influence of pitch range, duration, amplitude and spectral features on the interpretation of the rise-fall-rise intonation contour in english,","venue":null,"work_id":"9265f849-8372-4fe3-b4c0-1cc371623e09","year":1992},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.671081Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:16855435a1268a205837d08ad8a39d28b011c8ecbd5c2b93af86820202bd99f9","observation_id":"7a113808-64e3-4cfd-94b5-99c826fbe3c7","resolution":{"observed_at":"2026-08-11T14:06:09.422051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.404162Z","title":"Using prosody to avoid ambiguity: Effects of speaker awareness and referential context,","venue":null,"work_id":"763a7351-3578-46f1-87c9-2e487c9eb14c","year":2003},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.674691Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:ae5ea592bf1a88cd808d0535b6d80a91d47687695965b7423506deee55324b54","observation_id":"74cbc6ab-b04a-4be1-8957-d538deadb96b","resolution":{"observed_at":"2026-08-11T14:06:09.408439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.392038Z","title":"Analysis of emotionally salient aspects of fundamental frequency for emotion detection,","venue":null,"work_id":"486a7b0b-3576-4b52-a3bb-f32afdd10ed1","year":2009},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.678149Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:30c552da48288e56f4a9a180cf3b1aa0dfec24b2cebfa105d57ff56b861dfd95","observation_id":"846906b9-1916-4720-af85-33c619be4bbb","resolution":{"observed_at":"2026-08-11T14:06:09.396219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.379547Z","title":"Survey on speech emotion recognition: Features, classification schemes, and databases,","venue":null,"work_id":"0cb4f50f-5f02-4bd7-8536-8cbd4269f031","year":2011},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.681733Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:9f567341b0650994b1be642252e3fdebc3a33e383f9a8ea1ef6e954079ad542d","observation_id":"6f37876d-3586-4f80-821e-57263b1036d0","resolution":{"observed_at":"2026-08-11T14:06:09.384194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1121/1.420109","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.879640Z","title":"Expression of emotional–motivational connotations with a one-word utterance,","venue":null,"work_id":"196b1712-75b6-4070-a15f-108a398af26e","year":1997},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.685558Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:0ca613eb529bb237a2e93d68c6aef474c011d153fdb2c5ab842bdf198923fb02","observation_id":"507fc731-cad1-408c-bd43-699b8498c694","resolution":{"observed_at":"2026-08-11T14:06:08.885442Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.367807Z","title":"Controllable accented text- to-speech synthesis with fine and coarse-grained intensity rendering,","venue":null,"work_id":"034c8966-0e79-449d-8e13-3418aa738409","year":2024},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.689285Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:5eb20a6a3f0394fadbf459b016ab02920a61e0e3a88c4c89d352e6cc924114c2","observation_id":"04ad7066-1700-451b-93f0-d389f3b42c8b","resolution":{"observed_at":"2026-08-11T14:06:09.372004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.355240Z","title":"Connecting cross-modal rep- resentations for compact and robust multimodal sentiment analysis with sentiment word substitution error,","venue":null,"work_id":"d302ee4b-94e7-4c9e-bc1e-cf59e8d531ff","year":2024},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.693128Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:91a85764a42056a719405569040b46013dbcdc3a96e0ba9363caf4c92926483c","observation_id":"3a71807e-85b6-4a64-acb3-087cbf41ba31","resolution":{"observed_at":"2026-08-11T14:06:09.359568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.697089Z","title":"Style tokens: Unsupervised style modeling, control and transfer in end-to-end speech synthesis,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.697089Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:a886a0789b1e2f70b682a6b8745b751048d1e92f4e50119788a7ffd1db53c6b7","observation_id":"7adf3645-7708-4a2d-9e70-c517a3ce8768","resolution":{"observed_at":"2026-08-11T14:06:08.697089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.334785Z","title":"Improve emotional speech synthesis quality by learning explicit and im- plicit representations with semi-supervised training","venue":null,"work_id":"ffa62b43-d6b3-4b43-b7f7-87f778d109a4","year":2022},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.700600Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:3d395afb530578310263dd65a926bb951fb54220e42021ae52f24cc9bc18317e","observation_id":"f055f3e1-1a1f-4e76-8ad5-c13e09ec8813","resolution":{"observed_at":"2026-08-11T14:06:09.339091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.322161Z","title":"Multi-speaker emotional speech synthesis with fine-grained prosody modeling,","venue":null,"work_id":"7e4694f4-009f-43b1-b118-a27a3cefe9ff","year":2021},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.704111Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:6249290844946067791e08974d0c491c8c774353fb813ba29e88c2fa1d33ed1e","observation_id":"18323115-3318-40cb-a572-c9f6c843ff6b","resolution":{"observed_at":"2026-08-11T14:06:09.326666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.308939Z","title":"Language model-based emotion prediction methods for emotional speech synthesis systems,","venue":null,"work_id":"44a85718-0199-4892-b8c6-e0c35f701bb8","year":2022},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.707638Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:d4e38c1a28c08daa683a5db2a94f9d76a0770f4c8e2354d99a61220057d89bca","observation_id":"3451055b-47ef-40eb-a121-e6c3f51d4ca1","resolution":{"observed_at":"2026-08-11T14:06:09.313000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.711157Z","title":"Fine-grained style modeling, transfer and prediction in text-to-speech synthesis via phone-level content-style disentanglement,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.711157Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:fd72ec5a94cd6172030fc45911d4cf6a373ce37313d534892b7fb8946fcaad9e","observation_id":"12a6575f-239c-484a-8120-57e33d627da4","resolution":{"observed_at":"2026-08-11T14:06:08.711157Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.296846Z","title":"Hierarchical multi-grained generative model for ex- pressive speech synthesis,","venue":null,"work_id":"453ac3e5-931d-4de9-95bd-dfc5f73d7b92","year":2021},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.714934Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:b100ad02d57fac1ae912f014d26c7a044d213e3967900243211e283114c8080a","observation_id":"ff31eb97-8b64-437d-9424-ac8e06022f16","resolution":{"observed_at":"2026-08-11T14:06:09.300941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.284644Z","title":"Towards multi-scale style control for expressive speech synthesis,","venue":null,"work_id":"0454d905-65e0-4f6f-810b-29122ff5e8e0","year":2021},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.718757Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:0bf766109f886ba2a0e11f6a6e516d02f14ec21a097152899135d285920e2abc","observation_id":"f030e8e2-866b-4215-9605-ade282db58e8","resolution":{"observed_at":"2026-08-11T14:06:09.289100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.272655Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":"434709cf-f595-4008-9c71-0b6c56c51f77","year":2021},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.722320Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:8b194c1bf0affc4686b7630786e5c4fce76fd137ec7f19986af6f4c010ad6c57","observation_id":"b9119c76-aa80-461b-b5eb-8da500f6d1df","resolution":{"observed_at":"2026-08-11T14:06:09.276828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.261015Z","title":"An emotion speech synthesis method based on vits,","venue":null,"work_id":"3ab6d447-c2eb-41bc-871a-cafef6774bb3","year":2023},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.725748Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:8d543c1e6349ca86b662ce42336a758d8144e1153cd0591ce668c5d18f170991","observation_id":"415ea64f-bcf3-4a3d-8b6d-6ca1ffc4c713","resolution":{"observed_at":"2026-08-11T14:06:09.265049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.729316Z","title":"Generative adversarial networks,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.729316Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:7ba1a8167de225ca6fbb2fc59e37dc360031107be173395c40dffdb29c67d02b","observation_id":"0da5d858-9530-45f4-9673-0adb61c6a828","resolution":{"observed_at":"2026-08-11T14:06:08.729316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.242289Z","title":"FastDiff 2: Revisiting and incorporating GANs and diffusion models in high-fidelity speech synthesis,","venue":null,"work_id":"4e48fc50-9f80-4a97-a955-f95c179c2730","year":2023},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.732675Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:d66267ad9cb03db425730129da918f4534d879ba0b5e79609382a112a3e0e998","observation_id":"890f59db-3461-4d35-81dc-43fdaa98605c","resolution":{"observed_at":"2026-08-11T14:06:09.246376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.230163Z","title":"Bddm: Bilateral denoising diffusion models for fast and high-quality speech synthesis,","venue":null,"work_id":"b8b5ed40-d3b8-41bd-9c84-dbf655cf2661","year":2022},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.736092Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:0f69533eff10ae4fe63c933ed23fd96782901fdbe2d02b7ccdb1ac82305f9cd0","observation_id":"04b22edc-df59-45d9-9737-0b869f81c49e","resolution":{"observed_at":"2026-08-11T14:06:09.234257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.217777Z","title":"Matcha-tts: A fast tts architecture with conditional flow matching,","venue":null,"work_id":"4b3dbb67-9fdb-442b-8f00-feb9938fb150","year":2024},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.739604Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:45dd2976bd1292a2a996e4c0ef7dff99c5a8c8933326f03b03ee170868b3ff6a","observation_id":"96ff01ce-bd93-44f2-8a9a-31ac9b5725e2","resolution":{"observed_at":"2026-08-11T14:06:09.221999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.743172Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.743172Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:6ad76c3ea3b9c4c38a7cd1934ba33c4756b32bead9847cd0e639fb8649f4610e","observation_id":"91f90457-53fd-40e5-b56e-c505c5bab4e0","resolution":{"observed_at":"2026-08-11T14:06:08.743172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.186562Z","title":"Seen and unseen emotional style transfer for voice conversion with a new emotional speech dataset,","venue":null,"work_id":"deb5b334-9cf6-4884-8db0-be0719846097","year":2021},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.752366Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:11ece97360a4fd87ed55324d29b95b44a08c1e6596148f9839caf807ea5099d9","observation_id":"e82fc72d-6b5d-42c9-b002-1ce0533b03ba","resolution":{"observed_at":"2026-08-11T14:06:09.190533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.174819Z","title":"Emotional voice conversion: Theory, databases and esd,","venue":null,"work_id":"7c9ab8fc-d87c-453c-855f-94de060d8d48","year":2022},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.755963Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:e62b5acb129f7b2b011bac501a2b5f67c4508dc8810ed965ea177126d6f222d5","observation_id":"e6c0991c-45fc-4f31-b163-f22bef0a4add","resolution":{"observed_at":"2026-08-11T14:06:09.179120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.759549Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.759549Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:8e1f41c943688923ed02d6417edb02cca6baae76267b2489907ed64f4745454b","observation_id":"d33e773c-9774-419f-8da0-05ba17a9d5b9","resolution":{"observed_at":"2026-08-11T14:06:08.759549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.156242Z","title":"Glow-tts: A generative flow for text-to-speech via monotonic alignment search,","venue":null,"work_id":"8f3ab191-ae8a-451e-9a01-f71899285a88","year":2020},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.763267Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:cf7ebdccd5c785d0c4ce95af4ce9817df96dda53e9dff9963e123b5822e992d3","observation_id":"813f499e-a0c9-4543-b437-e51b04cbfddc","resolution":{"observed_at":"2026-08-11T14:06:09.160130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.198215Z","title":"Generalized end-to-end loss for speaker verification,","venue":null,"work_id":"d2cb6bbc-0749-4215-85bf-41bb038db170","year":2020},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.766815Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:91e82d61de1aaa3d96bc692c4b7c38c62ecfbd249552aa68a00f85a24ea83e45","observation_id":"dba3efa7-c20e-480c-ba76-366bc30dde28","resolution":{"observed_at":"2026-08-11T14:06:09.202501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.144236Z","title":"V ocos: Closing the gap between time-domain and fourier- based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":"2fe98c9d-70b9-48ca-b7da-fbfb6e3b004f","year":2023},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.770234Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:8178ff029e3beaf4910d3c85d207d890d3b0fef3afd2f14047a5a1c5de3fd246","observation_id":"132e3ca8-96e5-4561-a8a9-7fec55ef931e","resolution":{"observed_at":"2026-08-11T14:06:09.148508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.773936Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.773936Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:44fccebab82137e826082d7799ef8ecc1700893140584decd0450a4d8eb26c87","observation_id":"f9939591-14e3-46db-9ec5-f21518a35f09","resolution":{"observed_at":"2026-08-11T14:06:08.773936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.777748Z","title":"Unsupervised domain adaptation by backpropagation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.777748Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:8aec119110a6c739fecd48b0ece29b114a0ecb8d643362a63b1f7f5be0b46ffb","observation_id":"753e61bd-483a-4493-8e97-ca4741da447b","resolution":{"observed_at":"2026-08-11T14:06:08.777748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.119405Z","title":"Adversarial domain generalized transformer for cross-corpus speech emotion recognition,","venue":null,"work_id":"f15e38d6-3c9c-4a17-9efc-03f4faa8a079","year":2024},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.781281Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:9b1423163ddea8c3709260517a8d91ba929759cfb1589f1038dc4d1eac12b4d7","observation_id":"a3b2ab0a-2312-4a12-9903-23778bf20223","resolution":{"observed_at":"2026-08-11T14:06:09.123636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.107107Z","title":"Mel-cepstral distance measure for objective speech qual- ity assessment,","venue":null,"work_id":"96a54d9b-5586-4efc-ad91-6ce7f8e786d0","year":1993},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.785019Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:35b9ee50d44779d32c10fbde906f8fec17ba524f279196ee617ad80cb3b8dfb6","observation_id":"f68cf9c0-3cba-4c10-b9e7-08500f99dc13","resolution":{"observed_at":"2026-08-11T14:06:09.111777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.094940Z","title":"3-d convolutional recurrent neural networks with attention model for speech emotion recognition,","venue":null,"work_id":"e84d4394-6d2e-4c06-88c1-64fb3e0306d5","year":2018},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.788524Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:0de0a3cb29ccc55b5f2bb65d3911ec1615baa5fdc4112cf382ffabb79cfe8b93","observation_id":"ea67377c-8dd6-4316-b004-1b36882f95a1","resolution":{"observed_at":"2026-08-11T14:06:09.099517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.792294Z","title":"Multi-conditioning and data augmentation using generative noise model for speech emotion recognition in noisy conditions,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.792294Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:e2a84ea08bc2b90ab7760d0bbd02a0432b32f84a5dc8f15789d67fb38d06bf65","observation_id":"c64804da-90f8-4de1-acfa-c3e2a175ff24","resolution":{"observed_at":"2026-08-11T14:06:08.792294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.076304Z","title":"Speech emotion recognition in noisy and reverberant environments,","venue":null,"work_id":"3210390e-7190-43d0-9162-fc8c79fb8b98","year":2017},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.795971Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:3fd5a7e5d4c486339abee56426cec541b4a559511735bcb9df6811811dd55382","observation_id":"27af8343-f844-40ba-8bd9-e22be958a71a","resolution":{"observed_at":"2026-08-11T14:06:09.080298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.064198Z","title":"Deep learning techniques for speech emotion recognition,","venue":null,"work_id":"be1e1225-7e5b-42e2-bdc7-ebb4c4952606","year":2022},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.799554Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:f09a82237b01e645ad7ffc167f5d1d7ab17187007c2e7984b7462cf818024a79","observation_id":"736ee137-ad4e-43ef-9ad9-991c1a8b1e36","resolution":{"observed_at":"2026-08-11T14:06:09.068317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.051258Z","title":"Improved emotion recognition using gaussian mixture model and extreme learning machine in speech and glottal signals,","venue":null,"work_id":"fa201ce2-8838-441b-baae-a1c79de5e0d9","year":2015},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.803083Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:f62faa9a8d6191b6524626c576978ef48e8d1fa7991208e2eadb4108b450cc11","observation_id":"a122c003-a410-4541-8099-139f18cbf217","resolution":{"observed_at":"2026-08-11T14:06:09.055938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.806926Z","title":"Specaugment: A simple data augmentation method for automatic speech recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.806926Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:d35090400557e2fa160d7ecec25a029781f2b9acd81ed8e4c18889c155cdca77","observation_id":"82bef523-36d6-4aa2-824a-553e97ed47a7","resolution":{"observed_at":"2026-08-11T14:06:08.806926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.032322Z","title":"Wespeaker: A research and production oriented speaker embedding learning toolkit,","venue":null,"work_id":"cf9ddbdf-056d-4691-989d-79faa9b8c182","year":2023},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.810492Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:2db7226ba4cc3c2917b397ebcc69850a64b8be62b8a0dc5425c9f0ee5973509a","observation_id":"75740fd4-f651-4a51-b9ef-0a835da7b6e3","resolution":{"observed_at":"2026-08-11T14:06:09.036690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-11T14:06:08.814123Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.814123Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:3a30b59d6e3e258f16849d578ebe9400c614f151bcdabe3255f5c7ba15e673ce","observation_id":"a6217b18-5345-455d-99fe-21903b1531c3","resolution":{"observed_at":"2026-08-11T14:06:08.814123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.020655Z","title":"Best-worst scaling more reliable than rating scales: A case study on sentiment intensity annotation,","venue":null,"work_id":"5d8a0740-d3bd-4327-ba04-3482bb283b34","year":2017},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.818127Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:f958603d25ecfdd4869ffa400105d45b0bdc2d735ae1098fc9935a221c8034eb","observation_id":"8fa8ec19-2b99-47ff-a705-448931d98a54","resolution":{"observed_at":"2026-08-11T14:06:09.024616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.009548Z","title":"Measuring disentanglement: A review of metrics,","venue":null,"work_id":"9553a56a-7c1a-4eb7-8ec5-503148cef252","year":2020},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.821706Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:3448e5890ffa1321c6887d7692abe4f71f901b8184b87a53a270b6e7036b35ee","observation_id":"bdd7e523-0143-4a73-8f5d-990a8eaa6e35","resolution":{"observed_at":"2026-08-11T14:06:09.013442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.997237Z","title":"Isolating sources of disentanglement in vaes,","venue":null,"work_id":"e42f8827-ed07-4143-bcca-101dc29c4f9c","year":2018},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.825361Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:9f85b850c7126a6328d388db858fff10597d9358bb3ce479efe90327e003408b","observation_id":"e5f835b3-95da-444b-81f4-e42c7df6c66e","resolution":{"observed_at":"2026-08-11T14:06:09.001787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.985506Z","title":"A framework for the quantitative evaluation of disentangled representations,","venue":null,"work_id":"0356b91b-2ec1-4393-8f85-030fdf0a1aef","year":2018},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.829068Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:84c273ef3c723e21535a8902570a5bb9f8ac19dbee74e41161ca29edbfba64ca","observation_id":"a51c0188-1dce-41ab-9916-5432d91f5b93","resolution":{"observed_at":"2026-08-11T14:06:08.989499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.973691Z","title":"Learning deep disentangled embeddings with the f-statistic loss,","venue":null,"work_id":"4df85cb5-72ca-48a4-8aef-73b47048c561","year":2018},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.832368Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:ff7210532166a6168c7329b6f86008f8b8ebbfcdd10a91a72e6be24eb184587a","observation_id":"aae9dfeb-e6b1-4f37-8c91-5e959dccd5d8","resolution":{"observed_at":"2026-08-11T14:06:08.977717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.835917Z","title":"Speech emotion recognition: Two decades in a nutshell, benchmarks, and ongoing trends,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.835917Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:08406569a041535ce03d37c37cfda91be0be8fa83b0c3bf5cedc861636ea6432","observation_id":"2007afa7-cd4a-4a23-8ff2-adc7d7eea17f","resolution":{"observed_at":"2026-08-11T14:06:08.835917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.839539Z","title":"Dawn of the transformer era in speech emotion recognition: Closing the valence gap,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.839539Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:9479b7093e338eb9eeb84a9ef6e11f390dfe827b14b894be21efa80e3625ea19","observation_id":"7058b55d-b386-4746-87bc-7f3790192bbd","resolution":{"observed_at":"2026-08-11T14:06:08.839539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:08.947836Z","title":"Contrastive learn- ing based modality-invariant feature acquisition for robust multimodal emotion recognition with missing modalities,","venue":null,"work_id":"4d82ca1d-cba2-494a-bfd6-516a7176dec1","year":2020},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.843002Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:d4b6ece746c64c51a1640e11c27ff334b8ed86c7283e3e119dbd623f29c28805","observation_id":"77a008ac-5af3-470c-9ab4-4fc7747fd84a","resolution":{"observed_at":"2026-08-11T14:06:08.951996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:06:09.755530Z","title":"Available: https://api.semanticscholar.org/CorpusID: 252762216","venue":null,"work_id":"cae230d6-8408-4cbe-ba14-adffff21c9d0","year":null},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.550085Z"},"links":{"citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:e5943bd9d66964ff5761d331da39ea8efe3bfbcb6dd98cbcac852862dd59c20c","observation_id":"ebcb22a9-6a66-4103-b963-4c4c2beeed13","resolution":{"observed_at":"2026-08-11T14:06:09.759306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02002","last_updated":"2024-09-29T15:39:17Z","snapshot_observed_at":"2026-08-12T04:59:42.784568Z","submitted_at":"2024-03-04T12:53:15Z","title":"Fine-Grained Quantitative Emotion Editing for Speech Generation","version":2},"cited_work":{"arxiv_id":"2403.02002","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.02002","snapshot_observed_at":"2026-08-11T14:06:08.925047Z","title":"Fine-Grained Quantitative Emotion Editing for Speech Generation","venue":"cs.SD","work_id":"75a72292-c7f4-4b1f-8903-22c36c5e9772","year":2024},"citing_paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T14:06:08.652070Z"},"links":{"cited_paper":"/paper/2403.02002","citing_paper":"/paper/2412.12498"},"observation_digest":"sha256:c9b0440b032cfe823a2c2363b00b2100564a04c5c2fcd03aaca3688b91e7d359","observation_id":"de2b0f40-376a-4d8e-8abf-e3ef02beb990","resolution":{"observed_at":"2026-08-11T14:06:08.929237Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.12498","last_updated":"2025-06-22T16:51:47Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-11T13:59:15.293616Z","submitted_at":"2024-12-17T03:02:05Z","title":"Hierarchical Control of Emotion Rendering in Speech Synthesis"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":19,"verified_exact":2,"verified_fuzzy":62},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 2 inbound Pith citation observations for arXiv:2412.12498."}