{"as_of":"2026-08-15T09:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:90549106fae4af53aaa5bb8e5eca0d6a0dd6ec31577756b7b05ac7c3f087a21b","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:09:35.082934Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:09:34.920841Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T16:08:37.819812Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06276","snapshot_observed_at":"2026-08-10T21:09:34.920841Z","title":"PromptTTS [15] introduces a style encoder trained on ’style prompts’, natural language descriptions of desired speaking styles","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.920841Z"},"links":{"cited_paper":"/paper/2501.06276","citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:388da9b878464c7877ebcf90d46dd16b40e4fed58377cb58a0147dfb2c9644f8","observation_id":"a4491153-9b71-43eb-8361-b68bab420ec7","resolution":{"observed_at":"2026-08-10T21:09:34.920841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"cited_work":{"arxiv_id":"2501.06276","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06276","snapshot_observed_at":"2026-07-03T16:08:37.819812Z","title":"Zhang, A","venue":null,"work_id":"6e1619bf-f11e-4a19-9517-710d0878ae0d","year":2025},"citing_paper":{"arxiv_id":"2511.20657","last_updated":"2026-05-02T12:09:38Z","snapshot_observed_at":"2026-08-13T15:15:19.905394Z","submitted_at":"2025-10-11T07:40:36Z","title":"Intelligent Agents with Emotional Intelligence: Current Trends, Challenges, and Future Prospects","version":2},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-05-18T08:11:31.181704Z"},"links":{"cited_paper":"/paper/2501.06276","citing_paper":"/paper/2511.20657"},"observation_digest":"sha256:f649ef4c3ef9f893b89387baca5fef4bf0fe7017b16216ae55eedd2395d777d1","observation_id":"596feb8c-5bfb-4a1f-86f2-051aa62c4a9a","resolution":{"observed_at":"2026-05-18T08:12:30.260198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"cited_work":{"arxiv_id":"2501.06276","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06276","snapshot_observed_at":"2026-07-03T16:08:37.819812Z","title":"Zhang, A","venue":null,"work_id":"6e1619bf-f11e-4a19-9517-710d0878ae0d","year":2025},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-14T18:50:35.916149Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"cited_paper":"/paper/2501.06276","citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:acbca6444d93a65ae29f408c7ebffebe8be2f2c696916f18c9db8c6fd673d763","observation_id":"404d4c5d-a7f2-4f4c-8bca-76eff04cbb5a","resolution":{"observed_at":"2026-07-03T16:08:37.821400Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.06276/citation-record","integrity":"/paper/2501.06276/integrity","json":"/paper/2501.06276/citation-record.json","paper":"/paper/2501.06276"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.559877Z","title":null,"venue":null,"work_id":"f01f207b-362c-4189-a757-bf9756bb25a8","year":null},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.915567Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:636e349454c538d466c9dab754035fdeb728420a5bad2bfc58a235c7045924a8","observation_id":"ae09bece-a7cd-4d03-a640-8fc3ab0ff7cb","resolution":{"observed_at":"2026-08-10T21:09:35.564020Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06276","snapshot_observed_at":"2026-08-10T21:09:34.920841Z","title":"PromptTTS [15] introduces a style encoder trained on ’style prompts’, natural language descriptions of desired speaking styles","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.920841Z"},"links":{"cited_paper":"/paper/2501.06276","citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:388da9b878464c7877ebcf90d46dd16b40e4fed58377cb58a0147dfb2c9644f8","observation_id":"a4491153-9b71-43eb-8361-b68bab420ec7","resolution":{"observed_at":"2026-08-10T21:09:34.920841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.547270Z","title":"Initially, we pre-train a multispeaker English TTS backbone model uti- lizing a large publicly accessible dataset","venue":null,"work_id":"95cc98e0-035f-4752-a4f6-e71cada1b8e5","year":null},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.925804Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:9b7b6f39ae56c3a5467b28f683cfd2e9128665e2c4beb9e13dced9c0a53a32e4","observation_id":"a4e8761a-f39a-4a1a-bd6c-1cd9b5819efe","resolution":{"observed_at":"2026-08-10T21:09:35.551954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.522722Z","title":"Baselines and Datasets We utilize the LibriTTS [28] for pretraining, which includes 33, 236 training samples (equating to 53.78 hours) collected from 247 speakers","venue":null,"work_id":"45e8c47c-38a6-49f9-8ae5-bf1eb1d68fae","year":null},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.934269Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:c780ba6180bc86326ad7dc6b52a5b2fae508137e2452689e058c4b4287ddc470","observation_id":"28294d3a-8f25-45e5-8e5b-169636cb96ff","resolution":{"observed_at":"2026-08-10T21:09:35.527205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.511111Z","title":"Objective Evaluation To assess synthesized speech expressiveness, we analyze emo- tion recognition across different models","venue":null,"work_id":"173e8bb2-ba0d-462c-94a6-4c52d5c4c5e1","year":null},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.938291Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:f526ec0c934e641fde26b36dcdf8b56277e7ed39f3be08ae99ba3f3461204e07","observation_id":"f9a1b84b-2917-4371-b561-17c8f575e5aa","resolution":{"observed_at":"2026-08-10T21:09:35.515164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.500112Z","title":null,"venue":null,"work_id":"283bf300-6cc1-4473-ae85-dea6e296bf22","year":null},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.942387Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:71e266dd471f1831c38e3ae561b4dd7bc7446e454f2576d6bc9e24dec2a608ea","observation_id":"9ea96620-6330-4c69-9261-a154450227ab","resolution":{"observed_at":"2026-08-10T21:09:35.503840Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.440307Z","title":"Multi- speaker expressive speech synthesis via multiple factors decou- pling,","venue":null,"work_id":"cbbf3b02-e71d-487f-9177-768566b34097","year":2023},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.969860Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:1657b7d444c693b0c7527aed81cbb8a6ccdd1e67e618573542c42ee90527f2b3","observation_id":"ec112fbb-13c0-4a28-b8b7-2c43f7111a50","resolution":{"observed_at":"2026-08-10T21:09:35.445273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.488775Z","title":"A review of deep learning techniques for speech processing,","venue":null,"work_id":"73d013fc-6ed7-4107-98da-b930b0c7b3ad","year":2023},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.946189Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:7debc8a96e5b911ea36da74f5d5ec4d1613c89494db8583763ebc92ea68b54ba","observation_id":"49bb835a-2999-479a-8c7c-c9865de43a80","resolution":{"observed_at":"2026-08-10T21:09:35.492681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-14T02:11:04.009144Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-10T21:09:34.949717Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.949717Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:62ee36d9b24338e0895251f7bb22fedd96a8a4a46268f0f0ad63ab30357fb76b","observation_id":"304b3469-c214-49b8-b21e-bf8811bbf1c3","resolution":{"observed_at":"2026-08-10T21:09:34.949717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:34.953521Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.953521Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:b9c394c52df5bfce35c891b9a4b00c274ceec971e569682501a848d79ad58c93","observation_id":"1918cb47-b0eb-41d2-90e0-1ba2df8db0be","resolution":{"observed_at":"2026-08-10T21:09:34.953521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.470938Z","title":"Expressive speech synthesis: a review,","venue":null,"work_id":"bfddce0c-9729-4006-804f-78b5d1e3311b","year":2013},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.957779Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:e0ef07a2a49b8f20f1f51f0528cb8adb0aa7c93990b5d8ab4b3f207dfceddd49","observation_id":"6b4dce59-35db-4191-ad7e-d00eed9c84ca","resolution":{"observed_at":"2026-08-10T21:09:35.475270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:34.961669Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.961669Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:8c4e99787c3ce21f0e14312671b1bcbd6bfc7f9cc49010d0da23b7e7ed43b990","observation_id":"1773c3ea-f87f-4015-96e4-324cc75fc722","resolution":{"observed_at":"2026-08-10T21:09:34.961669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.453153Z","title":"Msstyletts: Multi-scale style modeling with hierarchical context information for expressive speech synthesis,","venue":null,"work_id":"4678a208-f1c8-461c-a62e-04294efe0544","year":2023},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.965764Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:7d950b8131f1f74a11b6af0a0ea51795770bec7922647b5b21cd16592550580c","observation_id":"22dcde4a-6bc9-45a8-8df5-d8a63b7a8ec0","resolution":{"observed_at":"2026-08-10T21:09:35.457079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:34.995520Z","title":"Style tokens: Un- supervised style modeling, control and transfer in end-to-end speech synthesis,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.995520Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:d3b20097a865e0c2ea2bc0fe993e84c4f8dff1e4497fe6f9ac8ec17cb872e0fe","observation_id":"171976f6-926b-42ec-ac39-073b22a02913","resolution":{"observed_at":"2026-08-10T21:09:34.995520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.428262Z","title":"Ensemble prosody prediction for expressive speech synthesis,","venue":null,"work_id":"bec64394-5d77-4cc4-ba55-5e251c9c009f","year":2023},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.973993Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:ee987d04aff0620b5d7822024267e6e791a7839038336ca48082aefb26fd80d2","observation_id":"fb79fcc9-ca34-49e8-bc8b-7c603abeecbd","resolution":{"observed_at":"2026-08-10T21:09:35.432987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.416039Z","title":"An overview of affective speech synthesis and conversion in the deep learning era,","venue":null,"work_id":"ce84ca8b-da4a-46fc-944a-c905707a433e","year":2023},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.977259Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:812a1295980ba82fef4a61bd21a8a5a5b811419a37da469c0e96f566d78209f2","observation_id":"e22642a2-96e3-4976-ad94-0c22a55faee0","resolution":{"observed_at":"2026-08-10T21:09:35.420498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:34.980661Z","title":"Prosody-tts: An end-to-end speech synthesis system with prosody control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.980661Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:4874d07500c006532cab9fa830a1df98373b93b50f1a6b22457e283705622946","observation_id":"1a956523-08bd-488b-8c75-57f198143293","resolution":{"observed_at":"2026-08-10T21:09:34.980661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.398174Z","title":"Speech Synthesis with Self-Supervisedly Learnt Prosodic Representations,","venue":null,"work_id":"200eb4a3-c545-4d2f-9266-3b4814430bea","year":2023},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.984093Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:3be68ce802ecefcba68f0fb6fefdd3c9477c08ff9176e223b7713e3f3b1c2101","observation_id":"22757c72-eb71-40d1-ad12-f7f566e29cd9","resolution":{"observed_at":"2026-08-10T21:09:35.402116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.388025Z","title":"Exploiting emotion information in speaker em- beddings for expressive text-to-speech,","venue":null,"work_id":"4d8f80bb-2ecb-44bf-91ea-09a60421d600","year":2023},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.987587Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:751b7bf757ec6f6ccba232fe14be27c7de936f625db6dcbede91cfd469abe884","observation_id":"fbf42999-012e-4ed7-9534-969779d28c25","resolution":{"observed_at":"2026-08-10T21:09:35.391318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.377637Z","title":"EmoMix: Emotion Mixing via Diffusion Models for Emotional Speech Syn- thesis,","venue":null,"work_id":"72443828-0648-4149-be76-9436210d640a","year":2023},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.991073Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:3f09abfb3e64d34c4e6f98f500514f2483b86b9f29df6bb40ba8e62cb8bc76e8","observation_id":"435a2ef0-aca9-4e44-8be1-67bc8d8d5223","resolution":{"observed_at":"2026-08-10T21:09:35.381236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.304290Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"71dce16d-31bb-4811-87ed-2c69eeb97e80","year":2020},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.023124Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:28151278928b1b0013b35dc0e9d8652ed9de6454db6dccfd230b95c75204b72f","observation_id":"44ef7b31-f0db-49b0-b167-98dcaefe20d1","resolution":{"observed_at":"2026-08-10T21:09:35.308417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:34.999491Z","title":"Prompttts: Control- lable text-to-speech with text descriptions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.999491Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:a6d3e11c1459b2bb39d75dd61b4c6cf7f4ec7b487579e5b557b5c2f4a599edbe","observation_id":"960dc8a4-2ea3-47fa-90a3-4a4a4d0ac8a8","resolution":{"observed_at":"2026-08-10T21:09:34.999491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.535057Z","title":"We intend to improve upon the algorithm proposed in [23] for predicting emotion intensity levels using a multispeaker emotive speech dataset","venue":null,"work_id":"a92147e4-7d20-40cb-adf5-e59409fb6dde","year":null},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:34.929998Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:beab7392dfbc94ab3f2cb5e0696bf86b7d5c5b6855f5281a755d1832ea48d19c","observation_id":"7cb87d6c-6670-4bc8-aa3b-1bac18fe59d6","resolution":{"observed_at":"2026-08-10T21:09:35.539109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.352149Z","title":"Controllable speaking styles using a large language model,","venue":null,"work_id":"d37864f5-c62b-4b94-aa6a-1d085c75afbd","year":2023},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.003413Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:bc60b66202d363d299ad339881e69c85b8aab1f04fe8a622323fe788a5ce96e1","observation_id":"ee9f89f8-5449-4ff9-8744-ab3313cd80af","resolution":{"observed_at":"2026-08-10T21:09:35.357008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.340221Z","title":"Emodiff: Intensity con- trollable emotional text-to-speech with soft-label guidance,","venue":null,"work_id":"94ed9ee0-2aee-430a-8971-71deeb923683","year":2023},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.007091Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:c6292f6fa4867f2567bd9247ab45c9b26ea67646db9e74e62e9f4f1fb11fe73e","observation_id":"fbc63428-e708-4095-a5cc-30197bd47213","resolution":{"observed_at":"2026-08-10T21:09:35.344939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.327930Z","title":"Fine-grained quantitative emotion editing for speech generation,","venue":null,"work_id":"36d97733-0185-4949-ac4b-727f996c0e6d","year":2024},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.010668Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:beceb9d17551e0b964ff7833a6b550cd49e056901ff99441406d41ca142dc255","observation_id":"845a4112-e8c3-4d00-a9f5-27441f69db91","resolution":{"observed_at":"2026-08-10T21:09:35.333132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.315742Z","title":"Train- ing language models to follow instructions with human feedback,","venue":null,"work_id":"82e71525-2a6d-43a0-b943-945394d4b17a","year":2022},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.014195Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:4913d2188437bf9f07f71d6e734bf1cc2c0c64cc099945953de10c0ff9d701d6","observation_id":"c8c9ac93-f5ed-4e8f-8254-f0a9bf0fdcbd","resolution":{"observed_at":"2026-08-10T21:09:35.320058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13662","last_updated":"2023-06-25T11:42:52Z","snapshot_observed_at":"2026-08-13T12:54:19.561672Z","submitted_at":"2023-01-31T14:26:52Z","title":"InstructTTS: Modelling Expressive TTS in Discrete Latent Space with Natural Language Style Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13662","snapshot_observed_at":"2026-08-10T21:09:35.018333Z","title":"Instructtts: Modelling expressive tts in discrete latent space with natural language style prompt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.018333Z"},"links":{"cited_paper":"/paper/2301.13662","citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:ce5c353fd9a862a69226cbdcc1f9a03906bd30c65c2e19762570b8c3fe3b592b","observation_id":"247c7768-c071-4474-85a1-1ce7ff51ca9c","resolution":{"observed_at":"2026-08-10T21:09:35.018333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.028120Z","title":"Hubert: Self-supervised speech rep- resentation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.028120Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:3814800f4991d65a3833fd1345a08d8b8bec102d30085e6321d16fbdb73be6f4","observation_id":"b88e0b78-3d9d-436f-b3f1-680243dad3f6","resolution":{"observed_at":"2026-08-10T21:09:35.028120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.284491Z","title":"Emotion intensity and its control for emotional voice conversion,","venue":null,"work_id":"635510ce-797c-496b-a8ba-de3cef797fdb","year":2022},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.031787Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:0b7451e2f8e285b937ab60ea3e17ce1f515307a1a441dbe062d96a8672fe4964","observation_id":"860ced15-bb13-4538-b808-ec87e987fb56","resolution":{"observed_at":"2026-08-10T21:09:35.288765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.273135Z","title":"Learning visual attributes,","venue":null,"work_id":"fdd905b4-f514-440e-8109-e87119f79a96","year":2007},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.035454Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:7598ff80093fe519995904fbc661f09aab4e475a405609fa3a67c47387d8af57","observation_id":"d85ad086-acba-49c4-af5e-db3e5c0e9f64","resolution":{"observed_at":"2026-08-10T21:09:35.276915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.260311Z","title":"opensmile: The mu- nich versatile and fast open-source audio feature extractor,","venue":null,"work_id":"5097f8f2-47d2-460a-82f4-4f6683df1128","year":2010},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.039142Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:ea7044b68018104425e1a32b15f9238e508329260438e62a14ced2c9da5db92d","observation_id":"373f9213-95bb-42a0-b293-98f84ffc3ef0","resolution":{"observed_at":"2026-08-10T21:09:35.264947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.247003Z","title":"Relative attributes,","venue":null,"work_id":"ae4f7439-2de9-41df-962f-b6c1862d491b","year":2011},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.042771Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:1c151d0b02e660cb011de70498b6d368a23e23723e506cdec6238811ba2a7a8a","observation_id":"8ff08090-d94e-4596-ab52-f61aab1eedaa","resolution":{"observed_at":"2026-08-10T21:09:35.251963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.235679Z","title":"Gpt-4 system card,","venue":null,"work_id":"6fcd55fd-1aed-4158-809a-b92af756fa83","year":2023},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.046239Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:db4f34b9a4bad586ccf92201bf348abbbc22435f8f3895c45a02f0b10cb7f318","observation_id":"742f6c2b-7447-41d3-9f2a-d10af22316f0","resolution":{"observed_at":"2026-08-10T21:09:35.239664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-14T16:51:22.656133Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-10T21:09:35.050554Z","title":"Libritts: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.050554Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:73d3f6344eb121091f41d95a43a6620e93da7f26705a73587805621c57b5de02","observation_id":"1e54675a-d36e-441c-be70-3ced3c72c5c1","resolution":{"observed_at":"2026-08-10T21:09:35.050554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.02271","last_updated":"2022-04-05T18:06:21Z","snapshot_observed_at":"2026-08-13T18:33:55.190081Z","submitted_at":"2021-08-04T20:13:00Z","title":"Daft-Exprt: Cross-Speaker Prosody Transfer on Any Text for Expressive Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.02271","snapshot_observed_at":"2026-08-10T21:09:35.054553Z","title":"Daft-exprt: Cross-speaker prosody transfer on any text for expressive speech synthesis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.054553Z"},"links":{"cited_paper":"/paper/2108.02271","citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:f159d115f59b374513cc1bd90f9d42f97f2cd24ae6742367d22735a95c24f73d","observation_id":"f911a4dd-66ad-4704-a1b0-8f257ba21694","resolution":{"observed_at":"2026-08-10T21:09:35.054553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.223142Z","title":"ubisoft-laforge-daft-exprt,","venue":null,"work_id":"a66f9f02-c6a0-4c88-9101-510e2c692232","year":2021},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.059519Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:b6c35f4b9b4e0be984f1828726c433a8457fa754100bd7cec55d363cd214fc54","observation_id":"345a9f60-4e17-407f-b52c-a48cfe91c329","resolution":{"observed_at":"2026-08-10T21:09:35.227120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.063108Z","title":"Generalized end-to-end loss for speaker verification,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.063108Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:e1269d674c7c69641af2b7b17609fdda7568874a3e1e084047d0b0b863f930b4","observation_id":"9b38db95-e8b5-4448-a571-ca6750f7bec0","resolution":{"observed_at":"2026-08-10T21:09:35.063108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.203651Z","title":"Hubert-base,","venue":null,"work_id":"34785795-1a80-4eaf-a012-06dca7e721f9","year":2021},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.067053Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:95502d7fcfa4ce204615e106e734a7c39f9c17c006a35f109c830c25d4b04eff","observation_id":"38bb2fbf-e097-4d0b-ac8b-a839e2f6fb03","resolution":{"observed_at":"2026-08-10T21:09:35.207952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.192474Z","title":"Synthesizer voice qual- ity of new languages calibrated with mean mel cepstral distor- tion","venue":null,"work_id":"10b56e64-125b-4be5-9b9a-3c301885f453","year":2008},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.070693Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:e5f611fd4dc4f7976c151d1db0c94fedbf40d142e0c39973bb32477ba7adb580","observation_id":"881ad810-739b-4073-92b1-e5e29258e8b6","resolution":{"observed_at":"2026-08-10T21:09:35.196402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.075180Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.075180Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:d19ced380cef73245a34c3ac38f957b3105d9590bd6f0de21f4820ccd52a413d","observation_id":"90936019-a344-4f86-90ec-6b831b620153","resolution":{"observed_at":"2026-08-10T21:09:35.075180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.174588Z","title":"Mean opinion score (mos) revisited: Methods and applications, limitations and alter- natives,","venue":null,"work_id":"cf95aada-8063-4e6d-87f6-31791a8616c2","year":2016},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.079283Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:b2baf8a84ba2a6af78042bc95ba52a8771f0fad009a6fbcebf78adcd52aeb863","observation_id":"3615b9af-3e54-4f7b-a0ad-3b6a80c95031","resolution":{"observed_at":"2026-08-10T21:09:35.178593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:09:35.160995Z","title":"Fine-grained emotional control of text-to-speech: Learning to rank inter-and intra- class emotion intensities,","venue":null,"work_id":"8e3d3008-a506-476b-9a60-18fee0c7cced","year":2023},"citing_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:35.082934Z"},"links":{"citing_paper":"/paper/2501.06276"},"observation_digest":"sha256:9c23c759477c2c789dc11dd7b4968909fe98ae36ee95e2f81f5b742297802e44","observation_id":"acd42077-81cd-427b-a8e4-c0bb04f4ef43","resolution":{"observed_at":"2026-08-10T21:09:35.166810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T15:16:15.139371Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 3 inbound Pith citation observations for arXiv:2501.06276."}