{"as_of":"2026-08-11T01:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:44827a5a3fa2ee92848e2271023f45d7d27ed1142ae6d446e8c617a7421eda9c","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:55:03.611900Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T15:21:28.820442Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T09:11:27.121428Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"cited_work":{"arxiv_id":"2507.04349","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04349","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tts-ctrlnet: Time varying emotion aligned text-to-speech generation with controlnet","venue":null,"work_id":"4c6754ed-b89b-4c8e-bc76-36244ea93b33","year":2025},"citing_paper":{"arxiv_id":"2604.26347","last_updated":"2026-07-22T04:43:04Z","snapshot_observed_at":"2026-08-02T15:21:28.271483Z","submitted_at":"2026-04-29T06:59:48Z","title":"The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-07T12:34:40.888089Z"},"links":{"cited_paper":"/paper/2507.04349","citing_paper":"/paper/2604.26347"},"observation_digest":"sha256:da23a4d3cbb612af254263905478ffd0157bdb95b9ec5518f5ae2ad07246046f","observation_id":"440da532-b107-4cfc-b485-61e310bb88d9","resolution":{"observed_at":"2026-05-12T09:11:27.124142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04349","snapshot_observed_at":"2026-08-02T15:21:28.820442Z","title":"Tts-ctrlnet: Time varying emotion aligned text-to-speech generation with controlnet,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26347","last_updated":"2026-07-22T04:43:04Z","snapshot_observed_at":"2026-08-02T15:21:28.271483Z","submitted_at":"2026-04-29T06:59:48Z","title":"The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T15:21:28.820442Z"},"links":{"cited_paper":"/paper/2507.04349","citing_paper":"/paper/2604.26347"},"observation_digest":"sha256:7e4c81d80f26b8961bf471a99773db8428ac4fc213362e8e5f6ad7af6276707e","observation_id":"a0b54a62-c850-489d-8430-cbcb74ef4ad6","resolution":{"observed_at":"2026-08-02T15:21:28.820442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04349/citation-record","integrity":"/paper/2507.04349/integrity","json":"/paper/2507.04349/citation-record.json","paper":"/paper/2507.04349"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.05543","last_updated":"2023-11-26T22:26:12Z","snapshot_observed_at":"2026-08-04T15:27:22.366324Z","submitted_at":"2023-02-10T23:12:37Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05543","snapshot_observed_at":"2026-08-06T19:55:02.241628Z","title":"Adding conditional control to text-to-image diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:02.241628Z"},"links":{"cited_paper":"/paper/2302.05543","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:81859c5a2c16d3c988b4d32b2576a0b369ad60df1d5887f25110d5aa1329a45b","observation_id":"f5764825-324b-4fac-a39b-750df4887754","resolution":{"observed_at":"2026-08-06T19:55:02.241628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.327855Z","title":"An emotion speech synthesis method based on VITS","venue":null,"work_id":"06f8535f-1231-436c-a808-c37a5264cfab","year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:02.318699Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:d817279b3bf4113f6e435499c84e8932f83b4fc2def69b078a7e0469781b8515","observation_id":"e546cec3-0c0f-4291-8e58-d3284f1384f9","resolution":{"observed_at":"2026-08-06T19:55:04.445789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.255965Z","title":"V oiceBox: Text-guided multilingual universal speech generation at scale","venue":null,"work_id":"83252476-12f1-4c8d-9c5e-4c259b0dad00","year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:02.438700Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:fd549cfb430ad22169ca8fe01bdc2839bb24c1ded0996eb96d3fcf64a920fa6a","observation_id":"208baeef-84d1-4e7c-9ac4-f08ed652bcc1","resolution":{"observed_at":"2026-08-06T19:55:04.309106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07383","last_updated":"2024-03-04T19:15:29Z","snapshot_observed_at":"2026-08-08T09:24:37.491001Z","submitted_at":"2024-02-12T02:58:10Z","title":"Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07383","snapshot_observed_at":"2026-08-06T19:55:02.574535Z","title":"Making flow-matching-based zero-shot text-to-speech laugh as you like","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:02.574535Z"},"links":{"cited_paper":"/paper/2402.07383","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:247d84fe35d3e0bd5d00627a6bec554f3671def59a01788bef028fa560374a7a","observation_id":"c7f1d86e-2076-4a00-a0eb-69b5d39e2ef9","resolution":{"observed_at":"2026-08-06T19:55:02.574535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.098383Z","title":"E2 tts: Embarrass- ingly easy fully non-autoregressive zero-shot tts","venue":null,"work_id":"d2ec905a-b560-433b-a798-d7ed83fe6bb0","year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:02.684793Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:c3f2d74c6c14b6e5328acc4dbf3dc0b84870ba42000b41788744a341adcd1aaa","observation_id":"44608682-5498-460d-a2ca-1803573f58dd","resolution":{"observed_at":"2026-08-06T19:55:04.144160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-06T19:55:02.966453Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:02.966453Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:04802b401e6be8ba2a3c955e8943a16632064ce088939efedb9ac3169e1e55bf","observation_id":"2c96ced3-fec9-4a79-bac3-b9a38325340c","resolution":{"observed_at":"2026-08-06T19:55:02.966453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.10135","last_updated":"2017-04-06T21:20:34Z","snapshot_observed_at":"2026-08-05T15:51:16.043022Z","submitted_at":"2017-03-29T16:55:13Z","title":"Tacotron: Towards End-to-End Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.10135","snapshot_observed_at":"2026-08-06T19:55:03.102660Z","title":"Tacotron: Towards end-to-end speech synthesis","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.102660Z"},"links":{"cited_paper":"/paper/1703.10135","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:a8af9ced433958c8e2b6fbcddde57bafe5f1d053db386a7065eaa89c011d0889","observation_id":"29734753-f174-4dcb-b602-7a45227fba33","resolution":{"observed_at":"2026-08-06T19:55:03.102660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.137493Z","title":"Fastspeech: Fast, robust and controllable text to speech","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.137493Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:c78be4b3f3dc06d2cd6a3b03cc323a49c603c6cfd9b89d63d33f0b91383bde81","observation_id":"9f6c56d8-d55d-4ea0-acde-d94a900578f6","resolution":{"observed_at":"2026-08-06T19:55:03.137493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08166","last_updated":"2024-01-16T07:13:16Z","snapshot_observed_at":"2026-08-06T00:01:14.217961Z","submitted_at":"2024-01-16T07:13:16Z","title":"ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08166","snapshot_observed_at":"2026-08-06T19:55:03.233086Z","title":"ED-TTS: Multi-scale emo- tion modeling using cross-domain emotion diarization for emotional speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.233086Z"},"links":{"cited_paper":"/paper/2401.08166","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:cee0e1886eca1339e28daa14561e988b9c0dfe1b38621b61f39b753cb57c5fe8","observation_id":"300d42a3-b2bf-4d08-a03f-d3579d2f27cf","resolution":{"observed_at":"2026-08-06T19:55:03.233086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.083810Z","title":"EmoDiff: Intensity controllable emotional text-to-speech with soft-label guidance","venue":null,"work_id":"29a768de-48a6-4574-beb5-915416faf932","year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.346441Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:483da3c0e54659df352cf4ca800b55d8740827d58a9450cee962a411b1854593","observation_id":"b1df3dc2-cdee-42ec-a9e5-05ede80647d4","resolution":{"observed_at":"2026-08-06T19:55:04.086938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00648","last_updated":"2023-06-01T13:14:56Z","snapshot_observed_at":"2026-08-10T23:35:43.453162Z","submitted_at":"2023-06-01T13:14:56Z","title":"EmoMix: Emotion Mixing via Diffusion Models for Emotional Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00648","snapshot_observed_at":"2026-08-06T19:55:03.419208Z","title":"EmoMix: Emotion mixing via diffusion models for emotional speech synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.419208Z"},"links":{"cited_paper":"/paper/2306.00648","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:4cff667177da573c59cce8168366c0f0f6a499a7b7e0454f4a31c93aa1dd2862","observation_id":"aa2deb88-4ce8-4e88-be3e-a9407cfa5235","resolution":{"observed_at":"2026-08-06T19:55:03.419208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.071263Z","title":"Speech synthesis with mixed emotions","venue":null,"work_id":"03e11889-733a-47fd-b96f-c86ade703874","year":2022},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.483681Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:90557070bc70fb230b9fca9eecc3ad2534b1e570e3d4409e9e1dbef1ee1f6876","observation_id":"366e1ecd-8c4f-4c60-a42c-bed69eb75c84","resolution":{"observed_at":"2026-08-06T19:55:04.076900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.059744Z","title":"QI-TTS: Questioning intonation control for emotional speech synthesis","venue":null,"work_id":"c116fd7d-0dad-4978-bf63-34b3b056b769","year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.518055Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:1b09d4d852657da7e9f22b64b7a1439c1fd73a2e4aa0aec912c0c1a61bc8c181","observation_id":"26020b9b-e846-477d-b112-66bafcc54e32","resolution":{"observed_at":"2026-08-06T19:55:04.064363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.048728Z","title":"MsEmoTTS: Multi-scale emotion transfer, prediction, and control for emotional speech synthesis","venue":null,"work_id":"1945f16c-1ab2-45e1-b42a-af6bb33f05b2","year":2022},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.523695Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:9a0ca94ad32960496f44fe921278e31fd15040186646ee437c59517fc7d3d5c5","observation_id":"abe66048-9699-43e9-95d5-3f7a7d3ee0f5","resolution":{"observed_at":"2026-08-06T19:55:04.053177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06000","last_updated":"2022-07-13T07:05:44Z","snapshot_observed_at":"2026-08-10T11:08:16.164642Z","submitted_at":"2022-07-13T07:05:44Z","title":"Text-driven Emotional Style Control and Cross-speaker Style Transfer in Neural TTS","version":1},"cited_work":{"arxiv_id":"2207.06000","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.06000","snapshot_observed_at":"2026-08-06T19:55:03.850763Z","title":"Text-driven Emotional Style Control and Cross-speaker Style Transfer in Neural TTS","venue":"cs.CL","work_id":"3a7dcf72-6f8f-47e3-9397-c9cce232d47d","year":2022},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.526791Z"},"links":{"cited_paper":"/paper/2207.06000","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:a564e2f0a59619fa1da4d602ca610e32a7d6c9de439ac59c9457535b36e8dcfc","observation_id":"ca31ec89-b39c-4d57-84fa-e2ae6f8c2ab1","resolution":{"observed_at":"2026-08-06T19:55:03.856194Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05447","last_updated":"2017-11-28T02:07:43Z","snapshot_observed_at":"2026-07-06T06:09:32.998168Z","submitted_at":"2017-11-15T08:27:35Z","title":"Emotional End-to-End Neural Speech Synthesizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05447","snapshot_observed_at":"2026-08-06T19:55:03.529499Z","title":"Emotional end-to-end neural speech synthesizer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.529499Z"},"links":{"cited_paper":"/paper/1711.05447","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:07d463154390f74db524e7cda4ae0804b8c962f2bb283e1cf90fe48c3fefb8bd","observation_id":"18355188-c91f-46cf-89a8-32016829c550","resolution":{"observed_at":"2026-08-06T19:55:03.529499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.038818Z","title":"Controllable emotion transfer for end-to-end speech synthesis","venue":null,"work_id":"75bad8cd-970d-480e-ad94-524748cc174d","year":2021},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.532021Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:0a6ad89e33f3c0d26a581306fc4f05921b959bb4b847a16d3aa99655001c8f95","observation_id":"6a73c16a-4189-4908-8f33-4f0f697b58cc","resolution":{"observed_at":"2026-08-06T19:55:04.043446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.025703Z","title":"Emotion controllable speech synthesis using emotion-unlabeled dataset with the assistance of cross-domain speech emotion recognition","venue":null,"work_id":"e22e5a10-9ca9-4512-92a0-8673dfeaf0da","year":2021},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.534804Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:d1b84e2670b56052f9f1738057f53aae1d5279721857b543d142a13702c278d4","observation_id":"9b569e5c-3eaa-4f8d-be37-b62c236fe297","resolution":{"observed_at":"2026-08-06T19:55:04.032509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-398","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Emosphere- tts: Emotional style and intensity modeling via spherical emotion vector for controllable emotional text-to-speech","venue":null,"work_id":"ab7912d0-c065-49f6-b0d7-c661ef4a816a","year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.537283Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:39c8223a513a33a0c79e960025451357170d79c4fe47d9f74d38420110a63e4f","observation_id":"cd5dac71-3209-466d-bf22-a250b1ae6ad1","resolution":{"observed_at":"2026-08-06T19:55:03.658196Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12229","last_updated":"2024-09-17T10:40:11Z","snapshot_observed_at":"2026-07-06T18:47:33.863041Z","submitted_at":"2024-07-17T00:54:15Z","title":"Laugh Now Cry Later: Controlling Time-Varying Emotional States of Flow-Matching-Based Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2407.12229","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.12229","snapshot_observed_at":"2026-08-06T19:55:03.827977Z","title":"Laugh Now Cry Later: Controlling Time-Varying Emotional States of Flow-Matching-Based Zero-Shot Text-to-Speech","venue":"eess.AS","work_id":"7b68a14c-17ee-48b1-b381-a0f9f2d2dbf5","year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.540269Z"},"links":{"cited_paper":"/paper/2407.12229","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:0921e6702671019df45bed7400b995bbe602c62bb3407448010201775b327cd4","observation_id":"24f69278-2478-400a-b62a-f7038cf8050b","resolution":{"observed_at":"2026-08-06T19:55:03.834991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-06T19:55:03.543011Z","title":"F5- tts: A fairytaler that fakes fluent and faithful speech with flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.543011Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:14e34908401928ac4b4fba5cb8582d568a3be5a7f847ba7cf887e9efa5b8c503","observation_id":"c28b31f1-ae99-4660-a07b-f6aba23591c0","resolution":{"observed_at":"2026-08-06T19:55:03.543011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.545404Z","title":"High-resolution image synthesis with latent diffusion models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.545404Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:77c80edbc43d4926e3901abb0e1ab2fc55fb170870618d86b9ecf79f32ee5d85","observation_id":"ae120038-da12-4821-b592-095af89548a3","resolution":{"observed_at":"2026-08-06T19:55:03.545404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11477","last_updated":"2020-10-22T06:09:10Z","snapshot_observed_at":"2026-08-07T05:13:16.889179Z","submitted_at":"2020-06-20T02:35:02Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11477","snapshot_observed_at":"2026-08-06T19:55:03.548339Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.548339Z"},"links":{"cited_paper":"/paper/2006.11477","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:62b700655e90d6643c8009822462b85d183cfeb0b10782e6aad2e63c918e5633","observation_id":"db240b9d-a81b-4cce-b5cb-3a8760823976","resolution":{"observed_at":"2026-08-06T19:55:03.548339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.553864Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.553864Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:1e3ee4c81c88d8d165a93c5f30a96e3f0f1a68e7934f81e2343cfa47f1274c42","observation_id":"74ab91bd-8e53-4437-8b1b-443cd01ffbdb","resolution":{"observed_at":"2026-08-06T19:55:03.553864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-06T19:55:03.556597Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.556597Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:47b0a9e3767b7471b342041c64d97d2fe5163e05e9604869922144be013bc1ab","observation_id":"3aba256c-3a5c-46b0-bc54-58c020af47e5","resolution":{"observed_at":"2026-08-06T19:55:03.556597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.558680Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.558680Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:9a2f08688cacdb343a24cf9fdcd6c1f2b3738c523bb2f17563393a9fdfea9305","observation_id":"dd543283-742f-407e-8f66-e0181482b3e6","resolution":{"observed_at":"2026-08-06T19:55:03.558680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-06T19:55:03.561139Z","title":"Scaling rectified flow transformers for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.561139Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:3207b1dea58c9ebafbd3705eb6964385b4056bccf5b299fd8c471f220934fa05","observation_id":"4722960f-6b47-4504-8095-59584de4ba11","resolution":{"observed_at":"2026-08-06T19:55:03.561139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.563909Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.563909Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:aad9bcd41ca7b56decac654f55226f8d067dd8054ce20c4329351ca62a07e6c2","observation_id":"b47965bb-61e1-41ba-9435-633e28f772fd","resolution":{"observed_at":"2026-08-06T19:55:03.563909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14430","last_updated":"2025-03-15T21:25:56Z","snapshot_observed_at":"2026-08-03T14:25:47.372658Z","submitted_at":"2024-11-21T18:59:51Z","title":"Stable Flow: Vital Layers for Training-Free Image Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14430","snapshot_observed_at":"2026-08-06T19:55:03.566512Z","title":"Stable flow: Vital layers for training-free image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.566512Z"},"links":{"cited_paper":"/paper/2411.14430","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:ff54ac631e2a492861346f3dd9a3bdd7d9d447237388d25e0da4d5af9cb18a57","observation_id":"aca95d79-9e1d-4b04-a981-57869bda2470","resolution":{"observed_at":"2026-08-06T19:55:03.566512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.998489Z","title":null,"venue":null,"work_id":"748e757e-594e-49f5-ba0b-d2514992cf64","year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.569359Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:a09fa6b9ca5309ee3daf6b04b211f378d5bec1590f0647a8ca37391e706bfeca","observation_id":"1cfc32c3-f63a-4151-ae45-23d83dec5180","resolution":{"observed_at":"2026-08-06T19:55:04.003235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2017-1494","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Jointly predicting arousal, valence and dominance with multi-task learning","venue":null,"work_id":"c23e53cf-c825-4e82-8756-8ea1fec3193c","year":2017},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.572713Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:505f719f85b1d0db74d31af9cdaa82a08ac808649c97132e3c56c429346a414a","observation_id":"7c0a4d10-0711-41e7-9bcb-e6d557b03047","resolution":{"observed_at":"2026-08-06T19:55:03.647994Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.575345Z","title":"Automatic speech emotion recognition using recurrent neural networks with local attention","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.575345Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:9ef9058d336fb6253c51ef88ca612375bde970273a88673b1637e108b4b77eb4","observation_id":"c0bef902-9eaf-4a1a-93a1-9fae01b79ccf","resolution":{"observed_at":"2026-08-06T19:55:03.575345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.11540","last_updated":"2019-08-30T05:44:24Z","snapshot_observed_at":"2026-08-10T02:18:19.197213Z","submitted_at":"2019-08-30T05:44:24Z","title":"DialogueGCN: A Graph Convolutional Neural Network for Emotion Recognition in Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.11540","snapshot_observed_at":"2026-08-06T19:55:03.577522Z","title":"Dia- loguegcn: A graph convolutional neural network for emotion recognition in conversation, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.577522Z"},"links":{"cited_paper":"/paper/1908.11540","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:a2b31f6a95415d492ce3e389707ae66ac958214fbc6f354978287e3c67b216a8","observation_id":"57d46f65-0a4c-4e40-8a49-541b498ce322","resolution":{"observed_at":"2026-08-06T19:55:03.577522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.986423Z","title":"Dawn of the transformer era in speech emotion recognition: Closing the valence gap","venue":null,"work_id":"aabfb440-b741-4ff0-bddd-5b592b7b39a9","year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.580775Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:19c9994d8d425f9bc5816360c5589e47472d40e5a23a141c71e7cfeb75771237","observation_id":"1c380437-f813-455d-95bc-6a23c1569fa7","resolution":{"observed_at":"2026-08-06T19:55:03.991773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.583254Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.583254Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:a1604dd4d6bdf7df83246a0bcb1a4c80a40ac8e72370a8c00b9ade51f6e5911f","observation_id":"f0c04121-3ed6-4d39-b2ef-27e9337b95c5","resolution":{"observed_at":"2026-08-06T19:55:03.583254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-10T09:39:47.608323Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-06T19:55:03.585947Z","title":"Libritts: A corpus derived from librispeech for text-to-speech","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.585947Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:ebd1ec97363c9afdbd782913c69696a4e4ccb46a058d426b7dc9b3e2ebd624f9","observation_id":"2a13b751-60f8-42e4-b698-360ce9de2ead","resolution":{"observed_at":"2026-08-06T19:55:03.585947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.970842Z","title":"Building naturalistic emotionally balanced speech corpus by retrieving emotional speech from existing podcast recordings","venue":null,"work_id":"437360dd-5ca2-40fc-9bb3-2afce0976867","year":2017},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.589132Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:9c38df991654b6f7460939e70e988d4b6a028ce44446b5d08dbdc7c7096367bc","observation_id":"9b0e4c01-87bd-4f7a-b487-cfea8791fdd4","resolution":{"observed_at":"2026-08-06T19:55:03.975384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.959815Z","title":"EARS: An anechoic fullband speech dataset benchmarked for speech enhancement and dereverberation","venue":null,"work_id":"6064af2d-1005-46b6-8a57-011a79757234","year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.591411Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:5f0db033054f8941f166d15d922693520228722d9674b1d507c7e436f3254e7b","observation_id":"76e9d925-af9f-4cdc-a122-cb4e78110d5a","resolution":{"observed_at":"2026-08-06T19:55:03.964072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.948761Z","title":"Iemocap: Interactive emotional dyadic motion capture database","venue":null,"work_id":"e4a133c1-c709-40ec-a7e9-8d9f8bd780b7","year":2008},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.593862Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:de3c33fd83af823e85f4445c746ddf1d93eb00644abaaa62b9d5c88e9372c1e7","observation_id":"04826e61-70a3-40b4-9541-418907ce9bcd","resolution":{"observed_at":"2026-08-06T19:55:03.952788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.937521Z","title":"Seen and unseen emotional style transfer for voice conversion with a new emotional speech dataset","venue":null,"work_id":"9f009990-1bf2-4642-8db2-f3ab3004ebd9","year":2021},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.596052Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:af8ba0a78522f5039aa3bea33c6157b7a2e10bcc227ccfe96fe118ac4b58b9f3","observation_id":"786b6ee7-f2df-484f-adf6-d87af02a949e","resolution":{"observed_at":"2026-08-06T19:55:03.942258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.925492Z","title":"Expresso: A benchmark and analysis of discrete expressive speech resynthesis","venue":null,"work_id":"6d647cca-5df9-4d9c-8755-11c9417ab1a0","year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.598786Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:cee94de21a560c2c670798af6b790bf2097cffe1b617adaeb42df54dddbf27f7","observation_id":"50fd03a3-26bf-4b1e-a145-3c47d6137f59","resolution":{"observed_at":"2026-08-06T19:55:03.930958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.913961Z","title":"The ryerson audio-visual database of emotional speech and song (RA VDESS): A dynamic, multimodal set of facial and vocal expressions in north american english","venue":null,"work_id":"8edb8684-1c41-48b0-a56a-c65200311747","year":2018},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.603813Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:8767171ec1433b1bb91e41c467651d7081f6d8f4facd972e50816befb1ff22fc","observation_id":"d39eaf97-f758-4234-9303-b0fcedb68c25","resolution":{"observed_at":"2026-08-06T19:55:03.918607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.902356Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"c933c962-b1cc-432b-a22c-d95400d95a49","year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.606423Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:fa3591e277dcbbfc55bf3a56d0cc706924261de2b5ec3fa587f215e7514a2d6f","observation_id":"57707053-24ee-4ccf-b3fa-4bc411d1448c","resolution":{"observed_at":"2026-08-06T19:55:03.908017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-06T19:55:03.608406Z","title":"Seamless: Multilingual expressive and streaming speech translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.608406Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:8f6b46b30002e01eb9593d409ae233a8602fcaea9a3d2b27602b7f3716454cc2","observation_id":"39cf408f-2267-471a-813e-88f5f227bf17","resolution":{"observed_at":"2026-08-06T19:55:03.608406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.611900Z","title":"supple_demo/index.html","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.611900Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:524479bcf32fa153bf94c3944196740dbe5273f871f212361c2d09b8bf015d64","observation_id":"ce67d789-761f-4502-8d41-2ab1bd58d570","resolution":{"observed_at":"2026-08-06T19:55:03.611900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.600978Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.600978Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:cf7ede022aceb1d70750c7701ec3c46c8496f6c51a0496e186e4a739e8b035a0","observation_id":"94723fb0-b9a0-4101-abd0-d7076b1748b1","resolution":{"observed_at":"2026-08-06T19:55:03.600978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T12:03:57.857500Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":4,"verified_fuzzy":17},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 2 inbound Pith citation observations for arXiv:2507.04349."}