{"as_of":"2026-08-18T17:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e96dc0570a5632556ab954a7c974f555b58f334343572368348130383003ce74","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:49:29.571097Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.16310/citation-record","integrity":"/paper/2506.16310/integrity","json":"/paper/2506.16310/citation-record.json","paper":"/paper/2506.16310"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1806.04558","last_updated":"2019-01-02T19:00:05Z","snapshot_observed_at":"2026-08-14T19:04:43.084823Z","submitted_at":"2018-06-12T14:29:22Z","title":"Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.04558","snapshot_observed_at":"2026-08-06T23:49:29.437114Z","title":"Transfer learning from speaker verification to multispeaker text-to-speech synthesis","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.437114Z"},"links":{"cited_paper":"/paper/1806.04558","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:7ca35fa29c3e2079c3664d88bbd486b77e55ac7d3b3502d96c953e2b8b047c3a","observation_id":"ebe006ce-447c-44de-9feb-4a5333e79cd3","resolution":{"observed_at":"2026-08-06T23:49:29.437114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15749","last_updated":"2023-05-25T05:57:54Z","snapshot_observed_at":"2026-08-16T15:29:53.335628Z","submitted_at":"2023-05-25T05:57:54Z","title":"Multilingual Text-to-Speech Synthesis for Turkic Languages Using Transliteration","version":1},"cited_work":{"arxiv_id":"2305.15749","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15749","snapshot_observed_at":"2026-08-06T23:49:29.743499Z","title":"Multilingual Text-to-Speech Synthesis for Turkic Languages Using Transliteration","venue":"eess.AS","work_id":"b4b38f38-e8d6-4f54-9bc1-653bb40a99fe","year":2023},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.442444Z"},"links":{"cited_paper":"/paper/2305.15749","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:11618159ac3915597f4310baa2e6ca19754c70affdf28617c0fb1fbcbe763a50","observation_id":"971d7b1b-3bd1-4f90-9883-07ee08c0dfbb","resolution":{"observed_at":"2026-08-06T23:49:29.747496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.972402Z","title":"Accented text-to-speech synthesis with limited data","venue":null,"work_id":"24e6b2c0-f720-4226-ac84-4e5b84084b1e","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.447162Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:8ebaa02381d165301ba64f97a235cd28a2750b8ac61219188ed9ccb7754cf359","observation_id":"29d3b487-0610-4ad1-a01a-a4193c108122","resolution":{"observed_at":"2026-08-06T23:49:29.975954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10844","last_updated":"2025-01-01T09:33:02Z","snapshot_observed_at":"2026-08-18T04:43:02.919919Z","submitted_at":"2024-06-16T08:34:22Z","title":"Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10844","snapshot_observed_at":"2026-08-06T23:49:29.451391Z","title":"Multi-scale accent modeling with disen- tangling for multi-speaker multi-accent tts synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.451391Z"},"links":{"cited_paper":"/paper/2406.10844","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:29df490a23719a183605f4d792d6944347a684563ee47415f61bc5e00017f74c","observation_id":"920b7fc6-09cd-427f-a463-9fdf34ff948c","resolution":{"observed_at":"2026-08-06T23:49:29.451391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.961487Z","title":"Text to speech synthesis: A systematic review, deep learning based architecture and future research direction","venue":null,"work_id":"b0da4057-8404-4bbe-b806-248ed4c9c666","year":2022},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.455540Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:4785e1615c754f436860ae643664811c9cfe8215fb58083ca7f5b1724916b389","observation_id":"47ff6157-599e-444a-819e-6833da8d3962","resolution":{"observed_at":"2026-08-06T23:49:29.965337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.04448","snapshot_observed_at":"2026-08-06T23:49:29.459675Z","title":"Weiss, Heiga Zen, Yonghui Wu, Zhifeng Chen, R","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.459675Z"},"links":{"cited_paper":"/paper/1907.04448","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:8fa71d96446527ee37075a357258e06096f4d29a49aa749081ffcec10ab34bc1","observation_id":"d54c8481-fba0-4c4e-bfaa-35dfdcb78861","resolution":{"observed_at":"2026-08-06T23:49:29.459675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15364","last_updated":"2022-10-27T12:23:41Z","snapshot_observed_at":"2026-08-18T13:47:03.497011Z","submitted_at":"2022-10-27T12:23:41Z","title":"Explicit Intensity Control for Accented Text-to-speech","version":1},"cited_work":{"arxiv_id":"2210.15364","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.15364","snapshot_observed_at":"2026-08-06T23:49:29.709157Z","title":"Explicit Intensity Control for Accented Text-to-speech","venue":"cs.SD","work_id":"17b0871b-8995-490e-8a12-069284ac07f7","year":2022},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.464178Z"},"links":{"cited_paper":"/paper/2210.15364","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:cd3574461f222c2c6d0bc595a2ee0d80640f72feeb78afb22687f4df77e18e5f","observation_id":"df89730a-db25-4613-b7f7-a47a892e5ab5","resolution":{"observed_at":"2026-08-06T23:49:29.714136Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.951380Z","title":"Metts: Multilingual emotional text-to-speech by crossspeaker and cross-lingual emotion transfer","venue":null,"work_id":"a1b0f0ca-2a9a-4ea8-b9b3-7a8fe908d40f","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.468466Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:c9784362ed7717a1799eaef07c804e36e0cf79f0c7315bac0949ba35cb195822","observation_id":"5e8dbce6-88b3-4d36-b716-3b27a1d2c191","resolution":{"observed_at":"2026-08-06T23:49:29.955066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08076","last_updated":"2024-06-12T10:51:29Z","snapshot_observed_at":"2026-08-17T08:09:22.171171Z","submitted_at":"2024-06-12T10:51:29Z","title":"VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech","version":1},"cited_work":{"arxiv_id":"2406.08076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08076","snapshot_observed_at":"2026-08-06T23:49:29.694362Z","title":"VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech","venue":"eess.AS","work_id":"0bdde181-565e-4a51-a9ca-db6a94b28315","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.472578Z"},"links":{"cited_paper":"/paper/2406.08076","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:8e67cb79abb686ca3cb0539a5b64076c0742a307236e155d750e7e1fdd8de6c0","observation_id":"20a6c9e4-8d04-4f2d-8150-872813e44731","resolution":{"observed_at":"2026-08-06T23:49:29.698561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.939102Z","title":"Ed-tts: Multi-scale emotion modeling using cross-domain emotion diarization for emotional speech synthesis","venue":null,"work_id":"80f68f84-8544-4658-a7eb-7b9ea118379c","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.477016Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:138fd37d6831337555083aabea4eb2ab0620295159225db344a1a461448a8bb4","observation_id":"7880117a-5808-4e96-b545-10976cb35ebc","resolution":{"observed_at":"2026-08-06T23:49:29.943579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.927902Z","title":"Advanced emotion and multi-speaker recognition with multilingual voicecloning in cross-cultural communication","venue":null,"work_id":"98a3163f-1d30-47a7-b2d7-85a552253104","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.480523Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:43b917368e90aec0762c98a968689dc3b21e4d47f8e6b420a8769dec00aef377","observation_id":"bd2c2e82-c8c7-44a1-8fcf-629fbb2b1d27","resolution":{"observed_at":"2026-08-06T23:49:29.931720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.915901Z","title":"Exploring cross-linguistic speech perception in hindi, english, and romance-language through temporal dynamics of neural activity, 2024","venue":null,"work_id":"3a9d29ac-5d37-48f3-80fe-ab8c0394c3fe","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.484546Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:ae4c98fff4754e3528a6f0c15be6673d274c1a85c935816ae925bf1d6982e890","observation_id":"dd849131-7d3a-407f-b5ae-50fb7e6f93dc","resolution":{"observed_at":"2026-08-06T23:49:29.920182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.903477Z","title":"Diclet-tts: Diffusion model based crosslingual emotion transfer for text-to-speech—a study between english and mandarin","venue":null,"work_id":"9c15473d-4f08-42e2-832f-d25b9eadffce","year":2023},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.488798Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:049495bcad4fd457bd0bbdc3c4b7c787b237cb7048f9783d5cc31660827a3907","observation_id":"19c876c8-5a23-41d5-bb2f-dc9f7763a6a9","resolution":{"observed_at":"2026-08-06T23:49:29.908216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.892872Z","title":"Diffsound: Discrete diffusion model for text-to-sound generation","venue":null,"work_id":"b510f4c6-2a03-4d96-a0f4-d9677add9fc9","year":2023},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.492155Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:bc5ccbcb466d85482678186df1e8aa22c66f9ccff6a004e33380449215c92f17","observation_id":"a8cd64e6-be47-4a18-b61f-a14dfebad091","resolution":{"observed_at":"2026-08-06T23:49:29.896557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-08-13T16:11:28.134657Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-06T23:49:29.495278Z","title":"Spark- tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.495278Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:3f9351ad5c1d815c7a162fbfba3a76facd6ce93ccb5befb3df1d09616e481f50","observation_id":"e5f9d465-6cd7-435c-bc08-08a9f234aa88","resolution":{"observed_at":"2026-08-06T23:49:29.495278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.882647Z","title":null,"venue":null,"work_id":"e194ba49-0da9-4c90-a553-4c2074e364b0","year":2020},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.499193Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:aa45a7211a96facc946f587c5721034f2675541013660316dce691705da06957","observation_id":"f41d8e28-e5b0-41e3-87f7-34b7d5f33d4a","resolution":{"observed_at":"2026-08-06T23:49:29.886317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-16T14:21:59.601701Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-06T23:49:29.502416Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.502416Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:95e93ce5c783cfe44c7ccbb0bd7a17f3df765fe6c6bcefa79eb00f79967f9fc1","observation_id":"de9f7812-7aa8-4c1b-ba5a-0257ba1e96db","resolution":{"observed_at":"2026-08-06T23:49:29.502416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-06T23:49:29.506899Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.506899Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:068d95061ee017b0f1543951345b1f8fbdfcc34c83f64a3d0aedecaebdb6124c","observation_id":"9033d180-b44d-471d-861a-7e8e189f475f","resolution":{"observed_at":"2026-08-06T23:49:29.506899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.871513Z","title":"Scaling instruction-finetuned language models","venue":null,"work_id":"8b2f1bd4-94a2-4c3e-8cfd-de873233bf9c","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.510659Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:436cc61251df995d70aad86aef02d7e65f06ded4f5cf182d4b0ca8efe1169734","observation_id":"1008a2d7-3253-410f-b560-762ac16eaa49","resolution":{"observed_at":"2026-08-06T23:49:29.875844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.861135Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"dbac2b8c-836f-4c20-b6ab-cd85cead84ef","year":2017},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.514100Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:51f4c710efd1822c1efb6e94365937c0289445946919025f0f401d4877e3fe7f","observation_id":"fd193622-ef5f-4b4b-8d33-457b2016e3ad","resolution":{"observed_at":"2026-08-06T23:49:29.864633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.518046Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.518046Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:982ed54ef1b0aa093300ac8e05f65ed04f4f57186c69c8af6403a9ae15c11be6","observation_id":"ef18d909-9835-4e85-99a3-c1b9d7812b1b","resolution":{"observed_at":"2026-08-06T23:49:29.518046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05708","last_updated":"2023-06-12T06:12:41Z","snapshot_observed_at":"2026-08-16T15:25:15.979058Z","submitted_at":"2023-06-09T07:02:43Z","title":"Boosting Fast and High-Quality Speech Synthesis with Linear Diffusion","version":2},"cited_work":{"arxiv_id":"2306.05708","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.05708","snapshot_observed_at":"2026-08-06T23:49:29.651314Z","title":"Boosting Fast and High-Quality Speech Synthesis with Linear Diffusion","venue":"cs.SD","work_id":"06599131-6902-4fcf-996f-c81dde439592","year":2023},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.521494Z"},"links":{"cited_paper":"/paper/2306.05708","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:f5c1690871c332e862f1dc5b9f15aba194dc3bf91e1c67902b2fd8768d9d74d9","observation_id":"bc68924d-7453-4089-a094-8cbcf40cb3d0","resolution":{"observed_at":"2026-08-06T23:49:29.655936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12867","last_updated":"2025-08-13T11:23:57Z","snapshot_observed_at":"2026-08-16T12:33:10.949238Z","submitted_at":"2025-04-17T11:50:04Z","title":"EmoVoice: LLM-based Emotional Text-To-Speech Model with Freestyle Text Prompting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12867","snapshot_observed_at":"2026-08-06T23:49:29.525601Z","title":"Emovoice: Llm-based emotional textto-speech model with freestyle text prompting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.525601Z"},"links":{"cited_paper":"/paper/2504.12867","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:a248eff484ec87a9f939fc302b803d0e3e580f35dd2ff4703abd85dbccf629e5","observation_id":"078c576c-a685-4c0e-aee4-d2d6c75b4979","resolution":{"observed_at":"2026-08-06T23:49:29.525601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-18T08:46:24.229617Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"cited_work":{"arxiv_id":"2411.14642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.14642","snapshot_observed_at":"2026-08-06T23:49:29.628563Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","venue":"cs.LG","work_id":"2d82e0d3-cff6-416c-b001-c26bace6f9fb","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.529419Z"},"links":{"cited_paper":"/paper/2411.14642","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:c7aee015c2d741bf4adb4412c741101f170855acac08eaadc07ce358e319f5df","observation_id":"efab0454-8e62-4597-848d-b261c2b3ca66","resolution":{"observed_at":"2026-08-06T23:49:29.632522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.842484Z","title":"Indicvoices-r: Unlocking a massive multilingual multi- speaker speech corpus for scaling indian tts.Advances in Neural Information Processing Systems, 37:68161–68182, 2024","venue":null,"work_id":"d3cad2a7-d1a7-4529-8898-8cdb15ae2485","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.533636Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:3c69172a85be389c251e6ecfabddacac0dfdd6fbbb1d53f521ef39d13edcf821","observation_id":"1b137f2d-3da4-4bd3-bdc5-b51002fe3da3","resolution":{"observed_at":"2026-08-06T23:49:29.846905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03706","last_updated":"2022-03-07T21:13:54Z","snapshot_observed_at":"2026-08-16T17:16:19.784342Z","submitted_at":"2022-03-07T21:13:54Z","title":"Detection of AI Synthesized Hindi Speech","version":1},"cited_work":{"arxiv_id":"2203.03706","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.03706","snapshot_observed_at":"2026-08-06T23:49:29.610702Z","title":"Detection of AI Synthesized Hindi Speech","venue":"cs.SD","work_id":"fe9debc5-6fa2-4bef-b11e-d7642b2b3e07","year":2022},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.537409Z"},"links":{"cited_paper":"/paper/2203.03706","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:797fd08921743cce91e6266d419ddd7d31c5f47449f4596afc4130d85970cf73","observation_id":"d127df31-9e6b-4ac6-b1e9-93cfc094045c","resolution":{"observed_at":"2026-08-06T23:49:29.616820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-18T15:57:37.984685Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-06T23:49:29.542314Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.542314Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:c910f5b968fa150c1ee04dba960381ca2f3761687302388ded3563b4a282312d","observation_id":"eb7ebb49-ba2d-4e51-805d-2b1b66e5e02f","resolution":{"observed_at":"2026-08-06T23:49:29.542314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.831033Z","title":"Falk, Vijay Parsa, Joao F","venue":null,"work_id":"b6017d99-1981-474b-a67e-123977e83d10","year":2015},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.546432Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:f0924cf3a84419131c07e6c5252fe201b8e98c9cc419a52737bfcdb6772e8ab7","observation_id":"2aabb818-a70c-443e-8bb9-0b0ca4a62248","resolution":{"observed_at":"2026-08-06T23:49:29.835195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.818878Z","title":"Timothy Bunnell, Ying Dou, Prasanna Kumar Muthukumar, Daniel Perry, Kishore Prahallad, Callie Vaughn, Alan W","venue":null,"work_id":"5e936405-092b-400f-a308-fc54c1ef0fc3","year":2012},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.550208Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:af396661fbdab0d914cc34d86d6476aa2b441be50ff2807f7dd22a6b532dbbab","observation_id":"11e49698-7005-4c6d-adbf-3f493b4ebbd4","resolution":{"observed_at":"2026-08-06T23:49:29.824203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.807186Z","title":"Stuck in the mos pit: A critical analysis of mos test methodology in tts evaluation","venue":null,"work_id":"02b91845-4065-4f89-97ec-35f439db4338","year":2023},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.554359Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:7419bcbfb50f69ea94042487417200e03a74cfaaea427e123278291560e27d29","observation_id":"eddc7b06-f3ce-43c3-8754-7511103a3333","resolution":{"observed_at":"2026-08-06T23:49:29.811586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.797045Z","title":"The limits of the mean opinion score for speech synthesis evaluation","venue":null,"work_id":"8d2cae85-960d-4262-9409-b01d4c546ae6","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.558358Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:4e58db69271941e63c3e98ba993204d4ea2942689c50b10f4c57ddc7a5270ed4","observation_id":"68833200-e53d-4d17-83ac-50bb022f34cf","resolution":{"observed_at":"2026-08-06T23:49:29.800445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.786592Z","title":"Rix, John G","venue":null,"work_id":"6c6ed892-1e60-4fa4-8fdf-587008a1a9f0","year":2001},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.562370Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:01cbfb5eef35856c8a100b9d778ae3977c6a0cd6aa7a1fb0e2bce3b7d667bccd","observation_id":"297a7558-60d5-462b-9fe7-77f624c4ce51","resolution":{"observed_at":"2026-08-06T23:49:29.790105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.775744Z","title":"Identification and classification of tts intelligibility errors using asr: A method for automatic evaluation of speech intelligibility, 2023","venue":null,"work_id":"ba501fe7-d471-4433-a98c-7d38c76d3087","year":2023},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.566649Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:0dde7624f1d8bb5cb457a7cdaae28dc0179bb2f96e443e00f0cdaf76daa82507","observation_id":"08e37f5d-0fdb-43c8-9658-0220a89a31d2","resolution":{"observed_at":"2026-08-06T23:49:29.779438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.764855Z","title":"Tracey, D","venue":null,"work_id":"ec18154f-86f0-40cb-bfbb-b7bbd51bb5ae","year":2023},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.571097Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:447c88c18478574908d9c8b4e1bee65d00b088c87b21cced4d9e72377e9e8035","observation_id":"18ec435c-4c8a-44ca-bc48-8b0c888cb697","resolution":{"observed_at":"2026-08-06T23:49:29.768602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":6,"verified_fuzzy":18},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2506.16310."}