{"as_of":"2026-08-09T15:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d3adfc06a1d2b46df4fd021bb9f2a17a3c36a6a679a3202428341f82eb7b5b74","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T00:09:35.661121Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:49:29.459675Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-25T00:10:07.071622Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"cited_work":{"arxiv_id":"1907.04448","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.04448","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","venue":"cs.CL","work_id":"31f4c481-def2-4dc6-801c-98bda5509273","year":2019},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"cited_paper":"/paper/1907.04448","citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:e973a6a488d5613f56823de5bbe2fee24fc34459e5a1049e99ae9508017cabe4","observation_id":"6fd71456-8b9d-4435-b97c-96a539929a35","resolution":{"observed_at":"2026-05-25T00:10:07.075022Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.04448","snapshot_observed_at":"2026-08-06T23:49:29.459675Z","title":"Weiss, Heiga Zen, Yonghui Wu, Zhifeng Chen, R","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-08T22:59:15.277514Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.459675Z"},"links":{"cited_paper":"/paper/1907.04448","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:254454f738a24329cb157790d70d80a60b023c7c98d5268b181392c90df3c970","observation_id":"d54c8481-fba0-4c4e-bfaa-35dfdcb78861","resolution":{"observed_at":"2026-08-06T23:49:29.459675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.04448","snapshot_observed_at":"2026-08-05T22:17:38.408435Z","title":"Learning to speak fluently in a foreign language: Multilingual speech synthesis and cross-language voice cloning,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.408435Z"},"links":{"cited_paper":"/paper/1907.04448","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:849866967507669b7c750d8641a763cbdfcaa1336a672163d418de357fbfd666","observation_id":"b5f15223-498d-4312-b7d4-6d7df3408c0e","resolution":{"observed_at":"2026-08-05T22:17:38.408435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1907.04448/citation-record","integrity":"/paper/1907.04448/integrity","json":"/paper/1907.04448/citation-record.json","paper":"/paper/1907.04448"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"prosody, by conditioning synthesis on la- tent representations [8–12] in addition to text","venue":null,"work_id":"f2c5a045-9618-4ecd-9fcc-93af60422a1c","year":null},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:15be54a031736f3681f7031fa11332c8e2ef3e1acac27f9ff402970f65b2d736","observation_id":"7ae3d3a5-6cbd-4435-b177-51c8f00bf4b9","resolution":{"observed_at":"2026-05-25T00:10:07.660334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"cited_work":{"arxiv_id":"1907.04448","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.04448","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","venue":"cs.CL","work_id":"31f4c481-def2-4dc6-801c-98bda5509273","year":2019},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"cited_paper":"/paper/1907.04448","citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:e973a6a488d5613f56823de5bbe2fee24fc34459e5a1049e99ae9508017cabe4","observation_id":"6fd71456-8b9d-4435-b97c-96a539929a35","resolution":{"observed_at":"2026-05-25T00:10:07.075022Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ddf4d886-2992-4521-92a8-201a8ccee6f8","year":null},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:80fb656c44bfb535ed6c8f83100d1cfecef08d598777c8cddcd2bea2d534a936","observation_id":"6cfd8f0d-51a0-4201-b5a4-346c0b1007e9","resolution":{"observed_at":"2026-05-25T00:10:07.642502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"heavyaccented","venue":null,"work_id":"6fe05467-27d0-4f76-9bd1-32c0c5111e57","year":null},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:868658f027fc956e8eee182916ee332d8f591b99f7d0f631ad054981fa3ac87c","observation_id":"fa48e1d4-4bc6-477f-925c-40da5a1e5ccf","resolution":{"observed_at":"2026-05-25T00:10:07.589630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4f38f264-f2b4-4720-bf51-8c973ccd370d","year":null},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:a2b31eac740812260607e2bfcfd50e4bb3296adcc934daf789479bc3fdee9793","observation_id":"0cb291dc-c2f5-4781-906a-d237027c3a92","resolution":{"observed_at":"2026-05-25T00:10:07.648339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7c4e4e4f-62b4-4bd5-b771-1c0e77790fb4","year":null},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:197643c5bdabba51bc17e0d47d67e884dea3d2e7b064c9ed26142be1e9f2cc41","observation_id":"13dd437f-953e-4e43-9586-426de24c3f0f","resolution":{"observed_at":"2026-05-25T00:10:07.680552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:0e3fc3c2430ca56fd2e648db34e698d54f7ad83b604cd8ae849c31da1ec37fc2","observation_id":"dad61d25-0bb5-4b23-9366-265181562df0","resolution":{"observed_at":"2026-05-25T00:10:07.041425Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tacotron: A fully end-to-end text-to-speech synthesis model","venue":null,"work_id":"44311454-4b41-4691-82f2-653a2d8087ee","year":2017},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:293017e33fb6217007cacfc8eb881544898faad44dd3fdbcf579860b1ea27d7c","observation_id":"da5c7525-49ce-40ba-b433-1f8767d18ee9","resolution":{"observed_at":"2026-05-25T00:10:07.576486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepVoice2: Multi-speakerneuraltext- to-speech","venue":null,"work_id":"80dc8cd2-3b7e-401f-8341-9485fb782506","year":2017},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:a76996bcaf7fa52b76a94c1ea401dad2b9b51650d64a72d14c425c57969dc6db","observation_id":"4a71613e-5913-4fa7-8311-5a843e6d3c49","resolution":{"observed_at":"2026-05-25T00:10:07.572278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neuralvoice cloning with a few samples","venue":null,"work_id":"a86d4613-9ed0-4135-9d4d-613f26052cab","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:7ef8a1aaee30000ab7212b109a5d67770a7d766d053ffc125866033ed2b8f164","observation_id":"b6187871-b060-4c34-adce-e4132faea9e0","resolution":{"observed_at":"2026-05-25T00:10:07.667956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transfer learn- ing from speaker veriﬁcation to multispeaker text-to-speech syn- thesis","venue":null,"work_id":"42a0c2c6-d249-42fa-83c4-cf619fbf1b28","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:0676f90f61bd2169c777aee1239ae5bea20264cd406790a41f2d9ac2f1fe65e5","observation_id":"f73a218d-7ba3-46ec-ba2c-d62a60168311","resolution":{"observed_at":"2026-05-25T00:10:07.602137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fitting new speakers based on a short untranscribed sample","venue":null,"work_id":"311ba02d-2286-4122-922a-21f8fc587646","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:e80e25d14eb61556b2ae7a915b8dc6605529fc1e58783be8802a76ab1fa99d91","observation_id":"463ce1de-833a-4c65-bdd9-02d7ffd90e7f","resolution":{"observed_at":"2026-05-25T00:10:07.672328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.10460","last_updated":"2019-01-16T22:30:22Z","snapshot_observed_at":"2026-07-06T07:04:39.537654Z","submitted_at":"2018-09-27T11:31:19Z","title":"Sample Efficient Adaptive Text-to-Speech","version":3},"cited_work":{"arxiv_id":"1809.10460","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.10460","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sample Efficient Adaptive Text-to-Speech","venue":"cs.LG","work_id":"69b6ec8d-83c9-46e2-93e6-e18c61e78962","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"cited_paper":"/paper/1809.10460","citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:decb6118fb2e54719c9ae29289f5cebcde90ccec71556ce9b50b0b9167095b94","observation_id":"50f1348c-36f9-4db1-9bd1-b67c37892f87","resolution":{"observed_at":"2026-05-25T00:10:07.062820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Style tokens: Unsupervised style modeling, control and transfer in end-to-end speechsynthesis","venue":null,"work_id":"88d4bded-8749-4756-baa1-f3f27250969a","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:eae5e90500d4541b8f3c4e8e4f79c6e1d259267de59a871e7cf2b31104be1db0","observation_id":"1546fa51-115f-4a65-97e2-6a89c39779eb","resolution":{"observed_at":"2026-05-25T00:10:07.605944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards end- to-endprosodytransferforexpressivespeechsynthesiswithTaco- tron","venue":null,"work_id":"2136c01f-3f6b-40f4-9c10-efb4d1ae6ace","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:8654abab1fde6b1ae9e8286949af9e34b39dbfe13e83e232da6f4799ca867e30","observation_id":"4e89d297-4da6-4fea-a261-56f9edce538e","resolution":{"observed_at":"2026-05-25T00:10:07.618551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Expressive speech synthesisviamodelingexpressionswithvariationalautoencoder","venue":null,"work_id":"677288c4-1eab-4695-9c38-d82fa007bbd8","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:2990351571b8421a12ccf7351800be41359b079b4f2893902a360fef26e5616e","observation_id":"82dfebc3-3a6a-44a0-a101-eff418e3ecf1","resolution":{"observed_at":"2026-05-25T00:10:07.626764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.11470","last_updated":"2018-09-09T17:01:07Z","snapshot_observed_at":"2026-07-06T06:53:08.668874Z","submitted_at":"2018-07-30T17:59:28Z","title":"Deep Encoder-Decoder Models for Unsupervised Learning of Controllable Speech Synthesis","version":3},"cited_work":{"arxiv_id":"1807.11470","doi":null,"metadata_source":"pith","pith_arxiv_id":"1807.11470","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep Encoder-Decoder Models for Unsupervised Learning of Controllable Speech Synthesis","venue":"eess.AS","work_id":"d5b1e792-4a5b-4808-9a17-b53a83ed926b","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"cited_paper":"/paper/1807.11470","citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:6dc1e449f1c56a7c09968f10f2a51ddf113ee6e9310b432e6dfb4405f0d0ee1c","observation_id":"9ba06a2b-ac69-44c8-8be9-d88c3e4cc5f6","resolution":{"observed_at":"2026-05-25T00:10:07.055571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical generative modeling for controllable speech synthesis","venue":null,"work_id":"3186b54f-c45c-4696-bdd2-50ba42ca6af7","year":2019},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:2741aa452b6c74079fed193a619d48d91ab3b3fc3a4d6f7eecfdba84a41ff0d1","observation_id":"743c9309-9d1c-40f6-af1a-c75a2ed2f734","resolution":{"observed_at":"2026-05-25T00:10:07.594414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Statistical parametric speech syn- thesis based on speaker and language factorization","venue":null,"work_id":"1a30cf79-1580-45de-957e-d743a141e014","year":2012},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:e478f1ed3728ff9e148c84ef6b66b1782a7125bb79a44611279fb29d92488e67","observation_id":"60b12332-d185-49e3-8474-e24b70eafd40","resolution":{"observed_at":"2026-05-25T00:10:07.598354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-language multi-speaker acoustic model- ingforLSTM-RNNbasedstatisticalparametricspeechsynthesis","venue":null,"work_id":"29c7b9d2-d480-44ec-9458-3419165d5a91","year":2016},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:2d77046a4e8ac38945092777b1d33d786d5fdd17cde8c037e9488b0aebe55fd9","observation_id":"bcdd3e0e-eea6-43b6-b75f-ad844e25f929","resolution":{"observed_at":"2026-05-25T00:10:07.609809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A light-weight method of building an LSTM-RNN-based bilingual TTS system","venue":null,"work_id":"33f43491-c355-44d7-a6d9-d122f07986c6","year":2017},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:b15ea59f364d4e56669ca6a13fb16deb83e923831da319ef36d79229d7317e77","observation_id":"fa1e41ff-b3e3-4599-ba23-1f2a46f9ef41","resolution":{"observed_at":"2026-05-25T00:10:07.614306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.09364","last_updated":"2020-06-24T00:57:25Z","snapshot_observed_at":"2026-07-06T07:16:33.611269Z","submitted_at":"2018-11-23T05:24:15Z","title":"Learning pronunciation from a foreign language in speech synthesis networks","version":4},"cited_work":{"arxiv_id":"1811.09364","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1811.09364","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning pronunciation from a for- eign language in speech synthesis networks","venue":null,"work_id":"f18641c4-a7c5-454e-af4d-17a4c8987717","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"cited_paper":"/paper/1811.09364","citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:b95b67141e1c9c33315d14c6174fa3a5d1110f938026a9fb1597c4077f4a1f08","observation_id":"0835da2a-2a5b-47f4-a6b5-5bf4cae7d335","resolution":{"observed_at":"2026-05-25T00:10:07.048463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervisedpolyglottexttospeech","venue":null,"work_id":"4501bceb-5906-4116-952b-3d37436156d1","year":2019},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:fb903bf1e0b91d0526475bcc0d2f5e94f30ca23caf49a66d5711f5d698bc5174","observation_id":"9cb4e778-c9bb-4a9f-8c20-c173c7e27d25","resolution":{"observed_at":"2026-05-25T00:10:07.676164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WORLD: a vocoder- based high-quality speech synthesis system for real-time applica- tions","venue":null,"work_id":"c58bfbae-e153-4708-93b9-50e4231c42f6","year":2016},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:ca97caed5ad147367de194fb1937622206c7a32826d179bdfccc8beedf613157","observation_id":"343089da-d838-405c-abdc-153c89ec3e02","resolution":{"observed_at":"2026-05-25T00:10:07.664180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bytesareallyou need: End-to-end multilingual speech recognition and synthesis with bytes","venue":null,"work_id":"06abe7e9-2a39-4ae4-86ae-e0756f9d1d6d","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:dae619b6a29e5de977a990cca87aff0f85c712016959374d6dc929f07d80f785","observation_id":"21e1c771-0432-47df-b516-f1a73f85d01b","resolution":{"observed_at":"2026-05-25T00:10:07.638343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natural TTS synthesis by conditioning WaveNet on mel spectrogram predic- tions","venue":null,"work_id":"84ea58d9-ceb5-4dbc-819b-441afe9646fc","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:244a82fdffca4b90978cc4efe98ad56a2e3eb0efbfc39d1201733434198d4027","observation_id":"0c01e1a0-242a-4369-9fc8-35d5b94496fe","resolution":{"observed_at":"2026-05-25T00:10:07.652174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Auto-encodingvariationalBayes","venue":null,"work_id":"410d7857-c169-48db-99df-8e51cac6f951","year":2014},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:0db9865fef804a2196d64947a5fdafc653037abc7a5eab2d19178a7e9637aabb","observation_id":"1ef0ec5c-fd0e-462e-b864-08100d5ee0b7","resolution":{"observed_at":"2026-05-25T00:10:07.656015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eﬃcient neural audio synthesis","venue":null,"work_id":"bfd6918f-f591-4d97-a566-aff5bdc4b3de","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:f3f38f8fcfc419d6f7276a1fd152eaf6a33d57c671fcfd144ded3e4e9148624a","observation_id":"ca15ffc2-a01b-4c46-9772-50af92048019","resolution":{"observed_at":"2026-05-25T00:10:07.695580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Char2wav: End-to-endspeechsyn- thesis","venue":null,"work_id":"03be463a-a31c-426e-896e-c544ff70b16c","year":2017},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:cd5fc4986ef53419d387267366fd22a7d3980026e08ae82c07c9aa9324ada175","observation_id":"586a05dc-7512-40bb-af36-0f5f68adfad3","resolution":{"observed_at":"2026-05-25T00:10:07.622605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep Voice 3: Scaling text-to-speech with convolutional sequence learning","venue":null,"work_id":"bf1d1397-1c5a-4ae8-83e3-93f9ed30664e","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:504d006fa382bd9ae4102951d8dd81b2c41528c48ee0ca0e6577ed86eff11935","observation_id":"79bd0c19-510b-4d92-b149-7d37f90d1262","resolution":{"observed_at":"2026-05-25T00:10:07.684223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.07240","last_updated":"2018-11-24T23:16:10Z","snapshot_observed_at":"2026-08-03T17:44:27.124626Z","submitted_at":"2018-11-17T22:45:15Z","title":"Representation Mixing for TTS Synthesis","version":2},"cited_work":{"arxiv_id":"1811.07240","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.07240","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Representation Mixing for TTS Synthesis","venue":"cs.LG","work_id":"8847a751-58e1-4f8e-a7aa-842cc5d113d7","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"cited_paper":"/paper/1811.07240","citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:b4a7b0c7bb1c545c6a1473b35a92411e66c0164119645fc8494b96bf4e845054","observation_id":"6f3d1a08-bbbf-4049-b058-c4a0b3db7883","resolution":{"observed_at":"2026-05-25T00:10:07.068668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Data-oriented methods for grapheme-to-phoneme conversion","venue":null,"work_id":"a25ed463-92cc-436f-818d-7e991d6953d4","year":1993},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:210865555a817b52609430c8430eab2ba6251101eaafd8966eae6f5a1c3814b7","observation_id":"bc52e1f1-98cb-413c-8928-22b3002d98e4","resolution":{"observed_at":"2026-05-25T00:10:07.631868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Domain- adversarial training of neural networks","venue":null,"work_id":"de1c0471-b441-46fa-b0c5-1ce09c88c27f","year":2096},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:75ce905c9dd1464b609773bbe7433226d76c12b838d1cb3b26352ef7e7b17c82","observation_id":"99409a6a-0220-44ba-8d48-ba0d1edc939b","resolution":{"observed_at":"2026-05-25T00:10:07.687837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disentangling correlated speaker and noise for speech synthesis via data augmentation and adversarial factor- ization","venue":null,"work_id":"b46d2d9c-dce0-4657-b746-c3836a754c01","year":2019},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:0c51a9f0ddca43627a0d4d211457cb3160914774f430d34f8b7d7cfba13e3ba2","observation_id":"d10ac97c-0db0-4a90-bd2b-2e4c23a7c895","resolution":{"observed_at":"2026-05-25T00:10:07.691566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-lingual speaker discrimination usingnaturalandsyntheticspeech","venue":null,"work_id":"b063752b-350a-47a7-aaf8-06ffd28f2b04","year":2011},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:84f3b595822149529cb4ef2067a1da672d2c230379938f621ebddb3ef1d33724","observation_id":"bd3acc62-3653-41ab-9dda-91fbb8c19d58","resolution":{"observed_at":"2026-05-25T00:10:07.584968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generalized end- to-end loss for speaker veriﬁcation","venue":null,"work_id":"95129d2a-8376-4fe3-9b65-fe35bc30ac06","year":2018},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:ce87ba35949a5b5457d8ce7ef62ddcea689e461ceaa89ea14c522749072120c7","observation_id":"900e2af5-09e5-4d88-b18d-184bac19d2a1","resolution":{"observed_at":"2026-05-25T00:10:07.580729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":3,"verified_exact":5,"verified_fuzzy":27},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 3 inbound Pith citation observations for arXiv:1907.04448."}