{"as_of":"2026-08-13T15:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ae752863552c61af99b2f531163ec6adc694d5ffeb5d02fc63336033e7fcbcf7","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:33:56.087718Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.20155/citation-record","integrity":"/paper/2412.20155/integrity","json":"/paper/2412.20155/citation-record.json","paper":"/paper/2412.20155"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.469743Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers,","venue":null,"work_id":"3d7c58b1-e3b0-4a07-a28f-d5c454d67145","year":2024},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:55.978812Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:4ddc0d9d316915e0f6dd69df89f4fc4fafa56b7101edf76f9d2162611cf4addc","observation_id":"57b2daa0-28dc-43fe-98e5-4938d53c2b1a","resolution":{"observed_at":"2026-08-10T23:33:56.474405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-10T23:33:55.983782Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:55.983782Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:335c2b6a9d541f26f2cec5d308590d5dc98f6f890900f91718760fb8f417064d","observation_id":"3637ec4e-14db-48f5-85d7-b43f73f21954","resolution":{"observed_at":"2026-08-10T23:33:55.983782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.456323Z","title":"Grad-StyleSpeech: Any-Speaker Adaptive Text-to-Speech Synthesis with Diffusion Models,","venue":null,"work_id":"bc14eabb-0aa9-43f5-a82e-ab129eef0b34","year":2023},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:55.989046Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:794e2579fc6a236d9f2bf9787ba42c1b3d47db7a085cbc8fb4aad0b28aaa9e74","observation_id":"ff02bd9e-0d6f-41f9-b8fb-d736d2c1e42c","resolution":{"observed_at":"2026-08-10T23:33:56.460667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03509","last_updated":"2023-06-06T08:54:49Z","snapshot_observed_at":"2026-08-13T11:23:37.547715Z","submitted_at":"2023-06-06T08:54:49Z","title":"Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03509","snapshot_observed_at":"2026-08-10T23:33:55.993734Z","title":"Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:55.993734Z"},"links":{"cited_paper":"/paper/2306.03509","citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:cec4ad80521893dd0ca31a24ade5f3a76440849558767b21add5aa3e623ac7da","observation_id":"c43b41df-fc1b-4f15-99f1-05aa0107e086","resolution":{"observed_at":"2026-08-10T23:33:55.993734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.443087Z","title":"YourTTS: Towards Zero-Shot Multi-Speaker TTS and Zero-Shot V oice Conversion for Everyone,","venue":null,"work_id":"7779f3b4-b630-422f-b14d-544275872e30","year":2022},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:55.998428Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:cbb8835b43d7107397a4610401ffa2eea7dfc954786e94cd332e87258161ad44","observation_id":"cd36bbc1-d4a0-4f91-acc1-c84c63eb359c","resolution":{"observed_at":"2026-08-10T23:33:56.447310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.427858Z","title":"UnitSpeech: Speaker-adaptive Speech Synthesis with Untranscribed Data,","venue":null,"work_id":"e77deb3f-434c-4fdb-9891-f5dcf5b88e68","year":2023},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.002933Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:3c784c7b1d7456365181cbfb55968c2a247a54f0a83f6895a51e409aac54e117","observation_id":"9a221940-a3e4-46a4-8058-23e060163828","resolution":{"observed_at":"2026-08-10T23:33:56.433614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.412777Z","title":"AdaSpeech: Adaptive Text to Speech for Custom V oice,","venue":null,"work_id":"8638ac96-2238-42fd-954e-9fb21aac7007","year":2021},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.008124Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:0dad9b13c859850a75403ae21d3b967eae2c0e82faacf4fce2fc669c63ade0ad","observation_id":"0a1b30dc-906f-4ccd-afbe-7aaf74273569","resolution":{"observed_at":"2026-08-10T23:33:56.417651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05798","last_updated":"2022-04-06T01:31:05Z","snapshot_observed_at":"2026-08-06T19:05:36.163265Z","submitted_at":"2021-10-12T07:51:25Z","title":"Adapting TTS models For New Speakers using Transfer Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05798","snapshot_observed_at":"2026-08-10T23:33:56.012265Z","title":"Adapting TTS models For New Speakers using Transfer Learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.012265Z"},"links":{"cited_paper":"/paper/2110.05798","citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:6177f5dbe0a84bdd4976e6fa48abefca9c8616b8f3adf60d03c223a5bf7340ea","observation_id":"f9976d44-a8be-4a21-b6df-f90fd25a76c5","resolution":{"observed_at":"2026-08-10T23:33:56.012265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.398618Z","title":"V oxCeleb: A Large- Scale Speaker Identification Dataset,","venue":null,"work_id":"e556f38c-89ff-4447-9899-2ff18bb05df5","year":2017},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.016452Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:bb3a14a760a886574e47ca6e22102a00c72954587c4f880315af1d8430b3881b","observation_id":"a661e80a-66ec-4362-a7c0-a0b0b701b009","resolution":{"observed_at":"2026-08-10T23:33:56.403262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.384321Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text- to-Speech,","venue":null,"work_id":"9cca3b7a-c30b-4eba-8951-fd5d1e95dbec","year":2019},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.020445Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:41a8c67ab190b8039a74d9040e7496b7028a7067fdb4f7dde0e56d03818a054d","observation_id":"38d93117-beb9-485e-989d-916afa95857c","resolution":{"observed_at":"2026-08-10T23:33:56.388986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.369265Z","title":"DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject- Driven Generation,","venue":null,"work_id":"800db22d-40fa-4bc3-bf3b-e5b11313b798","year":2023},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.024609Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:750858f1af2b8e108106702714231bc2183ab753060eebd3d377ab9f826a2ff1","observation_id":"f1afb0c0-87dc-453c-938c-e8943250de66","resolution":{"observed_at":"2026-08-10T23:33:56.374096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.353638Z","title":"Grad-TTS: A Diffusion Probabilistic Model for Text-to-Speech,","venue":null,"work_id":"d6cbec35-cf9d-40e4-9ff7-eb77b1271b8b","year":2021},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.028861Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:755a73fe1d3311355d9c25ec5ea8226771cc4282e69600f9c9d502e75d7c02c5","observation_id":"fe16b6a9-17dc-432b-b4b2-35952806d569","resolution":{"observed_at":"2026-08-10T23:33:56.358891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.337387Z","title":"Fast- Speech: Fast, Robust and Controllable Text to Speech,","venue":null,"work_id":"1aaaf1c7-6c2a-4f40-b2cb-b63124fa5011","year":2019},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.033429Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:8fa8ab61fa879fb63492fb13411b7dd62c40185e6618a58156334132beb46395","observation_id":"9382b176-b8b7-4f09-88c6-f410b7890aaf","resolution":{"observed_at":"2026-08-10T23:33:56.342524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.322276Z","title":"One TTS alignment to rule them all,","venue":null,"work_id":"4c7426d7-d605-49d9-91ff-50e703ecc9a2","year":2022},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.038207Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:6ac0b059d56c48776bb92eff9421465190953e7b553c3687a75b837849581a03","observation_id":"f0ef5ba8-ea54-4ef7-a2e0-17783fb8252f","resolution":{"observed_at":"2026-08-10T23:33:56.326971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.307316Z","title":"Meta-StyleSpeech : Multi-Speaker Adaptive Text-to-Speech Generation,","venue":null,"work_id":"78c5f512-ae3e-4ddc-ba71-ae3c619773c2","year":2021},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.042644Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:18e07873a1fdf6f0ab87f896595e846f63518c988add69147dbff41c3e1e5d69","observation_id":"d9078847-cc98-4bba-a151-30d4a22038c3","resolution":{"observed_at":"2026-08-10T23:33:56.312197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.293213Z","title":"Neural Discrete Representation Learning,","venue":null,"work_id":"1c056fe1-6067-4335-a9fe-ef7a59ef7386","year":2017},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.047331Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:825d64d9273d82e288104c31b15b52b91ae2495406c43165db334726390fba51","observation_id":"4eba0b97-1f60-431f-bbfd-390c5b60ad1c","resolution":{"observed_at":"2026-08-10T23:33:56.297286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.279435Z","title":"Denoising Diffusion Probabilistic Models,","venue":null,"work_id":"f6f39b11-bd29-435e-8423-5a4c1f259515","year":2020},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.051721Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:906878798252402e44c2a4b276744d519827a071a0e045481c9791a38c02df85","observation_id":"29d51dbf-2c53-450c-8a62-205117f9797d","resolution":{"observed_at":"2026-08-10T23:33:56.283889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.056337Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.056337Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:a9cdc16f55121fc0d8c07bafe6c81046b8dffce8a1b96a6780b792d3f3a7ea8a","observation_id":"1ec483cc-4d90-4046-adfc-852af9108672","resolution":{"observed_at":"2026-08-10T23:33:56.056337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.256235Z","title":"ProsoSpeech: Enhancing Prosody With Quantized Vector Pre-training in Text-to-Speech,","venue":null,"work_id":"d2fa6bb5-2c50-4a2f-94b0-612a7cf311a1","year":2022},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.060818Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:8e4c7b8e525c400bccd25cba74c4450fc02f9776b8e83739bba84806f7deea48","observation_id":"0e7e9042-33f4-4d02-baf8-6208fb0c8a6d","resolution":{"observed_at":"2026-08-10T23:33:56.260513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.240526Z","title":"Language Models are Unsupervised Multitask Learners,","venue":null,"work_id":"25d2ba4e-700c-401f-af9e-96315d37a69a","year":2019},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.065141Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:f03c7c351fb326460f12d8c7e79579ef5601cc746a5e17ed4f98927352e62a61","observation_id":"23d7844a-e2f6-4d83-9fef-2ed788c1df22","resolution":{"observed_at":"2026-08-10T23:33:56.245730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.224730Z","title":"CSTR VCTK Corpus: English Multi-speaker Corpus for CSTR V oice Cloning Toolkit (version 0.92),","venue":null,"work_id":"05356a47-948c-41db-9e9b-7c1574517e55","year":2019},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.069431Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:fbec827bb5c571a977152a6a1042067cb28e998f1f36880544fe5bb97e98accf","observation_id":"d3453a05-c41e-48a2-9416-c4e4e36264bd","resolution":{"observed_at":"2026-08-10T23:33:56.229694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.209953Z","title":"LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus,","venue":null,"work_id":"89ba4603-e33d-4930-a4dc-f7cc4df101cf","year":2023},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.074175Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:f21a65e526356033e27705657b9108585187602b520ce21e5ae9286fd63b4071","observation_id":"18f8a39d-d911-4600-8832-ba1880980335","resolution":{"observed_at":"2026-08-10T23:33:56.214818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.194790Z","title":"Robust Speech Recognition via Large-Scale Weak Su- pervision,","venue":null,"work_id":"2d731812-86a2-446e-b737-328808ac15d2","year":2023},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.078711Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:3a82c26ee224315b5d1dcdf2472516b910095a8de0509ff5f8f90a58d8ad16e9","observation_id":"5eb6ee85-955e-4622-9db4-a63d68472191","resolution":{"observed_at":"2026-08-10T23:33:56.199648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.179409Z","title":"Resemblyzer,","venue":null,"work_id":"4689c788-f69c-4f69-aee0-71587f88bf01","year":2020},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.083238Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:5d13637c4b79d1b161afe63d2e1c4ffdbb1c474d934bc85706876f163761e0e0","observation_id":"d7fb2b4b-2b90-4e08-b1f8-223f6ea86706","resolution":{"observed_at":"2026-08-10T23:33:56.184094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:33:56.162321Z","title":"HiFi-GAN: Generative Adversarial Net- works for Efficient and High Fidelity Speech Synthesis,","venue":null,"work_id":"9e4909b9-7b52-4450-ba6b-8cd8e826cd00","year":2020},"citing_paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:33:56.087718Z"},"links":{"citing_paper":"/paper/2412.20155"},"observation_digest":"sha256:2714f1e48e5d8bb4a4c0c003c3dfa2b36240a255899102fe9bbcf3e47edb9fcb","observation_id":"865c6e60-bb0b-43e5-85db-273d0e64fde6","resolution":{"observed_at":"2026-08-10T23:33:56.168979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.20155","last_updated":"2024-12-28T13:54:30Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T14:55:34.864732Z","submitted_at":"2024-12-28T13:54:30Z","title":"Stable-TTS: Stable Speaker-Adaptive Text-to-Speech Synthesis via Prosody Prompting"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2412.20155."}