{"as_of":"2026-08-18T03:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3fb15ad3276834f8f5b2c0ee7368165fb7638923c3682f28ade7688345c37866","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:19:58.490777Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T23:22:40.218077Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19462","snapshot_observed_at":"2026-07-12T23:22:40.218077Z","title":"V oices- tar: Robust zero-shot autoregressive tts with duration con- trol and extrapolation.arXiv preprint arXiv:2505.19462,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.27383","last_updated":"2026-04-10T12:44:27Z","snapshot_observed_at":"2026-08-15T10:26:03.792198Z","submitted_at":"2026-04-10T12:44:27Z","title":"Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T23:22:40.218077Z"},"links":{"cited_paper":"/paper/2505.19462","citing_paper":"/paper/2605.27383"},"observation_digest":"sha256:6c25ddc14d96c00bffa2118f58d11a7bdd9dabae9363303398e7f322cf5f6814","observation_id":"4a70ccd9-9a71-43f5-a190-b1e16e566dd0","resolution":{"observed_at":"2026-07-12T23:22:40.218077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19462/citation-record","integrity":"/paper/2505.19462/integrity","json":"/paper/2505.19462/citation-record.json","paper":"/paper/2505.19462"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:49.841291Z","title":"Soundstream: An end-to-end neural audio codec.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:495–507, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:49.841291Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:5ff9091f7d8804f2d436f6cfca86bd32d88eeec7f01e5c05fb9422e4e1773f68","observation_id":"1d9a321e-26ae-4b4f-8f8e-d74b54358d5a","resolution":{"observed_at":"2026-08-07T14:19:49.841291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T14:19:49.901237Z","title":"High fidelity neural audio compression.ArXiv, abs/2210.13438, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:49.901237Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:b4f6fda88a7451f6e272255e85d0ab41d648407584f08cfc45d57fe07d0ed8e1","observation_id":"70b9dbd1-e4e9-4bdf-a20d-6b0e93c64b32","resolution":{"observed_at":"2026-08-07T14:19:49.901237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-16T05:58:47.061997Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-07T14:19:50.066833Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching.ArXiv, abs/2410.06885, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.066833Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:aaa7a433c2237cd1d14970564c4f38799d11223c3b21a7e01488b8bf0a8741b3","observation_id":"2460dc9a-5101-4a73-b0ba-b16d0f199337","resolution":{"observed_at":"2026-08-07T14:19:50.066833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:50.173827Z","title":"Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.173827Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:c46b7862fcb7825184269ecba801b6adefb94e21666d1f039bb2bb6bdfe759af","observation_id":"c05b4db4-dc42-462e-93ba-1d2c9cada271","resolution":{"observed_at":"2026-08-07T14:19:50.173827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T14:19:50.254673Z","title":"Neural codec language models are zero-shot text to speech synthesizers.ArXiv, abs/2301.02111, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.254673Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:c3267345b41baf918e9b8ae0e28d2e0d3175f14e515c5a000ed7bd7064e55f3b","observation_id":"413b2487-d923-4f77-921b-443342a17858","resolution":{"observed_at":"2026-08-07T14:19:50.254673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:05.251968Z","title":"Vall-e 2: Neural codec language models are human parity zero-shot text to speech synthesizers, 2024","venue":null,"work_id":"0a46a08f-6b19-4684-b1e6-472669e31811","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.374743Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:683834f8a872a7f3ebed90cb6cd9c5815e2800e0d74bfcef8f63d82886f2a2f2","observation_id":"e854fbbc-f772-4500-8022-aa9bc2b23ef7","resolution":{"observed_at":"2026-08-07T14:20:05.424679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:04.831068Z","title":"V oicecraft: Zero-shot speech editing and text-to-speech in the wild","venue":null,"work_id":"cb0eb0a6-551b-4229-bc29-eea2ecb2bad9","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.481272Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:44d8cb34cb3a53e5cfcd578578413b0baea478a6809752de0658a7e0122da15a","observation_id":"9918ab20-a36c-4e57-8ef1-e28ca562c615","resolution":{"observed_at":"2026-08-07T14:20:05.056341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:04.486853Z","title":"On generative spoken language modeling from raw audio.Transactions of the Association for Computational Linguistics, 9:1336–1354, 2021","venue":null,"work_id":"90623ad3-737d-417a-9253-57345019e580","year":2021},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.603358Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:bd61a224a1bc398b6f474dcc3a0ca2f623326317916d245bd3fee55c744ba5d6","observation_id":"6404e8c6-308b-48ab-b2ff-92543293ef9a","resolution":{"observed_at":"2026-08-07T14:20:04.656485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:04.115428Z","title":"Audiolm: A language modeling approach to audio generation.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 31:2523–2533, 2022","venue":null,"work_id":"166ac955-ac20-4427-9fb6-e0dcac53c7fa","year":2022},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.727860Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:09d8fa053ebed5a198710412e9e019e1d08d1b15a426ead3e70c8a83f2a34db0","observation_id":"09cc527d-f973-43eb-9ce5-a5c6bd7309e5","resolution":{"observed_at":"2026-08-07T14:20:04.287314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-07T14:19:50.833721Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.833721Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:92a7d6cc4d196e242e05fda9fd17dfe9ef7b02479c1a3a12dce85cbc0a55c360","observation_id":"ebbb6bb1-5a6c-4a0b-8b3c-05f49645f4d4","resolution":{"observed_at":"2026-08-07T14:19:50.833721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:03.813346Z","title":"Speak, read and prompt: High-fidelity text-to-speech with minimal supervision.Transactions of the Association for Computational Linguistics, 11:1703–1718, 2023","venue":null,"work_id":"d70329de-389a-421e-9ba6-5fda7e7f564f","year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.893333Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:cc7ade73145514297e6f8707b5efbd42cc4c3e20008608ddf0c8c85eeb6eb55d","observation_id":"986297ee-6df1-432f-954f-d02096739bf5","resolution":{"observed_at":"2026-08-07T14:20:03.955411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-16T15:32:35.509283Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-07T14:19:50.973655Z","title":"Soundstorm: Efficient parallel audio generation.ArXiv, abs/2305.09636, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:50.973655Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:450d018fdde2eda927925874dc3180099dc7fe0ec18f4aa400de21c45f0fb148","observation_id":"bb56d6d4-287a-4e76-8944-dd5c35448e75","resolution":{"observed_at":"2026-08-07T14:19:50.973655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-07T14:19:51.036153Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale.ArXiv, abs/2306.15687, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.036153Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:b8185ab98fbfff6c5461e6f3f756d362657d6560da41e9896bb693067f419088","observation_id":"c44eb73f-b23e-479f-822f-8d99bf5d7fe1","resolution":{"observed_at":"2026-08-07T14:19:51.036153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-07T14:19:51.135367Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer.ArXiv, abs/2409.00750, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.135367Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:97cf97acf481be00501d0bfbf6594e0a85c4b22d34fa310dc5326d9f0fd9398f","observation_id":"03333264-800a-4980-89ee-16fd2c942e25","resolution":{"observed_at":"2026-08-07T14:19:51.135367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22179","last_updated":"2025-03-11T19:21:57Z","snapshot_observed_at":"2026-08-16T13:04:54.578632Z","submitted_at":"2024-10-29T16:17:01Z","title":"Robust and Unbounded Length Generalization in Autoregressive Transformer-Based Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2410.22179","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.22179","snapshot_observed_at":"2026-08-07T14:19:58.942363Z","title":"Robust and Unbounded Length Generalization in Autoregressive Transformer-Based Text-to-Speech","venue":"cs.CL","work_id":"155f87d3-d086-4ab1-9adb-6d427e75af54","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.283267Z"},"links":{"cited_paper":"/paper/2410.22179","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:ad43428fe0b3dc3b352cb7e624178c172eb244b3381b282cb29f00f48551af35","observation_id":"3a1a758a-6b3e-4758-a03d-e2c1796f49f5","resolution":{"observed_at":"2026-08-07T14:19:58.963053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T14:19:51.454188Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens.ArXiv, abs/2407.05407, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.454188Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:eec671a2fd2f94f5113a7ce3fe46a591d6a3c012b49a940378a5df781388f932","observation_id":"27763106-efe7-4f7b-834b-59b89b87e191","resolution":{"observed_at":"2026-08-07T14:19:51.454188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-07T14:19:51.609437Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models.ArXiv, abs/2412.10117, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.609437Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:5369c054d768b8cbb2aba0efc278eda911eb560f7ff38f0549a4724cb7d4ef3a","observation_id":"9382fd7f-03e0-478b-9daa-2c1b9d74e65d","resolution":{"observed_at":"2026-08-07T14:19:51.609437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:03.513999Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis","venue":null,"work_id":"2572e2a0-8f41-42a6-8210-9ac5b9624125","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.705529Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:31559f77e80f273ed5b5aa466a6524629da4a82d0ecde336be561acbd5eba972","observation_id":"3b032d13-40de-4694-b4d7-3fd94ebbce1d","resolution":{"observed_at":"2026-08-07T14:20:03.667748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:03.297350Z","title":"Ella-v: Stable neural codec language modeling with alignment-guided sequence reordering","venue":null,"work_id":"0e7cc485-0fa6-4f2e-9fef-e6e4e999b302","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.826778Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:7ed44ac46b093347ba7394f36470c6d41c6a8b378f225aa319de284d84db2561","observation_id":"b84f76b2-5175-4208-9515-21c1bc861091","resolution":{"observed_at":"2026-08-07T14:20:03.396435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07855","last_updated":"2024-06-12T04:09:44Z","snapshot_observed_at":"2026-08-16T13:43:55.619101Z","submitted_at":"2024-06-12T04:09:44Z","title":"VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07855","snapshot_observed_at":"2026-08-07T14:19:51.952647Z","title":"Vall-e r: Robust and efficient zero-shot text-to-speech synthesis via monotonic alignment.ArXiv, abs/2406.07855, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.952647Z"},"links":{"cited_paper":"/paper/2406.07855","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:7d205ae54b173e1a9ccc7a2388746de20504d044ec6a7b8ce94320b8e7611e0f","observation_id":"c099402e-4fee-4705-b271-6f0c51e6f718","resolution":{"observed_at":"2026-08-07T14:19:51.952647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:03.067499Z","title":"Vall-t: Decoder-only generative transducer for robust and decoding- controllable text-to-speech","venue":null,"work_id":"a631bfef-e735-49e4-8545-200862e6cbf3","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:52.092794Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:7847c4bcdda7721dc07814dd9887951b702a1e512308adcfccff7d73811773f7","observation_id":"474ee284-a658-4782-b777-5fa639db753e","resolution":{"observed_at":"2026-08-07T14:20:03.193256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:02.884306Z","title":"Attention- constrained inference for robust decoder-only text-to-speech.2024 IEEE Spoken Language Technology Workshop (SLT), pages 630–637, 2024","venue":null,"work_id":"ecef1740-563e-40e7-9b95-5f426bd464d2","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:52.174655Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:d97df8d2cef4132ac1649acf0f0840e88772754b3adf31b23fbc8c6689cb235f","observation_id":"669cdead-4f97-4776-88a7-4186167f048e","resolution":{"observed_at":"2026-08-07T14:20:02.969811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17957","last_updated":"2024-06-25T22:18:52Z","snapshot_observed_at":"2026-08-16T13:39:37.022353Z","submitted_at":"2024-06-25T22:18:52Z","title":"Improving Robustness of LLM-based Speech Synthesis by Learning Monotonic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17957","snapshot_observed_at":"2026-08-07T14:19:52.306333Z","title":"Improving robustness of llm-based speech synthesis by learning monotonic alignment.ArXiv, abs/2406.17957, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:52.306333Z"},"links":{"cited_paper":"/paper/2406.17957","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:610d77b6e41713f42f5247e44589bd919fbc54fd2787a80a93791053ea354461","observation_id":"60758394-101e-43fd-8c43-d555c12e201d","resolution":{"observed_at":"2026-08-07T14:19:52.306333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11630","last_updated":"2024-09-18T01:31:19Z","snapshot_observed_at":"2026-08-16T13:17:39.547697Z","submitted_at":"2024-09-18T01:31:19Z","title":"Speaking from Coarse to Fine: Improving Neural Codec Language Model via Multi-Scale Speech Coding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11630","snapshot_observed_at":"2026-08-07T14:19:52.424117Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:52.424117Z"},"links":{"cited_paper":"/paper/2409.11630","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:c1f25537ea476167145b4309d49ce4a2553dba8ce24c6e05e2c754bd29ea9def","observation_id":"85484e04-365d-408c-a020-e216707c56b9","resolution":{"observed_at":"2026-08-07T14:19:52.424117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:02.743627Z","title":"Mega-TTS 2: Boosting prompting mechanisms for zero-shot speech synthesis","venue":null,"work_id":"9cb23cc8-2e86-401a-ac8c-473d74468679","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:52.548815Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:a91ac2f04fa0d91d76188b4af30b2f6a15ea001b38a660c717c224ed6b5f9a0d","observation_id":"32e5db4f-f25a-4307-9d78-607b7fadd358","resolution":{"observed_at":"2026-08-07T14:20:02.826188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07556","last_updated":"2025-01-02T03:07:29Z","snapshot_observed_at":"2026-08-16T13:19:21.283826Z","submitted_at":"2024-09-11T18:24:07Z","title":"SSR-Speech: Towards Stable, Safe and Robust Zero-shot Text-based Speech Editing and Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07556","snapshot_observed_at":"2026-08-07T14:19:52.702338Z","title":"Ssr-speech: Towards stable, safe and robust zero-shot text-based speech editing and synthesis.ArXiv, abs/2409.07556, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:52.702338Z"},"links":{"cited_paper":"/paper/2409.07556","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:1354bba98d1d01cd94e6f7f8804a9b2a6a48229d0d2ab3a3a05b9524e3e5f1b9","observation_id":"ed023195-40ab-4345-b43f-4eda5a5f4a1a","resolution":{"observed_at":"2026-08-07T14:19:52.702338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03204","last_updated":"2024-05-19T21:34:28Z","snapshot_observed_at":"2026-08-16T14:03:44.923690Z","submitted_at":"2024-04-04T05:15:07Z","title":"RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03204","snapshot_observed_at":"2026-08-07T14:19:52.899498Z","title":"Rall-e: Robust codec language modeling with chain-of-thought prompting for text-to-speech synthesis.ArXiv, abs/2404.03204, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:52.899498Z"},"links":{"cited_paper":"/paper/2404.03204","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:ccf06913ca4e42cfe4445a0f348f76c8da46d1883d9e246148b80cdc641865c0","observation_id":"873d0146-bc69-4a97-8ac2-5e2a681475df","resolution":{"observed_at":"2026-08-07T14:19:52.899498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-08-16T13:47:03.288626Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-07T14:19:53.043874Z","title":"Enhancing zero-shot text-to-speech synthesis with human feedback.ArXiv, abs/2406.00654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.043874Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:30f964190fe634ec726c8d9127334a6f8a31d856b75d04cc927e7c4a1acc8b94","observation_id":"35f44ca9-e9d1-47d2-974d-62fe1ca1d699","resolution":{"observed_at":"2026-08-07T14:19:53.043874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02243","last_updated":"2024-07-02T13:04:04Z","snapshot_observed_at":"2026-08-16T13:37:45.320757Z","submitted_at":"2024-07-02T13:04:04Z","title":"Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02243","snapshot_observed_at":"2026-08-07T14:19:53.169474Z","title":"Robust zero-shot text-to-speech synthesis with reverse inference optimization.ArXiv, abs/2407.02243, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.169474Z"},"links":{"cited_paper":"/paper/2407.02243","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:f8f58ac69dfc519881a82242ca1b5af869186b4332ff24ffa4f6f9d1dad060f9","observation_id":"4ff82b7b-3459-4cce-a038-ca8c65736997","resolution":{"observed_at":"2026-08-07T14:19:53.169474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:02.551919Z","title":"Desta, Roy Fejgin, Rafael Valle, and Jason Li","venue":null,"work_id":"cc048dd0-a6b0-4a9c-8e68-0b9ce2f9ad3c","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.311490Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:0632ce207e4af8584baf98c39ef4a049479ad8f06c586473e41a77b5a8eaf93a","observation_id":"cb710981-e29d-40bd-8c39-1305b93c9d47","resolution":{"observed_at":"2026-08-07T14:20:02.632742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-17T12:37:56.992873Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-07T14:19:53.462342Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling.ArXiv, abs/2303.03926, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.462342Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:53d64621d42027d9771b6abb5a9dda0c48918531d12c0740fc77720adaf0cfea","observation_id":"7e1872e8-7f8e-468d-bf75-a5acd1a15bc1","resolution":{"observed_at":"2026-08-07T14:19:53.462342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00976","last_updated":"2024-11-01T13:54:48Z","snapshot_observed_at":"2026-08-16T13:46:54.193784Z","submitted_at":"2024-06-03T04:16:30Z","title":"Generative Pre-trained Speech Language Model with Efficient Hierarchical Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00976","snapshot_observed_at":"2026-08-07T14:19:53.626191Z","title":"Generative pre-trained speech language model with efficient hierarchical transformer.ArXiv, abs/2406.00976, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.626191Z"},"links":{"cited_paper":"/paper/2406.00976","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:f34f8214eb25ba49613d2e5ab355ce72b1231c8bd7f290afafbf7f65186a7cb5","observation_id":"012daf19-969a-4d96-a9d1-43fba4969a32","resolution":{"observed_at":"2026-08-07T14:19:53.626191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-16T15:29:41.877037Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-07T14:19:53.771128Z","title":"Viola: Unified codec language models for speech recognition, synthesis, and translation.ArXiv, abs/2305.16107, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.771128Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:49b0782a0f07e95b4492dfadbe7563a708baba4ffb44c8483197791ec9618a67","observation_id":"dc3048c9-080b-4860-b527-1fcdc0f87fc5","resolution":{"observed_at":"2026-08-07T14:19:53.771128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-16T14:54:18.806254Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-07T14:19:53.892566Z","title":"Lauragpt: Listen, attend, understand, and regenerate audio with gpt.ArXiv, abs/2310.04673, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:53.892566Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:020a6a78c23268ab03f5ec4e79f0a9cfd1bf4df9d760ff4d99d440ceb89f8a9a","observation_id":"6279db10-5903-4d71-adf5-822e051483e3","resolution":{"observed_at":"2026-08-07T14:19:53.892566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:02.357673Z","title":null,"venue":null,"work_id":"2af20b57-4209-49ca-a605-f5f9ea4acbf0","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:54.016530Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:0d7313e5ad5d0f01b9ec404a46caaa6a515b50a2b0965d2ac77b6c00f866f079","observation_id":"f41a6ef4-5484-4196-b1e3-a003a49b9111","resolution":{"observed_at":"2026-08-07T14:20:02.462834Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18045","last_updated":"2024-01-31T18:06:29Z","snapshot_observed_at":"2026-08-16T14:22:46.684222Z","submitted_at":"2024-01-31T18:06:29Z","title":"SpeechComposer: Unifying Multiple Speech Tasks with Prompt Composition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18045","snapshot_observed_at":"2026-08-07T14:19:54.204415Z","title":"Speechcomposer: Unifying multiple speech tasks with prompt composition.ArXiv, abs/2401.18045, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:54.204415Z"},"links":{"cited_paper":"/paper/2401.18045","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:4bccf30ab66d034c0a054a481b9f80b4c44996ad97579e2648b7fb160a66c19e","observation_id":"d7ab772c-e025-41bb-a22a-24ce39553164","resolution":{"observed_at":"2026-08-07T14:19:54.204415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:02.164299Z","title":"Metis: A foundation speech generation model with masked generative pre-training","venue":null,"work_id":"140eb000-83a2-4f81-b77e-231c7d0d89fc","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:54.327352Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:9b5376f462eb48476247e0d389b7a856dd6559d7e4001af43cd8e2c0048f2e0c","observation_id":"84f6cce3-b598-495d-8db5-7f4ce98de632","resolution":{"observed_at":"2026-08-07T14:20:02.247472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:01.973137Z","title":"Prompttts: Controllable text-to-speech with text descriptions.ICASSP 2023 - 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 1–5, 2022","venue":null,"work_id":"f58a2bdf-65a1-4f2b-bbe0-732823984e92","year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:54.422588Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:f4c069a51642bdc4d4526ecfe19363cbadcef12412b241dedbf352cd91797a71","observation_id":"556d9d7d-cac4-4f08-b791-226968ee62bb","resolution":{"observed_at":"2026-08-07T14:20:02.047892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13662","last_updated":"2023-06-25T11:42:52Z","snapshot_observed_at":"2026-08-17T18:42:13.982509Z","submitted_at":"2023-01-31T14:26:52Z","title":"InstructTTS: Modelling Expressive TTS in Discrete Latent Space with Natural Language Style Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13662","snapshot_observed_at":"2026-08-07T14:19:54.567317Z","title":"Meng, and Dong Yu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:54.567317Z"},"links":{"cited_paper":"/paper/2301.13662","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:63f9ad65250028f76e30f4c998ef29a48620fefcfde109c17ccca33ba223f300","observation_id":"fc53d6c9-e5c1-4e46-8f80-0122508deb35","resolution":{"observed_at":"2026-08-07T14:19:54.567317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19522","last_updated":"2023-06-01T09:30:41Z","snapshot_observed_at":"2026-08-16T15:28:05.625617Z","submitted_at":"2023-05-31T03:16:59Z","title":"PromptStyle: Controllable Style Transfer for Text-to-Speech with Natural Language Descriptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19522","snapshot_observed_at":"2026-08-07T14:19:54.715981Z","title":"Promptstyle: Controllable style transfer for text-to-speech with natural language descriptions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:54.715981Z"},"links":{"cited_paper":"/paper/2305.19522","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:41841b547626366704bc3e95f72ee275299210bb5be9efa3a53902c2a1016ff8","observation_id":"2ceec292-ba82-4ff9-8de3-dfdc53dd723a","resolution":{"observed_at":"2026-08-07T14:19:54.715981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14430","last_updated":"2023-08-28T09:06:32Z","snapshot_observed_at":"2026-08-16T15:05:20.175465Z","submitted_at":"2023-08-28T09:06:32Z","title":"TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models","version":1},"cited_work":{"arxiv_id":"2308.14430","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.14430","snapshot_observed_at":"2026-08-07T14:19:58.700116Z","title":"TextrolSpeech: A Text Style Control Speech Corpus With Codec Language Text-to-Speech Models","venue":"eess.AS","work_id":"ab5cdcee-d4b9-4c62-b6e7-41796539921d","year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:54.931851Z"},"links":{"cited_paper":"/paper/2308.14430","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:0204c368eb8703343556a0bfd28e8d0cdf5307511460c4cea2d898045f872845","observation_id":"a3ac4ea4-86e6-4c5e-976e-593653ca213a","resolution":{"observed_at":"2026-08-07T14:19:58.766245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-16T15:03:09.770881Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-08-07T14:19:55.063985Z","title":"Prompttts 2: Describing and generating voices with text prompt.ArXiv, abs/2309.02285, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.063985Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:c8ab6f889aba5e032b85b24125dc763b432d602f1b171972df96dddcecb0a8c6","observation_id":"1a8ba9e7-f22b-493f-b6e8-46229dd6c244","resolution":{"observed_at":"2026-08-07T14:19:55.063985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-16T14:21:59.601701Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-07T14:19:55.191205Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations.ArXiv, abs/2402.01912, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.191205Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:28a61ae79bfd1a49f2630b3ca1549d6fc79a259c782d90d61b15fc5f9bdfb5ea","observation_id":"a0230389-f536-413d-b453-4a4d8395e27d","resolution":{"observed_at":"2026-08-07T14:19:55.191205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:01.772237Z","title":"Scaling rich style-prompted text-to-speech datasets","venue":null,"work_id":"7bccc693-5797-421b-b2b5-3a787bb1b594","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.310667Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:356907f840f6edbfd9780558e86746c5fa8f40a4f9f1f8740711e6640245384a","observation_id":"44ff2b8f-9d24-4841-84b3-62414e426ed8","resolution":{"observed_at":"2026-08-07T14:20:01.854731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T14:19:55.465301Z","title":"Moshi: a speech-text foundation model for real-time dialogue.ArXiv, abs/2410.00037, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.465301Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:eeed101a1ae420cad36b12061f5901d7a7cc6d14a8126981ef668efac433041f","observation_id":"61f0d21b-5e1d-40cf-91ef-18199528b189","resolution":{"observed_at":"2026-08-07T14:19:55.465301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02622","last_updated":"2024-08-05T16:47:22Z","snapshot_observed_at":"2026-08-16T13:28:24.886213Z","submitted_at":"2024-08-05T16:47:22Z","title":"Language Model Can Listen While Speaking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02622","snapshot_observed_at":"2026-08-07T14:19:55.581577Z","title":"Language model can listen while speaking.ArXiv, abs/2408.02622, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.581577Z"},"links":{"cited_paper":"/paper/2408.02622","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:a73b58e79b5e0744846990ccb4a10cafd0e6f3258c4a932774aac33fd3dda058","observation_id":"91447976-ac9f-4a61-9ca5-c61009dce3b5","resolution":{"observed_at":"2026-08-07T14:19:55.581577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T14:19:55.644063Z","title":"Llama- omni: Seamless speech interaction with large language models.ArXiv, abs/2409.06666, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.644063Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:325c4db4888a4788bc8f1a9c228e4e75d63e353b714bbbb1cf5be1072258c28e","observation_id":"9ca4f5b7-4a33-40d1-aa74-c22a6e2656c5","resolution":{"observed_at":"2026-08-07T14:19:55.644063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18138","last_updated":"2024-11-27T08:38:57Z","snapshot_observed_at":"2026-08-18T02:53:18.978175Z","submitted_at":"2024-11-27T08:38:57Z","title":"SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18138","snapshot_observed_at":"2026-08-07T14:19:55.723227Z","title":"Salmonn-omni: A codec-free llm for full-duplex speech understanding and generation.ArXiv, abs/2411.18138, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.723227Z"},"links":{"cited_paper":"/paper/2411.18138","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:6821a1fa67df92bdf4b72f2d2d2b7c93164d265f78265c2e938e02bd9901b961","observation_id":"0c878640-8d68-4e7b-97c0-52e1752594f0","resolution":{"observed_at":"2026-08-07T14:19:55.723227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11727","last_updated":"2024-09-18T06:27:26Z","snapshot_observed_at":"2026-08-17T05:48:37.076526Z","submitted_at":"2024-09-18T06:27:26Z","title":"Enabling Real-Time Conversations with Minimal Training Costs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11727","snapshot_observed_at":"2026-08-07T14:19:55.833609Z","title":"Enabling real-time conversations with minimal training costs.ArXiv, abs/2409.11727, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.833609Z"},"links":{"cited_paper":"/paper/2409.11727","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:04b9f830c4ea72e82861a45571c747ae935a4b7fc6638cc083caabf1339dc156","observation_id":"832e6d0f-0bf6-40fd-bae9-48da9426e755","resolution":{"observed_at":"2026-08-07T14:19:55.833609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08035","last_updated":"2024-10-12T06:46:39Z","snapshot_observed_at":"2026-08-16T13:11:15.896754Z","submitted_at":"2024-10-09T05:04:31Z","title":"IntrinsicVoice: Empowering LLMs with Intrinsic Real-time Voice Interaction Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08035","snapshot_observed_at":"2026-08-07T14:19:55.952954Z","title":"Intrinsicvoice: Empowering llms with intrinsic real-time voice interaction abilities.ArXiv, abs/2410.08035, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.952954Z"},"links":{"cited_paper":"/paper/2410.08035","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:de76d7b1128ed6ff4d5b37fab446822eef3a488d45e5928d7c9427bbae18e7b1","observation_id":"b1889e61-ab6e-4d2e-92cd-ac6d3819c761","resolution":{"observed_at":"2026-08-07T14:19:55.952954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:01.529188Z","title":"Llm-enhanced dialogue management for full-duplex spoken dialogue systems","venue":null,"work_id":"9db5ea79-e52b-4fa0-b783-6d203b51c9e8","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.035454Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:508aca7c849dd58cb65705f9bec92656372f1495a701f0fd59987f4404715740","observation_id":"c1dad2e6-6205-48be-adc3-86345098b25a","resolution":{"observed_at":"2026-08-07T14:20:01.644408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-08-16T20:07:00.407637Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-08-07T14:19:56.106020Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data.ArXiv, abs/2402.08093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.106020Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:f837ec0aacf7ec5a2a9a8c9e45e2b6ddb58922e6ae29aecf223e357ffa97386f","observation_id":"5c38d1d3-bd8b-427f-bff7-00677543bc84","resolution":{"observed_at":"2026-08-07T14:19:56.106020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04380","last_updated":"2024-10-06T07:20:58Z","snapshot_observed_at":"2026-08-16T13:12:13.892396Z","submitted_at":"2024-10-06T07:20:58Z","title":"HALL-E: Hierarchical Neural Codec Language Model for Minute-Long Zero-Shot Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04380","snapshot_observed_at":"2026-08-07T14:19:56.181491Z","title":"Hall-e: Hierarchical neural codec language model for minute-long zero-shot text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.181491Z"},"links":{"cited_paper":"/paper/2410.04380","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:b249a4ce9441b37e54bcfb32967c3bdaabf1aa5e0c44c696397c596c5bd1f916","observation_id":"992085bb-1e13-4e77-a897-c0c0e2e2511d","resolution":{"observed_at":"2026-08-07T14:19:56.181491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-16T15:39:31.485174Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-07T14:19:56.312162Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers.ArXiv, abs/2304.09116, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.312162Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:f70e7a0566398b0a29ad891fcbc43777465e76c069ecaf7671a37bc8c2777220","observation_id":"d5407115-8935-4156-98a6-2901d3393e33","resolution":{"observed_at":"2026-08-07T14:19:56.312162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:01.330701Z","title":"Shih, Rohan Badlani, João Felipe Santos, Evelina Bakhturina, Mikyas T","venue":null,"work_id":"2263d160-541d-46b5-9754-6d0f97b812dc","year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.381071Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:89b34d782f2382946e76cb889cbe0ad13a8eb56968f7b4fb6e8055eb1efbe54e","observation_id":"556b0628-1098-4b0f-8d76-a2ba4395e922","resolution":{"observed_at":"2026-08-07T14:20:01.415277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:01.093694Z","title":"Ditto-tts: Diffusion transformers for scalable text-to-speech without domain-specific factors","venue":null,"work_id":"a228a3a6-87b9-4f0a-a2c0-89bf8967f6d5","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.451386Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:c69fa9e3d8948d34b093f6a33b7c0a5c5162bcb62cbfcab2ef26506da1a8a62b","observation_id":"37fd8c4d-8a2b-4ab1-87ab-b21dca27f849","resolution":{"observed_at":"2026-08-07T14:20:01.204599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:56.583065Z","title":"Peebles and Saining Xie","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.583065Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:427dafdab509c10edea9875316af003380e4d35cdb7db4745216d0c046841d62","observation_id":"433d7614-33db-4942-975d-0ae475faa212","resolution":{"observed_at":"2026-08-07T14:19:56.583065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:00.886267Z","title":"Dmospeech: Direct metric optimization via distilled diffusion model in zero-shot speech synthesis","venue":null,"work_id":"0a5d5c64-15bd-4d8a-8fd1-ca2c8d0cfee6","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.683947Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:acfd711016b7c161ce0ab2ee6cbdea4f86c36109997ba3d121b36fdf56932078","observation_id":"22457582-96a8-4eea-9a32-f5ecc442de3a","resolution":{"observed_at":"2026-08-07T14:20:00.990413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:00.751681Z","title":"E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts.2024 IEEE Spoken Language Technology Workshop (SLT), pages 682–689, 2024","venue":null,"work_id":"2b607d79-f211-4c19-9544-e0e89f41050d","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.779894Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:521e0d29cc21a8ed9bd2618e8f5a59a452502eaad5924ec7fe68748337182ca8","observation_id":"1e2b3cef-62ad-48af-b47a-1ddb4dcb323e","resolution":{"observed_at":"2026-08-07T14:20:00.801253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-07T14:19:56.842801Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.842801Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:2c4e935c987e70ce7fd66f1ea16e7c376b0a26459045cc8492c069a0850d34ff","observation_id":"a77996d5-2d3b-4528-9b14-7bd57feddcde","resolution":{"observed_at":"2026-08-07T14:19:56.842801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-08-16T13:21:11.032842Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-07T14:19:56.932091Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications.ArXiv, abs/2409.03283, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:56.932091Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:9578f85cd4fd73de6546a17613dbd195cb37d3b9254b1c47be295c33e51fe6f9","observation_id":"235bff6a-1867-49b6-87de-bd2096abb91f","resolution":{"observed_at":"2026-08-07T14:19:56.932091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05284","last_updated":"2024-01-30T04:49:16Z","snapshot_observed_at":"2026-08-16T15:25:26.441326Z","submitted_at":"2023-06-08T15:31:05Z","title":"Simple and Controllable Music Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05284","snapshot_observed_at":"2026-08-07T14:19:57.022040Z","title":"Simple and controllable music generation.ArXiv, abs/2306.05284, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.022040Z"},"links":{"cited_paper":"/paper/2306.05284","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:ddd59e84c9b1f30a46ac4c16b6ce6f25f59e634274db88a113ef6866be65f6e5","observation_id":"62d1ea48-ddeb-422a-afc6-9cd1cf666d36","resolution":{"observed_at":"2026-08-07T14:19:57.022040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:57.089308Z","title":"Neural machine translation by jointly learning to align and translate, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.089308Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:1670e81a630d9856605c32d3c4c160b66238fa25e2c5319ae8b311139f76e4e4","observation_id":"b5d23f41-e7c4-4aef-9075-65944122b465","resolution":{"observed_at":"2026-08-07T14:19:57.089308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:00.629400Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2023","venue":null,"work_id":"acb7f1cc-de90-4a64-b6dd-6f56978e5454","year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.181904Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:b2d83ee6657efecaf9d474fc8424b4dd131e68128b10c20ac4df4261fb977892","observation_id":"d3c1883d-8489-4d10-998e-13991ac28e25","resolution":{"observed_at":"2026-08-07T14:20:00.668512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:57.278975Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.278975Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:d4e40a9f54498a924c24520d50874e2a7a3a958d1afb6c600dbe711b9020f360","observation_id":"deee603a-0ce1-4795-8030-32fc1e0db0d1","resolution":{"observed_at":"2026-08-07T14:19:57.278975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:57.355945Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.355945Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:4bd1eb9308ac8497ad7c7c4607fcb881c93759c9aca46d2ef03598b0bb0aca2b","observation_id":"0df4e2a8-decb-4308-9f13-f80961a67480","resolution":{"observed_at":"2026-08-07T14:19:57.355945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:57.434211Z","title":"Smith, and Mike Lewis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.434211Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:04678cc07628acbcb18367b05aee6e72607dba5dd3d14efdb2950abda8a77929","observation_id":"a4750667-7041-41f0-84fe-797038ed46c6","resolution":{"observed_at":"2026-08-07T14:19:57.434211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:00.490614Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation.2024 IEEE Spoken Language Technology Workshop (SLT), pages 885–890, 2024","venue":null,"work_id":"8cc89baf-7ae6-46e5-a40e-1307c34f550c","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.537109Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:b790d3af1fa65d737fdfde8a13daa943e35bbda007f62f772729b37d1379dd7e","observation_id":"032496ba-6547-4544-80ef-b8c1d4fbca3b","resolution":{"observed_at":"2026-08-07T14:20:00.546516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:00.317030Z","title":null,"venue":null,"work_id":"5a588d3c-ea84-4ce8-9458-0a5ad7ebda25","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.594796Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:2f8ba4f8f0564cf97bc26445511fcbc80f13653c9c8e826bdd36c542ba70d15b","observation_id":"99fa98a6-c588-438f-b2d3-69705bb847a2","resolution":{"observed_at":"2026-08-07T14:20:00.387300Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:20:00.130048Z","title":"eSpeak NG: Speech synthesiser.https://github.com/espeak-ng/espeak-ng","venue":null,"work_id":"2612c95d-fd45-46d5-83d3-0bf9debcf790","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.695586Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:f22e61be42428f10bec40838f86419ec0e52ce3e6246d1b02f5d272c916b6297","observation_id":"0b8773f0-7299-4522-ab03-186b7534942e","resolution":{"observed_at":"2026-08-07T14:20:00.232493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T14:19:57.780080Z","title":"Seed-tts: A family of high-quality versatile speech generation models.ArXiv, abs/2406.02430, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.780080Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:602a32647fed25af54902ee26ea19eeedc9f71a697cda0da007bda2f421d7a6d","observation_id":"8d541a03-a710-477c-a4db-f2ce42905748","resolution":{"observed_at":"2026-08-07T14:19:57.780080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:59.987555Z","title":"Zipformer: A faster and better encoder for automatic speech recognition","venue":null,"work_id":"888d51f9-faaf-4b64-902d-3fbb6a4b9347","year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.837727Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:5e051abf7f90f808660e8d608f8f916768e340846a343ebdbb78ec188101b54b","observation_id":"fc9d4cbb-a552-4058-8c24-680bc8651cad","resolution":{"observed_at":"2026-08-07T14:20:00.042837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:59.866142Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens","venue":null,"work_id":"64dd7800-5e92-43e0-b7fa-b9ee13a34208","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:57.919375Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:a7d8f4eab7519fed11516ec3e57ddfa8ed5b352ecc97266446e0ce26445f8f1c","observation_id":"cc47ff8e-9be7-4e0f-aaca-e4557fceaf5d","resolution":{"observed_at":"2026-08-07T14:19:59.926601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:59.679801Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022, 2022","venue":null,"work_id":"9a88d6d8-3993-485a-9e14-fc3b659b45d1","year":2022},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:58.017967Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:5225d1c92c4a15d4121d8fe7af6afe63347ef4c377b10286f37c32ffde606170","observation_id":"b8179d0d-46ab-486a-a30d-a4ba1206f51a","resolution":{"observed_at":"2026-08-07T14:19:59.759952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-08-16T23:32:22.645653Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T14:19:58.084628Z","title":"Robust speech recognition via large-scale weak supervision.ArXiv, abs/2212.04356, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:58.084628Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:b1d774b4e8a3055ed213c91ae082727d842614ace3014c3d1edba79c64c661c2","observation_id":"7ffd8915-540a-457e-ad2a-feebe127b0e5","resolution":{"observed_at":"2026-08-07T14:19:58.084628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:59.546190Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing.IEEE Journal of Selected Topics in Signal Processing, 16:1505–1518, 2021","venue":null,"work_id":"446e4037-b285-48d0-91b8-281abe05c9ab","year":2021},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:58.176788Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:3b6275d21cb07ad29538cf7d4bb077752cdc565e603518deefb50a2ef861e23e","observation_id":"9774d91c-d74b-419e-80da-0d25f97b1e5a","resolution":{"observed_at":"2026-08-07T14:19:59.605196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:59.393198Z","title":"Speech quality assessment","venue":null,"work_id":"132e44ce-bf69-4374-a943-fe382d6ea9a2","year":2011},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:58.249319Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:6d5d9cc892109fcbf206ea6716c87e2bf9598236743deaa4ede423c04b1e8591","observation_id":"fcdb7826-d3bc-4038-8c87-1cdf16295d18","resolution":{"observed_at":"2026-08-07T14:19:59.455875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:58.330976Z","title":"Llm.int8(): 8-bit matrix multiplication for transformers at scale, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:58.330976Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:83db3d839b05b7655856de50fd82e382a416ffc99904a417afd3c53d01c89c0f","observation_id":"8d91192c-2adb-4c99-bb69-82eb63c45c81","resolution":{"observed_at":"2026-08-07T14:19:58.330976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:59.233764Z","title":"Fast and high-quality auto- regressive speech synthesis via speculative decoding","venue":null,"work_id":"75ce3a86-dbfa-420f-8ce6-c0ad54e70d32","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:58.406514Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:e948f22309a4387eba0809eb2a534314c1a294521329167c75c43956d1eef4f0","observation_id":"bcfe4542-9f26-42fc-a7fd-831a2e9c5aa1","resolution":{"observed_at":"2026-08-07T14:19:59.295479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:19:59.085711Z","title":"natural” in comparative naturalness task with “similar","venue":null,"work_id":"f4225826-d43c-490e-822b-9f16b9071dec","year":2025},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:58.490777Z"},"links":{"citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:c79b76c2b6aa572e93b37dc0690a533ea7a82dcecda06c17fb6b0cd6afabfce8","observation_id":"0fa78f88-7c67-4229-9457-1550633ce4dd","resolution":{"observed_at":"2026-08-07T14:19:59.140627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":2,"verified_fuzzy":29},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 1 inbound Pith citation observation for arXiv:2505.19462."}