{"as_of":"2026-08-20T14:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:884850c585f0612eda799115aadb86b02e67347af918462edc8acf6ebfeb97bc","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:37:05.011278Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11737/citation-record","integrity":"/paper/2608.11737/integrity","json":"/paper/2608.11737/citation-record.json","paper":"/paper/2608.11737"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-16T00:37:04.855832Z","title":"Seed-tts: A family of high-quality versatile speech generation models.arXiv preprint arXiv:2406.02430, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.855832Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:54b054eff292dd9ed8afbce7e5dbb381ef0f8420d44728edbc16942d16fa23d9","observation_id":"6299754f-6941-43b3-9c65-1897d925b67e","resolution":{"observed_at":"2026-08-16T00:37:04.855832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T22:45:01.557030Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-16T00:37:04.860178Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model.arXiv preprint arXiv:2406.04904, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.860178Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:034d6c2ced2ee212d47880b098b6737e7658cdb2b81e9246a18114cb8034c88c","observation_id":"24f6b3a3-7e86-4b8a-bf33-72248c77c095","resolution":{"observed_at":"2026-08-16T00:37:04.860178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-16T00:37:04.864550Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio.arXiv preprint arXiv:2106.06909, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.864550Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:46ad08d92436cc44bef79166c234c5df5698fd1c8b16c9c009601303b1a52f8c","observation_id":"ef19d6b0-298f-446a-838c-2426a92e094b","resolution":{"observed_at":"2026-08-16T00:37:04.864550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.626652Z","title":"Ds-codec: Dual-stage training with mirror-to-nonmirror architecture switching for speech codec","venue":null,"work_id":"b211d408-92f4-433e-b5ea-776ed2b01e3a","year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.868619Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:9bfc2d25475b2fb51b52aab2cbaa6a2dcfc3eea89b0d1a05fcc3ce4e51738c37","observation_id":"c7db203f-2dcf-4328-b109-506bf25fb32d","resolution":{"observed_at":"2026-08-16T00:37:05.631902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11611","last_updated":"2026-06-10T03:23:21Z","snapshot_observed_at":"2026-08-14T10:11:40.647550Z","submitted_at":"2026-06-10T03:23:21Z","title":"SARA: A Dual-Stream VAE for High-Fidelity Speech Generation via Integrating Semantic and Acoustic Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11611","snapshot_observed_at":"2026-08-16T00:37:04.872459Z","title":"Sara: A dual-stream vae for high-fidelity speech generation via integrating semantic and acoustic representations.arXiv preprint arXiv:2606.11611, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.872459Z"},"links":{"cited_paper":"/paper/2606.11611","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:20885a08cc421590de4041798cb58c3f80ed881240c513578e719d57e64a25dd","observation_id":"775d7f71-93cd-4c9b-aacd-a5b1b1044671","resolution":{"observed_at":"2026-08-16T00:37:04.872459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.609230Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing.IEEE Journal of Selected Topics in Signal Processing, 16(6):1505–1518, 2022","venue":null,"work_id":"cebf0d6c-a36c-4869-a102-7373f4a42c48","year":2022},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.876165Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:ae48740ffc2e7849c76be6275cd79e7a68bcbcea6363966a9b19c25511e693f4","observation_id":"26e56797-04fd-4565-8829-026f3014147c","resolution":{"observed_at":"2026-08-16T00:37:05.616681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.880497Z","title":"Neural codec language models are zero-shot text to speech synthesizers.IEEE Transactions on Audio, Speech and Language Processing, 33:705–718, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.880497Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:cae870d4e9ed62c289e81e663b30f90d9a79fb73b9aaf6e91a3ba366676752fc","observation_id":"d0725086-5c4b-4806-88ac-ad3c29b57b46","resolution":{"observed_at":"2026-08-16T00:37:04.880497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.884261Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.884261Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:c4ad2ff66976158583b459af35db5cd0d019e7e9016d5cb60572e4249567b44c","observation_id":"f3a9f138-c9ae-41a3-b09a-77a8b5b633de","resolution":{"observed_at":"2026-08-16T00:37:04.884261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.888080Z","title":"W2v-bert: Combining contrastive learning and masked language modeling for self-supervised speech pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.888080Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:930b40ff7b88ac29cb3b42970fccf27c0b28cfaab66c861dd21b86d59f9c3812","observation_id":"97897886-1e82-4a23-8a54-9682a6b4b788","resolution":{"observed_at":"2026-08-16T00:37:04.888080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-16T00:37:04.891909Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens.arXiv preprint arXiv:2407.05407, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.891909Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:503470e9291be7c4f4ff36d787e4f25701e94cbb951467f94251de93010eecd1","observation_id":"cf54ab6f-ceb9-43f5-8639-0c71bc5ee143","resolution":{"observed_at":"2026-08-16T00:37:04.891909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-16T00:37:04.896325Z","title":"Cosyvoice 3: Towards in-the-wild speech generation via scaling-up and post-training.arXiv preprint arXiv:2505.17589, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.896325Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:9a2d35c846415ce946c60131dcfec4fdee55b94747f5c8e78f39b41427052cad","observation_id":"4f0f3479-6dfa-4191-9acf-269cb5071608","resolution":{"observed_at":"2026-08-16T00:37:04.896325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-16T00:37:04.900278Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models.arXiv preprint arXiv:2412.10117, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.900278Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:5e1b45c1bff078eaf02cb6671a5116ab9f669792dac0d81603c561cdae516683","observation_id":"dff943c9-eaae-4729-be9c-2d189e7ef9cc","resolution":{"observed_at":"2026-08-16T00:37:04.900278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-16T00:37:04.903997Z","title":"High fidelity neural audio compression.arXiv preprint arXiv:2210.13438, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.903997Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:167a4edeece9fc7653f414c6435d132bce22607e92a9b20fb9399b47f6fd1f20","observation_id":"47121a70-ff15-4021-a5c8-1efac8aa7538","resolution":{"observed_at":"2026-08-16T00:37:04.903997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.907580Z","title":"E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.907580Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:578e812dc8d8d7eb7d799b838ea63714dbe623268258073be2a617f30e9af14b","observation_id":"cde3c9fd-c867-4eae-8885-5230e107130d","resolution":{"observed_at":"2026-08-16T00:37:04.907580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-19T21:11:09.673876Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-16T00:37:04.911143Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit.arXiv preprint arXiv:2305.11013, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.911143Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:f6ddb2c96f89061117e4e76daa9929e12f496b4f918acd66c70a29d0f472b0ca","observation_id":"ee9a78e7-0c36-4084-b44b-9198b2f3fd84","resolution":{"observed_at":"2026-08-16T00:37:04.911143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-16T00:37:04.915043Z","title":"Conformer: Convolution-augmented transformer for speech recognition.arXiv preprint arXiv:2005.08100, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.915043Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:7ca33282f0607ac8459d804b81b7043b217376b4040d4ab088ace44907cd8dec","observation_id":"848bc857-ef5c-43a4-a6b0-e6b640ba068f","resolution":{"observed_at":"2026-08-16T00:37:04.915043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-08-19T09:44:27.064800Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-16T00:37:04.919126Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications.arXiv preprint arXiv:2409.03283, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.919126Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:d39472f453dc8c35cf43a9d775ca2a409e2cc4bb5874f37ee63b10f2922a594e","observation_id":"d68c1bcb-43ad-440c-b9ef-a1e1f4946ff5","resolution":{"observed_at":"2026-08-16T00:37:04.919126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.923020Z","title":"Didispeech: A large scale mandarin speech corpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.923020Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:c934fe342b56c768a180674bcc8b11b55352d8510228c1eb8eb63ede256f93c3","observation_id":"f76cc8bc-1f3a-4b96-927c-a71265d63cf7","resolution":{"observed_at":"2026-08-16T00:37:04.923020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.926907Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.926907Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:4608693e8b51edc017bf775c22d4cd23ba16d3db962de11e567e631068fdc4c5","observation_id":"2f2cd431-891c-4a07-ad23-0bb3de3965c2","resolution":{"observed_at":"2026-08-16T00:37:04.926907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.544375Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units.IEEE/ACM transactions on audio, speech, and language processing, 29:3451–3460, 2021","venue":null,"work_id":"46340563-38f6-4f01-b3af-83e67bb44a41","year":2021},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.931008Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:10599a77a0f143ff06e28092b469e08d1ab4553dd723c91c783f0b30270576bd","observation_id":"faf71c01-bf65-4aa7-b665-7701c3e67bc2","resolution":{"observed_at":"2026-08-16T00:37:05.549427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.935124Z","title":"Ditar: Diffusion transformer autoregressive modeling for speech generation.arXiv preprint arXiv:2502.03930, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.935124Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:825c5fd5bdee69fd354be50bd23d2974e54d53c7752ad125681a543adfc0fee5","observation_id":"3657d78c-4938-47de-9af2-cfa2f82cc64d","resolution":{"observed_at":"2026-08-16T00:37:04.935124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-16T12:55:06.202467Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-16T00:37:04.938708Z","title":"Megatts 3: Sparse alignment enhanced latent diffusion transformer for zero-shot speech synthesis.arXiv preprint arXiv:2502.18924, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.938708Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:d88b855a9fd168fded0ba8af240fff031f7ebe919a6c5fc7d298b63efad04ca8","observation_id":"38fea359-7336-4eca-8aec-8ec2fa84dc1d","resolution":{"observed_at":"2026-08-16T00:37:04.938708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.530170Z","title":"Libriheavy: A 50,000 hours asr corpus with punctuation casing and context","venue":null,"work_id":"3315885c-2ce7-4b06-8c41-6a6d149dcf4c","year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.942649Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:95ece6b9f75be2df4b0563133ffaf9749a8a575d74bee2b8c499b3b9e5b44afc","observation_id":"7eb41eb7-2020-4432-89de-a3686b7633d0","resolution":{"observed_at":"2026-08-16T00:37:05.534863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.515159Z","title":"High- fidelity audio compression with improved rvqgan.Advances in Neural Information Processing Systems, 36:27980–27993, 2023","venue":null,"work_id":"2bc47383-ec99-4711-aa83-c1cae9c9b12d","year":2023},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.946072Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:33d0955bc5941294022d34843ad171492e20bcd2b03940fc6c3baee508e80751","observation_id":"201224c3-6514-4c19-a9a5-45de04100265","resolution":{"observed_at":"2026-08-16T00:37:05.521990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11427","last_updated":"2025-02-17T17:34:45Z","snapshot_observed_at":"2026-08-19T00:29:49.236242Z","submitted_at":"2024-06-17T11:25:57Z","title":"DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11427","snapshot_observed_at":"2026-08-16T00:37:04.949485Z","title":"Ditto-tts: Diffusion transformers for scalable text-to-speech without domain-specific factors.arXiv preprint arXiv:2406.11427, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.949485Z"},"links":{"cited_paper":"/paper/2406.11427","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:c5178a0e11e7d946c1a827d6a9731011fd06503ad92ec3f1a98c94efab202289","observation_id":"0f71aab3-e39d-4989-b3f4-31a948676316","resolution":{"observed_at":"2026-08-16T00:37:04.949485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09943","last_updated":"2024-11-15T04:43:44Z","snapshot_observed_at":"2026-08-18T12:41:13.446582Z","submitted_at":"2024-11-15T04:43:44Z","title":"Zero-shot Voice Conversion with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09943","snapshot_observed_at":"2026-08-16T00:37:04.953206Z","title":"Zero-shot voice conversion with diffusion transformers.arXiv preprint arXiv:2411.09943, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.953206Z"},"links":{"cited_paper":"/paper/2411.09943","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:c852d9aaba5965def2d1172c6a07efb49eebdaf38cc0de34dc3b59fc927b077e","observation_id":"6e64899a-7835-46d9-bb90-30dbda7a87e4","resolution":{"observed_at":"2026-08-16T00:37:04.953206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-08-19T01:24:41.802615Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-08-16T00:37:04.957117Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis.arXiv preprint arXiv:2406.05551, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.957117Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:9df1ed6562f4deebc049204ef5429a553cf55935be7fad2a3b6fb6f51c9eb926","observation_id":"4b115cb4-af6c-4869-9f42-bc6710c32c45","resolution":{"observed_at":"2026-08-16T00:37:04.957117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05763","last_updated":"2024-06-19T04:52:56Z","snapshot_observed_at":"2026-08-19T12:28:14.370407Z","submitted_at":"2024-06-09T12:32:42Z","title":"WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05763","snapshot_observed_at":"2026-08-16T00:37:04.960658Z","title":"Wenetspeech4tts: A 12,800-hour mandarin tts corpus for large speech generation model benchmark.arXiv preprint arXiv:2406.05763, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.960658Z"},"links":{"cited_paper":"/paper/2406.05763","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:2907e8f84399ea1da14ca81789ef07e85c5ad8579cf75eb6f38a1f3d2d9d7b6a","observation_id":"ea442264-10cd-41a2-98d6-e8cf3df62d6f","resolution":{"observed_at":"2026-08-16T00:37:04.960658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.964166Z","title":"Librispeech-pc: Benchmark for evaluation of punctuation and capitaliza- tion capabilities of end-to-end asr models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.964166Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:c96deae5a828a2f4d27177a5c76a656032d0b5b34739cf9ec7e5f96168badfde","observation_id":"c0a8bac5-196d-4068-8128-52d64fa6ed3c","resolution":{"observed_at":"2026-08-16T00:37:04.964166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.967650Z","title":"Autoregressive speech synthesis without vector quantization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.967650Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:754c559d0631c3b6258a29058b0f4ee1e514ee84ea1fa47e71a4ff62da57f8dd","observation_id":"90ac5d2e-5115-4339-aa2e-12d74942f7f7","resolution":{"observed_at":"2026-08-16T00:37:04.967650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.971209Z","title":"Librispeech: an asr corpus based on public domain audio books","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.971209Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:e448d0545ac3d8188dd191fe3d3c65fc3cdbb3f068070611e8350daed7c2b082","observation_id":"3caaa9a8-a762-44b4-abb2-2e4f28dba4d6","resolution":{"observed_at":"2026-08-16T00:37:04.971209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.975118Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.975118Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:f6fd4f75c5ead37af812d3b50e0e1a2ef9f0b2985b26047ab4725e298e43e305","observation_id":"a9d67925-d54f-4a3d-99e7-02fc5d60a9ff","resolution":{"observed_at":"2026-08-16T00:37:04.975118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:04.978650Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.978650Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:65de46f72e950a41c183bd22212f1d7d9d68715a58763d13d569a8c19af527b6","observation_id":"dbfe518d-49fe-447c-aead-9e343fd9bef5","resolution":{"observed_at":"2026-08-16T00:37:04.978650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-08-18T17:50:53.134857Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-16T00:37:04.982405Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis.arXiv preprint arXiv:2306.00814, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.982405Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:b05c3e2cc442977375292c269f00c47cbe4da64d1fddcfe70ad1dee5a3bca7d5","observation_id":"bef0a40f-7795-4b00-ac2a-a536a6ff8af7","resolution":{"observed_at":"2026-08-16T00:37:04.982405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-08-20T01:09:59.849605Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-16T00:37:04.986772Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens.arXiv preprint arXiv:2503.01710, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.986772Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:2e6066e5d44dd779f20c4d1b64b275a1e9ef79cea7bef82b8d54457ca777ae07","observation_id":"a1c13e3b-44d7-4ed7-934c-2568ce3b2d8d","resolution":{"observed_at":"2026-08-16T00:37:04.986772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-16T00:37:04.990844Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer.arXiv preprint arXiv:2409.00750, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.990844Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:aa6b5915af7015dce49809228d5f459d365f71b7f8f22823b4871931010ed3cd","observation_id":"ae40bb28-6d73-43a9-a72c-fa9cccee1085","resolution":{"observed_at":"2026-08-16T00:37:04.990844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05377","last_updated":"2024-09-09T07:18:07Z","snapshot_observed_at":"2026-08-16T20:32:23.736592Z","submitted_at":"2024-09-09T07:18:07Z","title":"BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05377","snapshot_observed_at":"2026-08-16T00:37:04.994189Z","title":"Bigcodec: Pushing the limits of low-bitrate neural speech codec.arXiv preprint arXiv:2409.05377, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.994189Z"},"links":{"cited_paper":"/paper/2409.05377","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:c80e63513f6ca92daa16a9baca0c189a022bb2f3447a4e774864af80a4937140","observation_id":"81311671-a9d0-4270-9e88-5af927fd25c1","resolution":{"observed_at":"2026-08-16T00:37:04.994189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-16T15:04:18.834535Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-16T00:37:04.998310Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models.arXiv preprint arXiv:2308.16692, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:04.998310Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:a9253640111ded519aa9246d5b04ac9583c26afb165fe4803928340ed24dbde6","observation_id":"c8019c36-794d-4b8e-9aed-58afb3dd4281","resolution":{"observed_at":"2026-08-16T00:37:04.998310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12456","last_updated":"2026-04-22T07:37:41Z","snapshot_observed_at":"2026-08-13T00:49:16.394376Z","submitted_at":"2026-04-14T08:42:10Z","title":"X-VC: Zero-shot Streaming Voice Conversion in Codec Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12456","snapshot_observed_at":"2026-08-16T00:37:05.002453Z","title":"X-vc: Zero-shot streaming voice conversion in codec space","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.002453Z"},"links":{"cited_paper":"/paper/2604.12456","citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:259221662c5ddedbb70d16e61f3956b87f0a8037bf43972f5aa23e60ec440525","observation_id":"3e209853-2f7b-4c21-9c50-9e32064c4973","resolution":{"observed_at":"2026-08-16T00:37:05.002453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.007627Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.007627Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:eec35b64cf3835441a3f9a524420940881bdea07bc67d4540f016afe179671af","observation_id":"17a4ed74-2ab2-4784-b52c-030b5cb0a95a","resolution":{"observed_at":"2026-08-16T00:37:05.007627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:37:05.011278Z","title":"V oxcpm: Tokenizer-free tts for context-aware speech generation and true-to-life voice cloning.arXiv preprint arXiv:2509.24650, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:37:05.011278Z"},"links":{"citing_paper":"/paper/2608.11737"},"observation_digest":"sha256:d318d20a0460a4c137a0242d6b63faeba26b1b99ca73233d8d2036dbec5d9216","observation_id":"e29db32b-1c62-41d3-8dc8-db4e941dadf6","resolution":{"observed_at":"2026-08-16T00:37:05.011278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.11737","last_updated":"2026-08-12T07:23:54Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-18T22:02:39.463120Z","submitted_at":"2026-08-12T07:23:54Z","title":"Phoenix TTS: High-Fidelity Synthesis and Voice Conversion via Flow-Matching-Driven Speech Tokenization"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2608.11737."}