{"as_of":"2026-08-18T14:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d9b7f6e22efafdae710c43169e628f05cab4931e09cca99469a7a7073c65320","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:40:25.380445Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11593/citation-record","integrity":"/paper/2608.11593/integrity","json":"/paper/2608.11593/citation-record.json","paper":"/paper/2608.11593"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:24.887133Z","title":"SoundStream: An end- to-end neural audio codec.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:495–507, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.887133Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:9ccf4d947da50dcfa48ca4da80ee6032ad87fba8b4f6969c6e79dd733e0f17a0","observation_id":"e805ec3a-4354-44c9-8abb-983e9e7aaae1","resolution":{"observed_at":"2026-08-16T00:40:24.887133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-16T00:40:24.893723Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.893723Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:24bc1afcb00ad3c7ca3a10edc47fcca032ac57ca7500763d6d95eb302df4b019","observation_id":"f48e3008-64ad-4001-878c-7fd84a817a87","resolution":{"observed_at":"2026-08-16T00:40:24.893723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:24.899526Z","title":"High-fidelity audio compression with improved RVQGAN","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.899526Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:5d7b21e4ab90f3aeb7c06124c2337e027e14d251bc265e2f8b9c5df0cf641507","observation_id":"b9b46316-33a2-415e-9ff5-5d97a84632e4","resolution":{"observed_at":"2026-08-16T00:40:24.899526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-08-17T03:27:03.725457Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-16T00:40:24.905147Z","title":"Better speech synthesis through scaling.arXiv preprint arXiv:2305.07243, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.905147Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:b1167edf8ce480c5dd2127f72b10109004063256ac581cb03e7d162dc0b453fc","observation_id":"f33112ad-8a97-4523-85de-78b437ba2705","resolution":{"observed_at":"2026-08-16T00:40:24.905147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-16T00:40:24.911049Z","title":"Neural codec language models are zero-shot text to speech synthesizers.arXiv preprint arXiv:2301.02111, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.911049Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:2fda56d2d1c2c1c1f8993586c4174eae0fd61f4e4a264972c2b7a45fe7f280f3","observation_id":"c3011b86-331d-4869-8ea6-355dcd2ef766","resolution":{"observed_at":"2026-08-16T00:40:24.911049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-16T00:40:24.916854Z","title":"Seed-TTS: A family of high-quality versatile speech generation models.arXiv preprint arXiv:2406.02430, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.916854Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:7772f1d28a7d6dfdb69f693ebc5d436257578a35dc7f46f25330617f8731828b","observation_id":"ff403716-cafb-4b0e-a78e-9d0bb87ed7db","resolution":{"observed_at":"2026-08-16T00:40:24.916854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-16T00:40:24.923060Z","title":"CosyV oice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens.arXiv preprint arXiv:2407.05407, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.923060Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:fe8ed76d779a17366716170e0b48721ed004e8cd4b1938eeb4bb1fb06a41af2c","observation_id":"389b2010-ca7c-484a-aee2-1dd823fad805","resolution":{"observed_at":"2026-08-16T00:40:24.923060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-16T00:40:24.928185Z","title":"CosyV oice 2: Scalable streaming speech synthesis with large language models.arXiv preprint arXiv:2412.10117, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.928185Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:6e290fc7b234f85160fdf76952845af73589c464e1fc907d6691cfeb0d0abd3c","observation_id":"bb718ee1-7cd7-4fd5-86e5-ee0a231c36f0","resolution":{"observed_at":"2026-08-16T00:40:24.928185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-16T00:40:24.933442Z","title":"CosyV oice 3: Towards in-the-wild speech generation via scaling-up and post-training.arXiv preprint arXiv:2505.17589, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.933442Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:8fa39dd4c486cf89297dcde36f96e13c425a80fef8dd9fae11c21d5d675fb6bd","observation_id":"128799c2-0bda-4d2e-8bd3-85b2e53ae1d4","resolution":{"observed_at":"2026-08-16T00:40:24.933442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07916","last_updated":"2025-05-12T14:25:20Z","snapshot_observed_at":"2026-08-17T19:35:47.077535Z","submitted_at":"2025-05-12T14:25:20Z","title":"MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07916","snapshot_observed_at":"2026-08-16T00:40:24.938990Z","title":"MiniMax-Speech: Intrinsic zero-shot text-to-speech with a learnable speaker encoder.arXiv preprint arXiv:2505.07916, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.938990Z"},"links":{"cited_paper":"/paper/2505.07916","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:84397440da9be67c7c2bfaa41cb1b8fc3dd14615192e4cecb1ecaca974ed5409","observation_id":"7dd17738-c6e4-496b-8b23-6700317c5213","resolution":{"observed_at":"2026-08-16T00:40:24.938990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-08T23:22:17.610458Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-16T00:40:24.944475Z","title":"Llasa: Scaling train-time and inference-time compute for Llama-based speech synthesis.arXiv preprint arXiv:2502.04128, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.944475Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:8bd69bc94addc4087c36736d570dbf767a16b247ed324d5327d47b47b8e5974e","observation_id":"a247d038-f48d-43b7-8843-9a0cabb861a1","resolution":{"observed_at":"2026-08-16T00:40:24.944475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:24.949797Z","title":"GLM-TTS technical report.arXiv preprint arXiv:2512.14291, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.949797Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:7e7d71ffd8848fdd58fa811bd5543008b19a4677c23f9f3350adefc2dec35b9d","observation_id":"ba110c96-b42a-40f7-a287-93fc4fb0014a","resolution":{"observed_at":"2026-08-16T00:40:24.949797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-13T01:33:42.158497Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15621","snapshot_observed_at":"2026-08-16T00:40:24.954815Z","title":"Qwen3-TTS technical report.arXiv preprint arXiv:2601.15621, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.954815Z"},"links":{"cited_paper":"/paper/2601.15621","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:20c21ee9a6947ea50f1320102db10cc9411cbc1de23f36f1ce0eedf481f02117","observation_id":"d7b2c8f1-4399-4437-a100-28f26ec637fc","resolution":{"observed_at":"2026-08-16T00:40:24.954815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.23938","last_updated":"2026-07-27T02:30:15Z","snapshot_observed_at":"2026-08-17T16:06:22.299297Z","submitted_at":"2026-07-27T02:30:15Z","title":"Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm","version":1},"cited_work":{"arxiv_id":"2607.23938","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.23938","snapshot_observed_at":"2026-08-16T00:40:26.841735Z","title":"Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm","venue":"eess.AS","work_id":"c339fa6c-6011-4f88-a22f-32dc2ae5cee8","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.960358Z"},"links":{"cited_paper":"/paper/2607.23938","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:7c7aaf19792e54772d321ecd609f12eb5cb0927ac875bf5e686d35a71144d712","observation_id":"a15fa500-ebc6-46ef-9891-7ce5705d6651","resolution":{"observed_at":"2026-08-16T00:40:26.847896Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:24.965356Z","title":"Fish audio S2 technical report.arXiv preprint arXiv:2603.08823, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.965356Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:48c6bc85185893f8bd2acd73fc66bc1aaf9a9096997b67275615dfd8a146040c","observation_id":"87d36c2d-eb45-476c-8252-4cc375bc3c07","resolution":{"observed_at":"2026-08-16T00:40:24.965356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:24.970636Z","title":"MOSS-TTS technical report.arXiv preprint arXiv:2603.18090, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.970636Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:0b87f3fac022ba1dfad36e4d99b919887f05cb3c9006bd48eeb3462c97c5d1fd","observation_id":"89ad41b8-bb8e-48ea-bf2d-f69c172c8371","resolution":{"observed_at":"2026-08-16T00:40:24.970636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-08-13T16:11:28.134657Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-16T00:40:24.975736Z","title":"Spark-TTS: An efficient LLM-based text-to-speech model with single-stream decoupled speech tokens.arXiv preprint arXiv:2503.01710, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.975736Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:e2f554e1538934b0433a972f5029858b5d80c028a7ebf29dded95ba34b672676","observation_id":"2000ce91-14ae-4b79-9ae6-bb88bd612383","resolution":{"observed_at":"2026-08-16T00:40:24.975736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-16T15:06:17.970180Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-16T00:40:24.981589Z","title":"IndexTTS2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech.arXiv preprint arXiv:2506.21619, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.981589Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:8ce65fecffbfda2ee22730a5a772674c01759ed9c0c18afc7c15ec808c94fd3c","observation_id":"2a4a3f19-edd3-4042-8c13-52514f576082","resolution":{"observed_at":"2026-08-16T00:40:24.981589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-08-16T13:21:11.032842Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-16T00:40:24.987167Z","title":"FireRedTTS: A foundation text-to-speech framework for industry-level generative speech applications.arXiv preprint arXiv:2409.03283, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.987167Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:8e85d802a32204f2ecf30bc4ae4c8432b5d756108fadbc4771fe508d3a60146e","observation_id":"f801373a-e6a9-4e29-94d6-3317bd77ead8","resolution":{"observed_at":"2026-08-16T00:40:24.987167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:24.993372Z","title":"MiMo-Audio: Audio language models are few-shot learners.arXiv preprint arXiv:2512.23808, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.993372Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:713ecb3c4dc93af9d05e6921edca5e1e782737aab063103f00a84030c6b90d37","observation_id":"5e314825-09b3-4d1b-a1b0-634f1246503e","resolution":{"observed_at":"2026-08-16T00:40:24.993372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-08-13T23:38:52.637908Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-16T00:40:24.998635Z","title":"Step-Audio 2 technical report.arXiv preprint arXiv:2507.16632, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:24.998635Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:ba4339703135b6a18e1049ed0cb6cd8ce193758feae2f0ddcb9b9d74642e9583","observation_id":"2cb6cdce-fade-48dc-9163-1355ecf94a81","resolution":{"observed_at":"2026-08-16T00:40:24.998635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:25.004435Z","title":"Simple and controllable music generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.004435Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:c05abfc211065cf8a96222e90680396c3684ba6661da0f0b1387523af04d69e0","observation_id":"667be8b7-5893-4834-8b1d-3296326292ab","resolution":{"observed_at":"2026-08-16T00:40:25.004435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-16T00:40:25.009906Z","title":"Moshi: A speech-text foundation model for real-time dialogue.arXiv preprint arXiv:2410.00037, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.009906Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:f43638576ef9f6319da98f1aa95b0168bdc150286f631177659e65624b739b06","observation_id":"8b86a200-3300-4270-be8d-5eb160fd1cf6","resolution":{"observed_at":"2026-08-16T00:40:25.009906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:25.015753Z","title":"DiSTAR: Diffusion over a scalable token autoregressive representation for speech generation.arXiv preprint arXiv:2510.12210, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.015753Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:fa858959b782704e2a2e536de659392fa82f57ce6ea32ca16c94bdf1d72b5d1f","observation_id":"3d139120-1b51-46bd-9772-eb3b502008af","resolution":{"observed_at":"2026-08-16T00:40:25.015753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:25.022798Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.022798Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:5f55536996590441f496d62398c151cc0dafbcbb68e05e3fe5bf6760a4ae76e0","observation_id":"6aad38f3-6432-4f68-a72a-bb4cac0dfa31","resolution":{"observed_at":"2026-08-16T00:40:25.022798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:25.028068Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.028068Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:733c1ded9fd84eb16e6d9bfa7d87cf2f01269a60585139b466f14cf2e511ba60","observation_id":"87fbe408-4a65-4dac-8110-c350f42be3cc","resolution":{"observed_at":"2026-08-16T00:40:25.028068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:25.033611Z","title":"E2 TTS: Embarrassingly easy fully non-autoregressive zero-shot TTS","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.033611Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:395babd35b94b1ffc60ee40dd4c886671601ff2583abea3235f890ccf2380dfa","observation_id":"0db4ed6c-0757-4460-931c-660c015f3bec","resolution":{"observed_at":"2026-08-16T00:40:25.033611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-16T05:58:47.061997Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-16T00:40:25.039576Z","title":"F5-TTS: A fairytaler that fakes fluent and faithful speech with flow matching.arXiv preprint arXiv:2410.06885, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.039576Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:16df3c218b36a5e36f1c25898ca8b1f329c98b3e21e67bb74740a42d51e5c50a","observation_id":"cd6fe3c4-7543-4c15-a2d8-0b290ccd39a4","resolution":{"observed_at":"2026-08-16T00:40:25.039576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-16T15:32:35.509283Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-16T00:40:25.044878Z","title":"SoundStorm: Efficient parallel audio generation.arXiv preprint arXiv:2305.09636, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.044878Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:a88babbdce472ce2a87579dfa0441e110c97ae13efd95b0bc0738ca2c61fc98e","observation_id":"0ea104cb-4681-4bef-8298-85341d3e443a","resolution":{"observed_at":"2026-08-16T00:40:25.044878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:25.051412Z","title":"NaturalSpeech 3: Zero-shot speech synthesis with factorized codec and diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.051412Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:1e4de8dc529fa628fbfd626896f65bd7f12bb5d746f86e81d10f10a63c7d6de9","observation_id":"a46bc923-c6f9-4d8f-bd1d-9b285d13d33d","resolution":{"observed_at":"2026-08-16T00:40:25.051412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:25.056917Z","title":"MaskGCT: Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.056917Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:a377f0c8e0b03485f892df8e8e4851923d826da737c0af2b621803eaea90c376","observation_id":"f26c9346-c6c8-4b2e-898f-b88d471880ba","resolution":{"observed_at":"2026-08-16T00:40:25.056917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.726162Z","title":"Johnson, Jonathan Ho, Daniel Tarlow, and Rianne van den Berg","venue":null,"work_id":"98bf56bc-0990-4222-8eb7-72b65ab0ef6d","year":2021},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.062469Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:ae412b566e44558dfd84f5a716f77f7780ea688b86eec760ea788227930b5a74","observation_id":"d2f22061-83bf-47ce-b889-d188dcf62b77","resolution":{"observed_at":"2026-08-16T00:40:27.732705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:25.067949Z","title":"Discrete diffusion modeling by estimating the ratios of the data distribution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.067949Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:4f0e53898d59c87d348b8a99cf8b414a6006aae50e4e928a8111542639858fbf","observation_id":"db57c669-3b5a-41b7-abd5-d0cd2eebf058","resolution":{"observed_at":"2026-08-16T00:40:25.067949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.691397Z","title":"Chiu, Alexan- der Rush, and V olodymyr Kuleshov","venue":null,"work_id":"401c43d0-f638-4cbf-9974-b116dd81a079","year":2024},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.074048Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:374c6dcd81d5889a41b93b7839d36868543d280feb75b430ad1c6793d320cc5f","observation_id":"f8b29698-a3a1-485e-96de-583cf3fe2979","resolution":{"observed_at":"2026-08-16T00:40:27.697054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:25.079322Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.079322Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:6935f0dbb0a74f50e777438e85e35f1ab5d28d4c3f8e2703e09d7d182f8d1d0d","observation_id":"f40f2ebe-67dc-442b-86dc-4e313bfd3047","resolution":{"observed_at":"2026-08-16T00:40:25.079322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09992","last_updated":"2025-10-18T15:35:05Z","snapshot_observed_at":"2026-08-04T04:34:22.998376Z","submitted_at":"2025-02-14T08:23:51Z","title":"Large Language Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09992","snapshot_observed_at":"2026-08-16T00:40:25.084430Z","title":"Large language diffusion models.arXiv preprint arXiv:2502.09992, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.084430Z"},"links":{"cited_paper":"/paper/2502.09992","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:c9131a990332b1ebda2d2ac2e0f82f6862f35f401c0e23b15de5da164a71d0a8","observation_id":"2f13b8b3-cca3-43a4-b397-4f250a409bb6","resolution":{"observed_at":"2026-08-16T00:40:25.084430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15487","last_updated":"2025-08-21T12:09:58Z","snapshot_observed_at":"2026-08-14T18:38:02.862463Z","submitted_at":"2025-08-21T12:09:58Z","title":"Dream 7B: Diffusion Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15487","snapshot_observed_at":"2026-08-16T00:40:25.090799Z","title":"Dream 7B: Diffusion large language models.arXiv preprint arXiv:2508.15487, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.090799Z"},"links":{"cited_paper":"/paper/2508.15487","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:0c7dbc0a700f0cccc1fecb695845158e0b413a142d9da1b017338b9a9373eedd","observation_id":"bcfce8e3-3daf-40e2-89af-aa3f9aff2a39","resolution":{"observed_at":"2026-08-16T00:40:25.090799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17298","last_updated":"2025-06-17T17:06:18Z","snapshot_observed_at":"2026-08-16T00:24:16.429058Z","submitted_at":"2025-06-17T17:06:18Z","title":"Mercury: Ultra-Fast Language Models Based on Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17298","snapshot_observed_at":"2026-08-16T00:40:25.096604Z","title":"Mercury: Ultra-fast language models based on diffusion.arXiv preprint arXiv:2506.17298, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.096604Z"},"links":{"cited_paper":"/paper/2506.17298","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:a3a38be2fe48ed6795b6dd078335ad65a02f8e4fd9a3d0f978e1ed80cef8ab01","observation_id":"9202085e-1b06-4928-9a34-f94072035da1","resolution":{"observed_at":"2026-08-16T00:40:25.096604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02193","last_updated":"2025-08-04T08:43:01Z","snapshot_observed_at":"2026-08-13T09:36:05.994763Z","submitted_at":"2025-08-04T08:43:01Z","title":"Seed Diffusion: A Large-Scale Diffusion Language Model with High-Speed Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02193","snapshot_observed_at":"2026-08-16T00:40:25.102291Z","title":"Seed diffusion: A large-scale diffusion language model with high-speed inference.arXiv preprint arXiv:2508.02193, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.102291Z"},"links":{"cited_paper":"/paper/2508.02193","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:167c3687d6fc4a751483adce54adc2aa2bca3495f16af2921a1ef2af25569f62","observation_id":"2fa27e5d-7ef2-41df-a20b-8e8ac16fec95","resolution":{"observed_at":"2026-08-16T00:40:25.102291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-08-10T07:50:38.265616Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15745","snapshot_observed_at":"2026-08-16T00:40:25.109186Z","title":"LLaDA2.0: Scaling up diffusion language models to 100B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.109186Z"},"links":{"cited_paper":"/paper/2512.15745","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:8c2d6b0d3f8471710c33da8274f5bcd29a27206cfb9bf05208d33193b6b54bca","observation_id":"f1b2993f-3e95-4249-abfd-acd88a730c93","resolution":{"observed_at":"2026-08-16T00:40:25.109186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.658960Z","title":"Chiu, Zhihan Yang, Zhixuan Qi, Jiaqi Han, Subham Sekhar Sahoo, and V olodymyr Kuleshov","venue":null,"work_id":"9903470c-0d1f-41f7-aadb-dbee0256afe3","year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.114717Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:254d4a823861459d8eb751f8022040049c9a51682ba3708683e86becdee61195","observation_id":"591840f3-f639-4be5-9501-f462409acf9d","resolution":{"observed_at":"2026-08-16T00:40:27.665634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.641533Z","title":"Scaling diffusion language models via adaptation from autoregressive models","venue":null,"work_id":"8c905c57-3aa0-4ab2-83a3-06fb91f395f3","year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.121603Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:1172ab205d584fb17ccd8c923e967e95988bcacb61fee916d3cc97d6c440e4b0","observation_id":"478ede88-ccb1-4661-8c2b-af6f3ed851d8","resolution":{"observed_at":"2026-08-16T00:40:27.646767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:25.128873Z","title":"Fast-dLLM v2: Efficient block-diffusion LLM","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.128873Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:893746a8ec9c9a1b0c179a723a67021aeffb544be5e0c92bab6412e8e3c41797","observation_id":"afe55eeb-5f63-4f55-a599-22f2c2063eb6","resolution":{"observed_at":"2026-08-16T00:40:25.128873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:25.134673Z","title":"Sequential diffusion language models.arXiv preprint arXiv:2509.24007, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.134673Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:7f1ee7ac78f827ea3846cc1c815c79f3d50f19e723fd9780986250f0ff267bda","observation_id":"00a6024b-3379-447b-966e-e8aef4bcf578","resolution":{"observed_at":"2026-08-16T00:40:25.134673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-12T19:51:32.587082Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.23463","snapshot_observed_at":"2026-08-16T00:40:25.139841Z","title":"StepAudio 2.5 technical report.arXiv preprint arXiv:2605.23463, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.139841Z"},"links":{"cited_paper":"/paper/2605.23463","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:2b831048009129c1c37edb712bd6bba5cbdf529c6521f4885371adf60bd8f9c8","observation_id":"78e4914f-fb63-468c-98b7-979a34a62d7c","resolution":{"observed_at":"2026-08-16T00:40:25.139841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.26364","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:26.092774Z","title":"LLaDA-TTS: Unifying speech synthesis and zero-shot editing via masked diffusion modeling.arXiv preprint arXiv:2603.26364, 2026","venue":null,"work_id":"eb5815ce-760c-4bc9-9fad-b66a65b181e0","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.145077Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:f86828bfb2d9c540ebb01c39effe0c5e551c65046944f334ce6cc2a24ee30b4e","observation_id":"57f94976-6046-443a-b9c1-dc5fdd30c87c","resolution":{"observed_at":"2026-08-16T00:40:26.111805Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.22889","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:26.017671Z","title":"DiffuSpeech: Silent thought, spoken answer via unified speech- text diffusion.arXiv preprint arXiv:2601.22889, 2026","venue":null,"work_id":"40f08e23-c199-467e-8ed3-7b7aaea6ef6d","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.150006Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:53fd6fb695260a87dd3cfb82cc9162bfd55479dd21d13971d4a52e0f0f687f33","observation_id":"e81d885d-e5f5-41b9-a2d9-4d7891f9e834","resolution":{"observed_at":"2026-08-16T00:40:26.028258Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00688","last_updated":"2026-04-21T12:14:57Z","snapshot_observed_at":"2026-07-06T22:51:26.754746Z","submitted_at":"2026-04-01T09:45:51Z","title":"OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.00688","snapshot_observed_at":"2026-08-16T00:40:25.155751Z","title":"OmniV oice: Towards omnilingual zero-shot text-to-speech with diffu- sion language models.arXiv preprint arXiv:2604.00688, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.155751Z"},"links":{"cited_paper":"/paper/2604.00688","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:f2ce280ec09a4a1d617a6fc7f35a49265950dfaf5f51666073ddf08b97c3390e","observation_id":"98a5f179-4fed-4619-8621-08280873dec0","resolution":{"observed_at":"2026-08-16T00:40:25.155751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30748","last_updated":"2026-06-01T01:53:31Z","snapshot_observed_at":"2026-08-15T22:11:29.481885Z","submitted_at":"2026-05-29T02:25:02Z","title":"Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS","version":2},"cited_work":{"arxiv_id":"2605.30748","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.30748","snapshot_observed_at":"2026-08-16T00:40:25.912740Z","title":"Chatterbox-Flash: Prior-Calibrated Block Diffusion for Streaming Zero-Shot TTS","venue":"cs.SD","work_id":"b90d23a6-a522-404f-b47a-b91c57eb576c","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.161585Z"},"links":{"cited_paper":"/paper/2605.30748","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:556bd0a634a18a9393e1034619ad52b824469374442a59d8fa222d6ec7aad795","observation_id":"490026c5-ac1c-4f97-aabd-7304ef8c2fe2","resolution":{"observed_at":"2026-08-16T00:40:25.918892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-16T00:40:25.166914Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.166914Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:eb0238f8afbbe2a882c1351a411bd0a7ec89e354d3bdfb855c27e989ef06d4e3","observation_id":"074360d6-8526-4c92-93be-bb04c4490469","resolution":{"observed_at":"2026-08-16T00:40:25.166914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:25.171837Z","title":"V oxCPM: Tokenizer-free TTS for context-aware speech genera- tion and true-to-life voice cloning.arXiv preprint arXiv:2509.24650, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.171837Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:957ec9bc94e2e89d439550059204c52fd1d6c6fb368fe518effce8c2d4bb6905","observation_id":"52cc8349-ac76-42dd-98c5-46cec00de6c5","resolution":{"observed_at":"2026-08-16T00:40:25.171837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17175","last_updated":"2024-11-27T11:47:45Z","snapshot_observed_at":"2026-08-16T20:33:30.347717Z","submitted_at":"2024-08-30T10:24:07Z","title":"Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17175","snapshot_observed_at":"2026-08-16T00:40:25.177667Z","title":"Codec does matter: Exploring the semantic shortcoming of codec for audio language model.arXiv preprint arXiv:2408.17175, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.177667Z"},"links":{"cited_paper":"/paper/2408.17175","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:85b1b6c895760a0ca70e0fcf53c5f965d4795035d223f03f4b664647f409ca81","observation_id":"e2a714f9-8a76-4278-8760-ee261ec3b95d","resolution":{"observed_at":"2026-08-16T00:40:25.177667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.623509Z","title":"SpeechTokenizer: Unified speech tokenizer for speech large language models","venue":null,"work_id":"ad02e499-d3ae-4441-9b8c-87838dc251a0","year":2024},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.183840Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:92987850ff87e0e13801c804da76bf39e2ae43aeaacaf3f89ac32b4e629ddaab","observation_id":"9cebe932-f49a-4378-a694-f4ee21a69bcf","resolution":{"observed_at":"2026-08-16T00:40:27.628956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.602940Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":"7e76123e-5ac9-4423-af6a-7b1a191185a2","year":2022},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.188805Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:07a887161869cc9d3fa6f74832e1eb6a0564efdeea2588d02719ef8b27b97df0","observation_id":"62de1417-535f-44f5-94d1-18ef2f47568b","resolution":{"observed_at":"2026-08-16T00:40:27.609658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.583101Z","title":"HiFi-GAN: Generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":"96b02ab8-f217-4aab-b524-bbb8cd3060d7","year":2020},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.194056Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:91b6c046d381cf3419f0243d099ac5e92612caf8420a32605e2637b00cb0d6d7","observation_id":"388b7fb9-1796-4bd3-8956-e651984f2b11","resolution":{"observed_at":"2026-08-16T00:40:27.589174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.563217Z","title":"BigVGAN: A universal neural vocoder with large-scale training","venue":null,"work_id":"ee9e0304-b556-4159-afee-fe5ae6fc2548","year":2023},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.199085Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:5587e44bf7a9af790fb1854628590ad7325a5531530cef651d879a7abadcf4dd","observation_id":"631bdc40-d89e-4ac7-ace5-31312e8b7fcb","resolution":{"observed_at":"2026-08-16T00:40:27.569169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.544959Z","title":"Higgs audio v2: Text-audio foundation model.https://github.com/boson-ai/higgs-audio,","venue":null,"work_id":"de8e50ce-5957-4916-961a-cffdf682b0df","year":null},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.204473Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:4b57b4ef5c19bdd1165b075bcc86160143ce2d1d38a30d15e6180ab813b955c5","observation_id":"0755c884-03f5-45b1-9f02-8b01ec36648c","resolution":{"observed_at":"2026-08-16T00:40:27.550652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:25.215711Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.215711Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:a983a40ca91a27af3244192eeca8c1a2a54aa4713ddb2bbd7c22827c1aa4fca1","observation_id":"d7044a85-bfc2-423a-bb0e-0912c153731b","resolution":{"observed_at":"2026-08-16T00:40:25.215711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.485441Z","title":"d1: Scaling reasoning in diffusion large language models via reinforcement learning","venue":null,"work_id":"50f9e524-1554-4bcc-8489-04eafdaaf99d","year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.220764Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:607e61b615885977bc6bf7ea08d47c34f30b80cfb7206773db63a885f80af8a1","observation_id":"a9d5a483-a2bb-4c5e-ac72-000429ec4f77","resolution":{"observed_at":"2026-08-16T00:40:27.491484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.464841Z","title":"Training dif- fusion models with reinforcement learning","venue":null,"work_id":"ef35b295-0007-4735-b54a-a5ed46dd58b2","year":2024},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.226146Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:c3d796e966ba14f07ce811e1594344876f7ecc16c1ca236867224597f5276f94","observation_id":"7c172714-8c34-47fd-92c7-c7b975bc6b45","resolution":{"observed_at":"2026-08-16T00:40:27.471220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.15200","last_updated":"2026-07-16T16:57:34Z","snapshot_observed_at":"2026-08-16T08:58:48.046234Z","submitted_at":"2026-07-16T16:57:34Z","title":"Mask-Aware Policy Gradients for Diffusion Language Models","version":1},"cited_work":{"arxiv_id":"2607.15200","doi":"10.48550/arxiv.2607.15200","metadata_source":"pith","pith_arxiv_id":"2607.15200","snapshot_observed_at":"2026-08-16T12:16:17.039197Z","title":"Mask-Aware Policy Gradients for Diffusion Language Models","venue":"cs.CL","work_id":"9fa287c7-d187-4e12-8caa-6283bc5f12d8","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.231908Z"},"links":{"cited_paper":"/paper/2607.15200","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:59bc4f54e97489eda73eeff3e2fdfcfe88184b1b6db8ca443708f80de1df6f51","observation_id":"16a08523-06b5-4c92-9199-b4ca8ba1e95a","resolution":{"observed_at":"2026-08-16T00:40:25.729606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-16T00:40:25.237713Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.237713Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:da38fe17ebf4cab021f64e44459cae49affd2918027502edca9a8499265c3d1c","observation_id":"a7022029-a0c2-4541-bc6a-ee6b96531f1c","resolution":{"observed_at":"2026-08-16T00:40:25.237713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T00:40:25.245620Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.245620Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:f4fa3304f43c22291615a859ee9d29b29e6e262a22c258a9704f01a19666fb74","observation_id":"0999b830-8486-4a30-aef6-9956eb221776","resolution":{"observed_at":"2026-08-16T00:40:25.245620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2602.02204","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:25.656672Z","title":"vLLM-Omni: Fully disaggregated serving for any-to-any multimodal models.arXiv preprint arXiv:2602.02204, 2026","venue":null,"work_id":"b1bcc528-382d-4c14-97ef-7111b621ac8b","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.251439Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:54802bd4e736a934654fd50f764ee81342ec6e00d234591c2cea0312eb30a05a","observation_id":"72562f2b-97a4-47bd-9f3e-7245ec759b31","resolution":{"observed_at":"2026-08-16T00:40:25.663788Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-18T07:29:44.183618Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19931","snapshot_observed_at":"2026-08-16T00:40:25.256850Z","title":"Accelerating flow- matching-based text-to-speech via empirically pruned step sampling.arXiv preprint arXiv:2505.19931, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.256850Z"},"links":{"cited_paper":"/paper/2505.19931","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:07f89c613001e134be1eff89a50dfe4b925f9b7eb96948ac893471eaaa379b83","observation_id":"b3cb0fd2-0409-4b35-a793-3ff3247fa28c","resolution":{"observed_at":"2026-08-16T00:40:25.256850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13053","last_updated":"2025-08-07T03:12:26Z","snapshot_observed_at":"2026-08-17T05:48:22.688935Z","submitted_at":"2025-06-16T02:48:17Z","title":"ZipVoice: Fast and High-Quality Zero-Shot Text-to-Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13053","snapshot_observed_at":"2026-08-16T00:40:25.263064Z","title":"Zipvoice: Fast and high-quality zero-shot text-to-speech with flow matching.arXiv preprint arXiv:2506.13053, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.263064Z"},"links":{"cited_paper":"/paper/2506.13053","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:e80a0657701596e91e60f344a2ac2a1c32e3137b0409b3e3e967eb7f534d539f","observation_id":"e9b42b5c-8d5f-42b7-b6cc-28bd80a5fdf0","resolution":{"observed_at":"2026-08-16T00:40:25.263064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.445841Z","title":"V oxCPM2: Production deployment and inference performance.https://github.com/OpenBMB/ VoxCPM, 2026","venue":null,"work_id":"59e91631-c11b-44f5-a7d1-e2748f3283f1","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.268599Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:24498e3afd48a07778825906a9eb892999dc1901ae5b5f9c1dc569916555834b","observation_id":"3383c818-eeea-462f-92cd-7b1c7f92a210","resolution":{"observed_at":"2026-08-16T00:40:27.451743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.427439Z","title":"Spark-TTS: Nvidia triton inference serving.https://github.com/SparkAudio/Spark-TTS,","venue":null,"work_id":"757a5bc2-36c8-4bcd-993b-779ce3f10a16","year":null},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.274343Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:114e3679ebd4204747debbfd9593b542a56d6b0a68e583924ff259f9a69fcef5","observation_id":"d7d53a26-e462-4c9b-8a31-43f6f3272ed7","resolution":{"observed_at":"2026-08-16T00:40:27.433402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.387941Z","title":"SGLang-Omni: High-performance multi-stage pipeline framework for omni models.https: //github.com/sgl-project/sglang-omni, 2026","venue":null,"work_id":"b342c768-cbe4-4311-97d1-8e4de037273d","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.285545Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:10ca3d703f5db43cabda1f7444ecad11c47532e4fc120d4810df57329a478f88","observation_id":"14636bfa-2c68-48a3-859d-dde1e4b205a2","resolution":{"observed_at":"2026-08-16T00:40:27.393547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.407342Z","title":null,"venue":null,"work_id":"1662e56e-955b-4742-94ee-0a6d44954cad","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.279969Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:846ea03d40d37ac9e8ab44b33dbf9b55dd344bc78830a957b33d432428b3cdb8","observation_id":"6b387dc5-d8fc-4366-a29e-eb98ee7771d1","resolution":{"observed_at":"2026-08-16T00:40:27.413198Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.348159Z","title":"Models: Eleven flash v2.5.https://elevenlabs.io/docs/overview/models, 2026","venue":null,"work_id":"bc8a678e-c443-4547-9cab-3bd2cab18dad","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.298092Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:f68817fc758433a8853b46dee1c734561018997c63861af035a62faadc785de5","observation_id":"ef6be5de-06d9-48ce-a62c-9e32788f4257","resolution":{"observed_at":"2026-08-16T00:40:27.353717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.368369Z","title":"Sonic 3.5 self-hosted hardware selection and latency.https://docs.cartesia.ai/self-hosted/ hardware-selection, 2026","venue":null,"work_id":"f2ad6713-1484-4d2a-9abb-452643545050","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.292032Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:2c486bf58c1e04e0138402505d1d5a7a8de70974e6ee1894556ef25c6c46a229","observation_id":"ef907eb4-eeed-4b26-914e-d23be500c154","resolution":{"observed_at":"2026-08-16T00:40:27.374753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.310902Z","title":"Text-to-speech models: Play 3.0 mini.https://docs.play.ht/reference/models, 2026","venue":null,"work_id":"0ed41834-0a7a-463a-bc4a-cbdf638328e5","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.311830Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:6d4285697c90f16bdbaf3d707212cd01d2b4143f93179c848f8f887bffb3a0e4","observation_id":"6a673219-f2fd-4fbb-8ab4-cfdbd7c31cff","resolution":{"observed_at":"2026-08-16T00:40:27.316937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.329821Z","title":"Text-to-speech: Octave 2.https://dev.hume.ai/docs/text-to-speech-tts/overview, 2026","venue":null,"work_id":"ddde792e-ef7c-451e-b9d0-2e2f80fb789f","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.304257Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:43f696e3905d4d68bdda2edce5637e0fd86f349e90f68b113445c0e4a35983a9","observation_id":"7acea1b9-de6a-498d-98b7-e44b577c018d","resolution":{"observed_at":"2026-08-16T00:40:27.335785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.268841Z","title":"Vibevoice-realtime: Real-time streaming text-to-speech.https://github.com/microsoft/ VibeVoice, 2025","venue":null,"work_id":"61f8eab3-c76f-4ae2-ad79-8623a3149ea5","year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.323406Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:d3aa4de128ae5feef31aa4fa7edaef2b39aa76fab45e059e645aa6de788d3f5a","observation_id":"68e7dfd8-0b84-44cb-8346-d900beb3e6e8","resolution":{"observed_at":"2026-08-16T00:40:27.275358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.290317Z","title":"Aura-2 text-to-speech performance.https://developers.deepgram.com/changelog/2025/5/ 14, 2025","venue":null,"work_id":"8ec36afa-b890-4733-8e28-3688defca012","year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.317697Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:068ae6e4afc4ee7f2fa63bc2f630e928bd554a12b79d3c0f42a5681c5ef9b84c","observation_id":"e9c7d253-39f1-4494-855e-a0960c789a68","resolution":{"observed_at":"2026-08-16T00:40:27.296430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.247093Z","title":"MiniMax Speech-2.8.https://www.minimax-speech.com/, 2026","venue":null,"work_id":"732ee6ab-32f4-4d1e-bbe9-446bb1c1cae3","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.333666Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:86ec61fd57ff191a2117b996cf22c5bef8a82344760261ee80ef1cfdc50821d5","observation_id":"00097372-654a-40da-b6a6-9e9f4c095d87","resolution":{"observed_at":"2026-08-16T00:40:27.254329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06928","last_updated":"2026-06-05T05:43:15Z","snapshot_observed_at":"2026-08-16T17:28:12.915614Z","submitted_at":"2026-06-05T05:43:15Z","title":"VoxCPM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06928","snapshot_observed_at":"2026-08-16T00:40:25.328324Z","title":"V oxCPM2 technical report.arXiv preprint arXiv:2606.06928, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.328324Z"},"links":{"cited_paper":"/paper/2606.06928","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:be63424949f2c9e57eefe1ca3cff571ad8fbb1c192836d03996b049434f39a69","observation_id":"1ae9d38f-119e-42f2-afe5-0c9ec74fcc97","resolution":{"observed_at":"2026-08-16T00:40:25.328324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.195095Z","title":"Introducing S2.1 Pro: Our most expressive TTS model yet.https://fish.audio/blog/ s2-1-pro-free-api/, 2026","venue":null,"work_id":"c7c5ac1f-41b1-4b45-9d77-3e656d25c28c","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.343354Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:80d67e1889e56afda4db927a2b64ce8266771e2f0778f807d71d4e7c7bc7dd9e","observation_id":"60999807-8c61-4f19-8227-1ddfcbf47fa4","resolution":{"observed_at":"2026-08-16T00:40:27.207515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.222600Z","title":"Eleven v3.https://elevenlabs.io/v3, 2026","venue":null,"work_id":"2c528607-ded1-4f15-897a-effc7efbf06f","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.338581Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:eaa192fb44d69aba63fa3c18039264d9159b21d86c0650a8ea1cc9d173795107","observation_id":"f7499e1e-025f-4953-b3d0-1b59187a9342","resolution":{"observed_at":"2026-08-16T00:40:27.232812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.16211","last_updated":"2026-04-21T13:32:36Z","snapshot_observed_at":"2026-08-15T12:03:55.265841Z","submitted_at":"2026-04-17T16:20:55Z","title":"NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.16211","snapshot_observed_at":"2026-08-16T00:40:25.353780Z","title":"NVV-SuperBench: Beyond words, beyond quality—benchmarking nonverbal vocal- izations in speech generation.arXiv preprint arXiv:2604.16211, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.353780Z"},"links":{"cited_paper":"/paper/2604.16211","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:398b0fd96b067a97882696901e5e00098ed7acff34b95914d54ae762c878a8e3","observation_id":"8ae3aca2-7477-40ff-bb5e-fe526ba8a6d2","resolution":{"observed_at":"2026-08-16T00:40:25.353780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2603.15352","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:25.545067Z","title":"NV-Bench: Benchmark of nonverbal vocalization synthesis for expressive text-to-speech generation.arXiv preprint arXiv:2603.15352, 2026","venue":null,"work_id":"f5b15e46-2bf9-4988-8e9f-2930d9b620f9","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.348470Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:843ebe38d3ba42abeda542a2bb3bd715e6679913e390b9a5fe3ee4d2428d48e6","observation_id":"222b54e8-2444-4ee5-8629-f2ba24accbf7","resolution":{"observed_at":"2026-08-16T00:40:25.552584Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:25.364583Z","title":"Emotional voice conversion: Theory, databases and ESD","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.364583Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:ded7d47d8675c036acc9b7b7d36c5f6cf71845efccbfac3fa71a1f58ac629ccd","observation_id":"595aedc9-407e-4208-9e46-087b510c01d4","resolution":{"observed_at":"2026-08-16T00:40:25.364583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.172939Z","title":"Gemini 3.1 Pro model card.https://deepmind.google/models/model-cards/ gemini-3-1-pro/, 2026","venue":null,"work_id":"90cc4bf1-55fe-4b7b-b007-6e0313c7b8a7","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.359507Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:cf15d38b3f345aeb1f77c06f4ccb19242d2aa72bc1747333e3c997f715a71847","observation_id":"79e1c23a-6dec-4b28-a9fc-31e0ec34b4d5","resolution":{"observed_at":"2026-08-16T00:40:27.179821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.151798Z","title":null,"venue":null,"work_id":"f6176ddb-ff79-4b4f-a051-63b9900bc350","year":2025},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.375381Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:78d1708550236280d686026d7febdf45d22604788cb08a8370cbc3ea653f102f","observation_id":"1cf04fc3-8cda-4216-8d6e-27e1447869d4","resolution":{"observed_at":"2026-08-16T00:40:27.157862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:25.369872Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.369872Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:a5319b3306a00ea790c2229810b924c8bbe3960e7c1bfecbaca73f6e8e8e416a","observation_id":"5d6aec85-664d-4bec-924d-c85b29137d5b","resolution":{"observed_at":"2026-08-16T00:40:25.369872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.17958","last_updated":"2026-04-20T08:39:55Z","snapshot_observed_at":"2026-08-14T03:21:39.243837Z","submitted_at":"2026-04-20T08:39:55Z","title":"MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech","version":1},"cited_work":{"arxiv_id":"2604.17958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.17958","snapshot_observed_at":"2026-08-16T00:40:25.750509Z","title":"MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech","venue":"eess.AS","work_id":"5e9587af-f9b1-49b6-baca-b6e5b6bd2157","year":2026},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.380445Z"},"links":{"cited_paper":"/paper/2604.17958","citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:983c7b71c322aa6e08355691d55adc08532c15efb47f1e502c8bb558cedbf1ad","observation_id":"96d3bf61-c75d-4e0c-8bc0-956f843c7efb","resolution":{"observed_at":"2026-08-16T00:40:25.756497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:40:27.523341Z","title":null,"venue":null,"work_id":"e309b273-b870-4a0b-8ab2-68baf3d47e29","year":null},"citing_paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T00:40:25.210326Z"},"links":{"citing_paper":"/paper/2608.11593"},"observation_digest":"sha256:7f9158f71b45b0e8ed4c6c43c2009c5d77a8c5072d47e1e23e5fa7f3464d7390","observation_id":"31f381b5-43a6-427e-b071-63a78a11a2c6","resolution":{"observed_at":"2026-08-16T00:40:27.529429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.11593","last_updated":"2026-08-12T03:07:07Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T20:33:48.013584Z","submitted_at":"2026-08-12T03:07:07Z","title":"Luna-TTS Family Technical Report"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":55,"verified_exact":8,"verified_fuzzy":24},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 0 inbound Pith citation observations for arXiv:2608.11593."}