{"as_of":"2026-08-16T23:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:57303ec674d092119943754b966d575e15006fe8e2726ccd2a9b51341b990709","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:34:47.857279Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08638/citation-record","integrity":"/paper/2608.08638/integrity","json":"/paper/2608.08638/citation-record.json","paper":"/paper/2608.08638"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-14T04:34:47.690816Z","title":"arXiv preprint arXiv:2301.02111 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.690816Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:8ee8f5876788cbde3aa0e4a81601ef249b659662522e90686f7406e563f5b8f6","observation_id":"9f348351-f5c6-48eb-aebd-70385bd661f2","resolution":{"observed_at":"2026-08-14T04:34:47.690816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.596616Z","title":"Transactions of the Association for Computational Linguistics , volume =","venue":null,"work_id":"e70d03ef-cdd0-4aeb-8a44-2f3a87a86c3c","year":2023},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.696570Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:997cf607e3dd4621498fd37010233ad42443e163cf66e95f4266dfc4fc12bee6","observation_id":"2265625b-dbaf-4695-bae1-ced74b0f97e7","resolution":{"observed_at":"2026-08-14T04:34:48.600345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.584227Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages =","venue":null,"work_id":"f2b34996-2533-4571-bf3a-57f14d813675","year":2024},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.700590Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:b8d60613c841e89a3010e06beae4162dc6b807c569c67ea63e3b2633c5ae86c5","observation_id":"263b3929-e08d-4039-aa48-bbfce87a285c","resolution":{"observed_at":"2026-08-14T04:34:48.589000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.573419Z","title":null,"venue":null,"work_id":"a90638ae-46fd-4dc1-8442-33ad9745002f","year":2021},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.704386Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:73dc79cacd2c856ed68b8332b4f99e906d7591dfc3628c2d5722cff8885a63d2","observation_id":"528bde7a-10be-4cd5-ae0d-7a3fa4d60659","resolution":{"observed_at":"2026-08-14T04:34:48.576877Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.560236Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":"eb61a5ad-57e2-41de-80b5-e16c09730f63","year":2023},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.708558Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:717b2e2c8e863ec188dadc4f0fd634475d7719ba05e242cb05a554a3940ac0c9","observation_id":"ca9de21b-070a-4a41-8e40-9000f901dffa","resolution":{"observed_at":"2026-08-14T04:34:48.566541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03199","last_updated":"2024-01-09T21:02:34Z","snapshot_observed_at":"2026-08-16T15:02:44.909438Z","submitted_at":"2023-09-06T17:59:57Z","title":"Matcha-TTS: A fast TTS architecture with conditional flow matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03199","snapshot_observed_at":"2026-08-14T04:34:47.712299Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.712299Z"},"links":{"cited_paper":"/paper/2309.03199","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:163aac5b26913e2a45bd172086cfce0a34a95f712ac4c4442ecd6737be828be1","observation_id":"c4a55a63-e3d1-44f3-9972-2cbbcf19b7fd","resolution":{"observed_at":"2026-08-14T04:34:47.712299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.548930Z","title":null,"venue":null,"work_id":"d0646f21-d7df-4c0d-ba69-1b922e5fd7e5","year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.716159Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:0688b9a30b75429dc3122a9a274aaa9f676904c6d4525c3675154d1e680d6365","observation_id":"dc69aa60-8551-4c30-baf7-d3c52fff7bb2","resolution":{"observed_at":"2026-08-14T04:34:48.552579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-14T04:34:47.719682Z","title":"arXiv preprint arXiv:2407.05407 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.719682Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:092f451bfaec7528037f349819cdad68ebcb7d27a3cef617ac5f17f9e7fb11f3","observation_id":"cd0a88a1-8c3f-498e-823c-f267199e3654","resolution":{"observed_at":"2026-08-14T04:34:47.719682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-14T04:34:47.723267Z","title":"arXiv preprint arXiv:2412.10117 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.723267Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:4182bf28e5e2432e001251eb008e39856e2f815f65e50a9b8873e7098ed90637","observation_id":"b4764bab-f4c4-4c0d-8fea-fd213af4b19b","resolution":{"observed_at":"2026-08-14T04:34:47.723267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.537916Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages =","venue":null,"work_id":"02f15609-528d-4381-b413-0b2aaccdfcce","year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.727270Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:03d6b2900b12e99b79f36f5b87bcbc8da97b7c09fd643dbe5c6f97bd6eeef3c3","observation_id":"c08ef51c-77f7-419c-9563-d504c0366d5c","resolution":{"observed_at":"2026-08-14T04:34:48.541526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:47.730831Z","title":"arXiv preprint arXiv:2410.16048 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.730831Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:8a4aaa04dba602d153060e618c0fabb1d8b4144db76ba730580527e7603c3cb8","observation_id":"a8005653-95e4-4bd2-b93d-aae2f764b6f8","resolution":{"observed_at":"2026-08-14T04:34:47.730831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.526410Z","title":"2025 , url =","venue":null,"work_id":"1dffd17d-7809-497a-886e-8e948be62be7","year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.734210Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:15636b225dbfa568f872b384c09cd2005d6ca577bbbaababec228258e24fee4e","observation_id":"c5be50df-da2b-48ed-b227-0d540de1b06c","resolution":{"observed_at":"2026-08-14T04:34:48.530357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.515286Z","title":"2025 , doi =","venue":null,"work_id":"3efc7eaa-1626-4d8c-acba-b52a2b90b3ad","year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.737637Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:9a7ecf10512c5b6b48cfc2a2ca3deec2572743029c0f0da011603d211fd37fd3","observation_id":"bfc28a2b-d9d1-43af-ae53-37b9ae64f760","resolution":{"observed_at":"2026-08-14T04:34:48.519301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:47.741058Z","title":"arXiv preprint arXiv:2509.06926 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.741058Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:588fcf60f6819599b0de380601dfa105b0b8cb3d5e193082360954f6ffbdc4be","observation_id":"39ad39d4-2362-4965-9625-e2ab8828681e","resolution":{"observed_at":"2026-08-14T04:34:47.741058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08635","last_updated":"2024-12-11T18:57:32Z","snapshot_observed_at":"2026-08-16T13:00:15.419884Z","submitted_at":"2024-12-11T18:57:32Z","title":"Multimodal Latent Language Modeling with Next-Token Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08635","snapshot_observed_at":"2026-08-14T04:34:47.744852Z","title":"arXiv preprint arXiv:2412.08635 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.744852Z"},"links":{"cited_paper":"/paper/2412.08635","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:856b6c5abdaa21d12665dd5c6ef5b1525238cd84d8374f5928b54f229849014f","observation_id":"65323f6f-84f2-4476-8031-fa97c37987c5","resolution":{"observed_at":"2026-08-14T04:34:47.744852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.502765Z","title":"High-Fidelity Audio Compression with Improved","venue":null,"work_id":"1a8b7dd0-1d43-41f5-8f99-ed13a876da88","year":2023},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.748625Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:8c9e49be3144f3e77ab73d7e0289b6dd9a27cdd6e5c669497f72385c1f6d20c9","observation_id":"f18bc46a-a7fd-4235-a096-7c3f0a283207","resolution":{"observed_at":"2026-08-14T04:34:48.507858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19205","last_updated":"2025-08-26T17:09:12Z","snapshot_observed_at":"2026-08-15T16:51:35.217742Z","submitted_at":"2025-08-26T17:09:12Z","title":"VibeVoice Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19205","snapshot_observed_at":"2026-08-14T04:34:47.751890Z","title":"arXiv preprint arXiv:2508.19205 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.751890Z"},"links":{"cited_paper":"/paper/2508.19205","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:788502e64221bb055d6251fb21c82af9a12cd1d15e4f64876f3049cfd5245d4d","observation_id":"81886fc8-a880-426b-8207-de3d5d56cd95","resolution":{"observed_at":"2026-08-14T04:34:47.751890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.490593Z","title":"2025 , eprint =","venue":null,"work_id":"fc196a96-fc32-4cf1-9568-b197933fc4a5","year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.755814Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:0308ab94bec0b2bbc8791d13493c270726c28b82f31ee0b43292be89e0ccc222","observation_id":"36ae63b0-65a6-4bdf-832c-69dd7ac4aced","resolution":{"observed_at":"2026-08-14T04:34:48.494830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.479354Z","title":"2025 , eprint =","venue":null,"work_id":"5a234586-b804-4701-ad94-e928f9528369","year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.759287Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:dcf620150c852fac6a16ae2900661db21f91855987d6f4b960766cf546a4b93d","observation_id":"c2ec74ab-3073-4aa1-9268-44398cfcf990","resolution":{"observed_at":"2026-08-14T04:34:48.483310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.467381Z","title":"2025 , eprint =","venue":null,"work_id":"b9ce8d9a-eb9d-4247-96f3-3c12cdc88c1f","year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.762805Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:537a4ecf8c15166736df5ff62776b8fcee55328b2639d242b36ff11effee3327","observation_id":"083af3b6-ba30-4d94-8c49-60a8b74fdbda","resolution":{"observed_at":"2026-08-14T04:34:48.471583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.455694Z","title":"2025 , eprint =","venue":null,"work_id":"cc24de69-23ae-4216-8373-7cac3f514b01","year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.766120Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:5d20360f301f265d0eba2be48c559e699b71bf307a2f48106cdd4b42e351f05c","observation_id":"428a9006-3935-4abc-b8e5-abb2d9ebcb9f","resolution":{"observed_at":"2026-08-14T04:34:48.459216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.443705Z","title":"The Eleventh International Conference on Learning Representations , year =","venue":null,"work_id":"8de5758e-9869-49cc-98ad-d37e3ef9899a","year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.769256Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:3c7a7402d48521f24ff610c8a5885bb3fd4660167430190e7d68a870175f795c","observation_id":"73cbeffa-3907-46cf-955d-7867ebef71a8","resolution":{"observed_at":"2026-08-14T04:34:48.447427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-14T04:34:47.772701Z","title":"arXiv preprint arXiv:2207.12598 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.772701Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:0e4935ecb5215a984fad57397f14a46de32a3a212c32ae57e744852c81bbe2d7","observation_id":"e02c77d7-d48f-4e73-9ca5-c67b6f3c0572","resolution":{"observed_at":"2026-08-14T04:34:47.772701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.431919Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages =","venue":null,"work_id":"d68f2b6d-df67-442e-90b7-2b18442145ff","year":2023},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.776552Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:d66a7031cf527d3dcb781c001eed1fc6b43ba78b49c94296bcd7e81f40f3a575","observation_id":"46c16d2c-5daa-43bb-b59f-14e089c95063","resolution":{"observed_at":"2026-08-14T04:34:48.436450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.419311Z","title":"The Tenth International Conference on Learning Representations , year =","venue":null,"work_id":"d507e6f1-b7a2-4c25-bb0c-f024e66297ef","year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.779605Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:b98ae90c2f0d81d6984490b873476435080632b9967603262941100b17cfd246","observation_id":"6c2bd392-48c0-45e8-a72f-6180f6937928","resolution":{"observed_at":"2026-08-14T04:34:48.424221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.407983Z","title":"Proceedings of the 40th International Conference on Machine Learning , series =","venue":null,"work_id":"321f03aa-4889-4aa2-b530-1dce87a0c80e","year":2023},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.783172Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:f35a6a7de6a93525775f4392da336b95b963c3b05791eb2d21bf50d3337ccdf5","observation_id":"09873062-4a0f-47f8-b6b3-cfeb06f4c75f","resolution":{"observed_at":"2026-08-14T04:34:48.412154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13447","last_updated":"2025-05-19T17:59:42Z","snapshot_observed_at":"2026-08-14T04:21:47.598355Z","submitted_at":"2025-05-19T17:59:42Z","title":"Mean Flows for One-step Generative Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13447","snapshot_observed_at":"2026-08-14T04:34:47.786352Z","title":"arXiv preprint arXiv:2505.13447 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.786352Z"},"links":{"cited_paper":"/paper/2505.13447","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:15e49e15f987364c0edde274765990d9af53a1d3346e6537eb9f2b840fc10eb2","observation_id":"c295d162-8dfe-4232-96ed-089ee32ea4c7","resolution":{"observed_at":"2026-08-14T04:34:47.786352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:47.789831Z","title":"arXiv preprint arXiv:2510.07979 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.789831Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:77cd9e7281f27ded7c7209fc5f21185096f091d51f3ed6d63c0635610f8655ba","observation_id":"b27b8a3b-f804-435f-86b3-827857d3dfb4","resolution":{"observed_at":"2026-08-14T04:34:47.789831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.396603Z","title":"The Thirteenth International Conference on Learning Representations , year =","venue":null,"work_id":"9ca74a8f-9e3d-4324-8783-97c95d1ea94f","year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.793206Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:d43501fb401d0d176cb97c10099df317f16331e2f5b9ea0c00d350e458467621","observation_id":"13f99b37-cf3c-4cff-b71b-5083e02514e2","resolution":{"observed_at":"2026-08-14T04:34:48.400368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:47.796494Z","title":"Transactions on Machine Learning Research , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.796494Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:191a978bdda93ff39aa83afa8f3a4255eaccaf3f23c2eebb0f0c5e859eb79b10","observation_id":"ad0d5956-ddb7-45b3-ad18-48c0736bc789","resolution":{"observed_at":"2026-08-14T04:34:47.796494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:47.799959Z","title":"2022 , doi =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.799959Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:0269215f4a5747fd32e958e3fdaa0ffce0f7df3c172f99a0dde149c4051c3e2a","observation_id":"6f56e798-40f0-4c8f-a3d5-51565053e899","resolution":{"observed_at":"2026-08-14T04:34:47.799959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:47.803174Z","title":"2020 , doi =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.803174Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:b00f8929517eafac54a0dd09c43ae4839c218e9b1fd279f26af557df856df79a","observation_id":"3aa0008a-61ab-4e8b-b154-266b1337adba","resolution":{"observed_at":"2026-08-14T04:34:47.803174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.364414Z","title":"2015 , doi =","venue":null,"work_id":"18e70b2a-d930-4f21-b462-5d3b0ec54217","year":2015},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.806731Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:95cf463cac2ee01d74cdf55686273e8dce3586f6a336998a5bc2fa99eeb575e7","observation_id":"93a6d603-a4fd-45b2-8461-56b8219426b6","resolution":{"observed_at":"2026-08-14T04:34:48.368273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.351928Z","title":"Proceedings of the 40th International Conference on Machine Learning , series =","venue":null,"work_id":"858f7f7a-7d40-468a-a03c-847fb44991f5","year":2023},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.810384Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:276f84251a0b7b3d76490087850c9faa3271bc202a6dd765b2747ae09e3df9d2","observation_id":"4f0bb643-69ee-44e1-bfe1-458b4d73fd3d","resolution":{"observed_at":"2026-08-14T04:34:48.355838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.341490Z","title":null,"venue":null,"work_id":"2a7bf61c-b81c-4410-a9b4-f78f462ae9e2","year":2024},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.814011Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:75d494a85d29688300b20d81735acfee27e80a5a2f611e90787f2709ae4d931d","observation_id":"056454a2-9fe3-4340-a6e3-bd0ebda5ad3c","resolution":{"observed_at":"2026-08-14T04:34:48.345096Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.331125Z","title":"2023 , doi =","venue":null,"work_id":"ca5cb783-eefb-4d3d-80c6-0d0e047e8af1","year":2023},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.817524Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:506ba0d3546da8e39a752783ec94da109e0dc01dae23eddce7ff80d5da023629","observation_id":"c965efa6-0138-4ce3-99ca-a9a8277bcc45","resolution":{"observed_at":"2026-08-14T04:34:48.334685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.318357Z","title":"2022 , doi =","venue":null,"work_id":"56cc25ee-be5e-4da6-ba1c-eb5916434c36","year":2022},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.820763Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:109fe80725e6adda0565be1e4d350f4c48afcc08bdf2713ce6c52a8cea6c6b59","observation_id":"c53016fa-7f3d-477f-9966-877847cbb790","resolution":{"observed_at":"2026-08-14T04:34:48.322397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.306364Z","title":"2026 , eprint =","venue":null,"work_id":"00ce9e06-ecbe-4da9-b6e0-07573399952b","year":2026},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.824208Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:03b5fe413a8aefefbdd3212182497243f2c7141dcb3910871b76f76f27ce1f4b","observation_id":"da649455-cd2b-4fc7-b64c-724111984689","resolution":{"observed_at":"2026-08-14T04:34:48.310203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.294838Z","title":null,"venue":null,"work_id":"fff8bbfd-1dc5-4c75-b8c2-a8d70529a350","year":2026},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.827519Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:a508459a05b2f643cc2af9f1c18e2a863d42fd20f0ba0dd8c6a129db6bf63bd4","observation_id":"00857867-259e-438d-97e5-5ea59ba9c2f5","resolution":{"observed_at":"2026-08-14T04:34:48.298673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-15T08:18:32.827110Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-08-14T04:34:47.830741Z","title":"arXiv preprint arXiv:2509.02020 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.830741Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:965d8eb864b6c57ae72711d1353d260f34b2b54f8a9d7f79289bb71dc6aa6e5c","observation_id":"f6a00cd0-c484-42da-ae3f-df317a6ab822","resolution":{"observed_at":"2026-08-14T04:34:47.830741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13053","last_updated":"2025-08-07T03:12:26Z","snapshot_observed_at":"2026-08-13T16:12:03.853679Z","submitted_at":"2025-06-16T02:48:17Z","title":"ZipVoice: Fast and High-Quality Zero-Shot Text-to-Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13053","snapshot_observed_at":"2026-08-14T04:34:47.834426Z","title":"arXiv preprint arXiv:2506.13053 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.834426Z"},"links":{"cited_paper":"/paper/2506.13053","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:a2f5309c5e014c0d39c6f2874e6baecbd3aa10edc8566f61be511d2068641f42","observation_id":"d48ff219-ef5f-4097-b213-fb27449d39b1","resolution":{"observed_at":"2026-08-14T04:34:47.834426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-16T15:06:17.970180Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-14T04:34:47.839144Z","title":"arXiv preprint arXiv:2506.21619 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.839144Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:cb9f05b019b6fab8c7b90e18a5504ef9055c52e13035c32b7b22e8320a105621","observation_id":"118e73e2-b728-42ec-ab50-4485a16f7c18","resolution":{"observed_at":"2026-08-14T04:34:47.839144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-14T04:34:47.842901Z","title":"arXiv preprint arXiv:2505.17589 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.842901Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:b20ee283891936435b9d83080647619edb1e53b5f0243d39b5024b245b16985b","observation_id":"a709c555-245c-4f56-bd60-43e4691a48f2","resolution":{"observed_at":"2026-08-14T04:34:47.842901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.284896Z","title":"Interspeech 2022 , pages =","venue":null,"work_id":"a2ed8e6f-6761-404f-a17e-05096a2acc05","year":2022},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.846901Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:b6dff265652984f9607bd1de6e41c7608d9df1a47364eba6e649bb012f812102","observation_id":"80e12354-253c-4f35-aa32-75f8ade94d32","resolution":{"observed_at":"2026-08-14T04:34:48.288224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.274888Z","title":"2026 , eprint =","venue":null,"work_id":"6cee6485-4768-401f-b3e3-5c66adb5e117","year":2026},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.850315Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:001001f6d81605655e2c2027f292f39d727ddceaabd6dbc8164a524fd8adb3bc","observation_id":"9bd9d3af-0c4b-4776-8f64-f9e3603f81f4","resolution":{"observed_at":"2026-08-14T04:34:48.278229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:48.261812Z","title":"2026 , howpublished =","venue":null,"work_id":"e758c9a9-869a-4a5f-963b-2325ab01426e","year":2026},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.853760Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:76b1a1d31d3433f99b9d7552544a93d3796d330069d547f6714a590b0b597175","observation_id":"9004cfd9-b545-4e17-9985-aa8d0974c1ac","resolution":{"observed_at":"2026-08-14T04:34:48.266572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:34:47.857279Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-14T04:34:47.857279Z"},"links":{"citing_paper":"/paper/2608.08638"},"observation_digest":"sha256:166ad45caa73faba2822a8d6c2c088869d2b7466a5dc9d98408d66df865f6638","observation_id":"c724480d-11d0-4999-bb45-1ecc651c3803","resolution":{"observed_at":"2026-08-14T04:34:47.857279Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08638","last_updated":"2026-08-09T11:10:20Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T16:14:30.193688Z","submitted_at":"2026-08-09T11:10:20Z","title":"CuteTTS: Efficient and High-Quality Speech Synthesis via Autoregressive Modeling of Continuous Latents"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":22,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2608.08638."}