{"as_of":"2026-08-10T16:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a9c6f8f26ae63523e2a665d15bc0b2954580e754e9844894f8524327ea17d754","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:53:18.993310Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.17426/citation-record","integrity":"/paper/2505.17426/integrity","json":"/paper/2505.17426/citation-record.json","paper":"/paper/2505.17426"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T14:53:14.619002Z","title":"Seed-tts: A fami ly of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:14.619002Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:e560551bc847862899e0f694a255e5ed814a6bc687c9bcc911b8c28b70e0421b","observation_id":"9d33002b-6b3c-47b2-89c1-3fcdaa12fcef","resolution":{"observed_at":"2026-08-07T14:53:14.619002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:23.538882Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech represen tations","venue":null,"work_id":"bf583fc6-f886-40ef-9905-ecfdef6389da","year":2020},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:14.670603Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:4b44e13bb37fb05d7d22ff63893903306ff1877d953a9a600a288b8fb43022ee","observation_id":"e4d26acb-124c-476a-b934-3f4e48d06b50","resolution":{"observed_at":"2026-08-07T14:53:23.656153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-07T14:53:14.733869Z","title":"F5-tts: A fairytaler that fakes ﬂuent and faithful speech with ﬂow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:14.733869Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:e46bd2e3e4750e15f1af7655a30bc093bca54534baba5187f5462ae41891e516","observation_id":"966c5132-20c0-440d-b084-c0e5db6586e4","resolution":{"observed_at":"2026-08-07T14:53:14.733869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T14:53:14.823243Z","title":"High ﬁdelity neural audio compression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:14.823243Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:2a5d6543f408765776fea4f835efdd035d5cc4b6d752b59f144adf56ae591caf","observation_id":"ec869804-b9ce-409a-9c1f-486251b2b3c6","resolution":{"observed_at":"2026-08-07T14:53:14.823243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T14:53:14.907708Z","title":"Moshi: a speech-text fou ndation model for real-time dialogue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:14.907708Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:5c54201dfa5cf1c332bb0fdcdcd85906d1183c72b34bd89e8bc7ba2f6d48848b","observation_id":"213665fe-a09a-410c-8c8e-d40078715e2e","resolution":{"observed_at":"2026-08-07T14:53:14.907708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-09T19:41:17.737989Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-07T14:53:14.979998Z","title":"Indextts: An industrial-level controllable and efﬁcient zero-shot text-to-speech syste m","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:14.979998Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:9962c718a1976ad4796c4dcfa1358c2a836941406ad633866c4636028abd5370","observation_id":"cceffa41-b9b1-4038-bf68-672cd9a46730","resolution":{"observed_at":"2026-08-07T14:53:14.979998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T14:53:15.064261Z","title":"Cosyvoice: A scalable multil ingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.064261Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:163df763513704e489feb5e2c2c033a0c7fbbce728affa56af7d928ffc8942d6","observation_id":"e607820d-e8a4-430f-955c-79c2edb8e86d","resolution":{"observed_at":"2026-08-07T14:53:15.064261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-07T14:53:15.130965Z","title":"Cosyvoice 2: Scalable s treaming speech synthesis with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.130965Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:8be85515ca87600476e48bbaa0bf6892e6b6833156211ecd578fd3bf72bb15cf","observation_id":"0facc9cb-428e-4f1e-8901-17226756ef20","resolution":{"observed_at":"2026-08-07T14:53:15.130965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-01T16:05:21.888603Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T14:53:15.212421Z","title":"Paraformer: Fast and accu- rate parallel transformer for non-autoregressive end-to- end speech recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.212421Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:93b3a656d66a8b153ef85f2f78771d81ce2a7c42cdd72d35f764e59ae9d46474","observation_id":"a113fd37-95e0-4b9c-8a1b-a3282570a878","resolution":{"observed_at":"2026-08-07T14:53:15.212421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:53:15.302882Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.302882Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:3805e7be1c3a5e9f2ac3801964bca09a2657ffb72def13e5865931c563bc4fe9","observation_id":"7b0deeda-b6f5-4529-8ee7-58b20615f6a1","resolution":{"observed_at":"2026-08-07T14:53:15.302882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:23.381984Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":"bc6543d9-94c8-480f-80e4-58da765d4a09","year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.463966Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:d7ed2a38c4fec11b834cf658b30dee6de9586c2f8cd310b5421ad8f38e60fa13","observation_id":"2347bbc7-4675-4758-900f-fef985939400","resolution":{"observed_at":"2026-08-07T14:53:23.450367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:23.229806Z","title":"Hubert: Self-supervised spe ech representation learning by masked prediction of hidden units, 2021","venue":null,"work_id":"625abf91-2069-4502-b9b5-33a883e51e19","year":2021},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.590347Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:ded59e724f6dd1102dcfac84b25f36a0c595d15e944b731f33069b3279e7513e","observation_id":"a56d4796-c3f9-436d-91ed-da5e3a3e48f0","resolution":{"observed_at":"2026-08-07T14:53:23.285384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-07T23:06:05.723893Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-07T14:53:15.691624Z","title":"Wavtokenizer: an efﬁ cient acoustic discrete codec tokenizer for audio language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.691624Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:7dd6666b94b19ef763a5ce0fa60420a45d1a0c6259d7fed4491d06e366dd5d13","observation_id":"f9ef53f3-404f-46bb-8008-bc5d8b4d1de1","resolution":{"observed_at":"2026-08-07T14:53:15.691624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:23.107999Z","title":"Libriheavy: A 50,000 hours asr corpus with punctuation casing and con- text","venue":null,"work_id":"5b0c321b-e0a8-4121-887c-4ce117eba391","year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.795893Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:c16b17e38f87b672fdbf3b121b8b4acacba3bd81ff1dec32908a35e42589b9fe","observation_id":"fcdc4326-4c69-4601-a2ae-5b9241fa4864","resolution":{"observed_at":"2026-08-07T14:53:23.159193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T14:53:15.934554Z","title":"Scal ing laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:15.934554Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:797b7dd013cdc29f1b0508f1b63438e93038dd0d8e01edb7f9a90f19e5c265eb","observation_id":"a3f97cc6-f5d9-4d2f-8b49-b022605b9663","resolution":{"observed_at":"2026-08-07T14:53:15.934554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:22.939718Z","title":"Hiﬁ-gan: Generative adversarial networks for efﬁcient and high ﬁdelity speech synthesis","venue":null,"work_id":"7f70e31b-e5a5-4272-adb4-9405a794b3be","year":2020},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.069772Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:ee26a5be9cc4e1cabb139969d7bea85ed77aa238682d1912b135dea86f9dcca8","observation_id":"dbc7af43-37c4-44bd-94e4-40c2e31177c9","resolution":{"observed_at":"2026-08-07T14:53:23.005927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07422","last_updated":"2024-06-11T16:22:57Z","snapshot_observed_at":"2026-08-10T13:35:57.169341Z","submitted_at":"2024-06-11T16:22:57Z","title":"Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07422","snapshot_observed_at":"2026-08-07T14:53:16.222193Z","title":"Single-codec: Single-codebook speech c odec towards high-performance speech generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.222193Z"},"links":{"cited_paper":"/paper/2406.07422","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:3cf7757710f938b9cf6c09a94a6bf3ad123feaa7e20afb25032b665727302ed1","observation_id":"15d8824e-45e5-40de-add5-0652964ca1f8","resolution":{"observed_at":"2026-08-07T14:53:16.222193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-10T00:08:15.031162Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-07T14:53:16.316201Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.316201Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:0792e5f4e0cd5e2a2ce534f0f51d81cc3dea48ea9977849e78b2f786902135d8","observation_id":"1bafbe8f-77ba-41e9-bc48-584777613c6e","resolution":{"observed_at":"2026-08-07T14:53:16.316201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:16.366904Z","title":"Unitok: A uniﬁed tokenizer for visual generati on and understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.366904Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:bc0c3e88b88bf30cbc8002d18133bbc1dbeacb88db96b5a72fa5df862ffc2726","observation_id":"d7a1aebb-b7f9-4d63-b941-2dfb44717064","resolution":{"observed_at":"2026-08-07T14:53:16.366904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05763","last_updated":"2024-06-19T04:52:56Z","snapshot_observed_at":"2026-07-06T18:27:45.631190Z","submitted_at":"2024-06-09T12:32:42Z","title":"WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05763","snapshot_observed_at":"2026-08-07T14:53:16.449290Z","title":"Wenetspeech4tts: A 12, 800-hour mandarin tts corpus for large speech generation model benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.449290Z"},"links":{"cited_paper":"/paper/2406.05763","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:a21146dfda7eed94a50566957a52aa05070f56dd933b85a6c25a13bf0c5429d1","observation_id":"30bb3cbe-ee07-4b8c-98c1-e66a3eca2135","resolution":{"observed_at":"2026-08-07T14:53:16.449290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08551","last_updated":"2025-05-27T05:07:56Z","snapshot_observed_at":"2026-08-05T05:08:56.833881Z","submitted_at":"2024-07-11T14:36:53Z","title":"Autoregressive Speech Synthesis without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08551","snapshot_observed_at":"2026-08-07T14:53:16.516851Z","title":"Autoregressive speech synthesis without vector quanti- zation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.516851Z"},"links":{"cited_paper":"/paper/2407.08551","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:f36c4ddf2d8815f793c2c060b5d25fed00a36fb8c8b109ce94e43cb903fa8daa","observation_id":"10d591a9-3c72-4840-b415-418f7995e5cd","resolution":{"observed_at":"2026-08-07T14:53:16.516851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-07T14:53:16.616864Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.616864Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:b22559e6ffdde4298bdfda59924387cd0b99f774b2ed34d74dba29d9a94341ba","observation_id":"e04f95dd-98d0-4488-a399-b92592437938","resolution":{"observed_at":"2026-08-07T14:53:16.616864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19842","last_updated":"2024-11-29T16:58:02Z","snapshot_observed_at":"2026-08-10T00:42:50.079942Z","submitted_at":"2024-11-29T16:58:02Z","title":"Scaling Transformers for Low-Bitrate High-Quality Speech Coding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19842","snapshot_observed_at":"2026-08-07T14:53:16.774762Z","title":"Scaling transformers for low-bitrate high-quali ty speech coding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.774762Z"},"links":{"cited_paper":"/paper/2411.19842","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:1e4c0c97b6b6d1d38b12d177e06366776c79a4141d049c78265b2c81d97698c8","observation_id":"53fa332c-d27a-43da-966e-4b834a73cad8","resolution":{"observed_at":"2026-08-07T14:53:16.774762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:21.666012Z","title":"Loss-sensitive generative adversarial ne tworks on lipschitz densities, 2018","venue":null,"work_id":"b74f0a9e-6f12-40c7-a2a7-db235f06b5d8","year":2018},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.862660Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:8d0ec2cdaeaccd54ee5a1c70d771ecbe6c896911c72cce64bf1f3a3ca613a5f6","observation_id":"72b749f9-c540-4490-8fa4-134eb682d2ac","resolution":{"observed_at":"2026-08-07T14:53:22.341747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:21.439658Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"73a15e11-46ef-428a-b48e-e0d66bb9b0c1","year":2023},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:16.955473Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:597f5bc10276d174f6cf27cb7e8dec6213e41af2ed3b51516fcab9226d555549","observation_id":"87751d8b-54bb-406f-aeb7-ba408ac83444","resolution":{"observed_at":"2026-08-07T14:53:21.518013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:21.297420Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"70070eec-a8d3-42dd-b97b-db1a042eebe1","year":2019},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.076214Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:124f2f3466e8bf95e14bf3891ad5a977f8559b89619b8cee1987eef048ba6112","observation_id":"dc727f44-2f28-4626-9890-34064b2961a3","resolution":{"observed_at":"2026-08-07T14:53:21.364048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:21.183395Z","title":"Direct preference optimization: Y our language model is secretly a reward model","venue":null,"work_id":"9841bf53-5534-4abe-abcd-45faa0815c40","year":2023},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.171284Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:c6bc6fcc3e37a29ed6a41a6c121e1f1d2616ed483107493e9cee3a02137104ae","observation_id":"f120fd47-36e9-42e9-ae14-53b979da2abb","resolution":{"observed_at":"2026-08-07T14:53:21.223798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:21.051824Z","title":"Dnsmos p","venue":null,"work_id":"8d8d01f0-7925-46d3-9d07-378ad7b34034","year":2022},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.261661Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:2138e7ba1983d8ea2434a165c6fda6764c9b597e7116fb21c6179942330d64cc","observation_id":"9701ba54-0ecd-4c53-9aae-316cfd4e8577","resolution":{"observed_at":"2026-08-07T14:53:21.106441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:20.909628Z","title":"Utmos: Utokyo-sarulab system for voicem os challenge 2022, 2022","venue":null,"work_id":"6d02861c-073a-42f4-b67b-4f27475ca11b","year":2022},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.331644Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:e9093a9c24786dffeaf16d99d465947e260b764a43863262fe3eab0912f8d0df","observation_id":"afef3ee6-190a-4445-9f43-6feb6b7343c1","resolution":{"observed_at":"2026-08-07T14:53:20.984555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:20.763704Z","title":"Neural discret e representation learning","venue":null,"work_id":"12544046-b081-4b47-92d5-02054b7f153f","year":2017},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.426791Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:f357646a2f28d729acc0aa29707b3fc7984ae3fba76ee51f1657edef451493f3","observation_id":"66a420ae-6782-43af-96c9-7844c3edf45c","resolution":{"observed_at":"2026-08-07T14:53:20.810423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T14:53:17.522496Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.522496Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:5e8563e0b8fabb5bf83f4e545fcbc0f65a9537da838a3e742f4710a3a3b1d6c3","observation_id":"f6fd71d8-af69-4bf9-956a-c795fc93f5f9","resolution":{"observed_at":"2026-08-07T14:53:17.522496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-07T14:53:17.592637Z","title":"Spark-tts: An efﬁcient llm-based text-to- speech model with single-stream decoupled speech tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.592637Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:0966bad455ce9593bdf4d3881e964ce4fe3c58d799d66ecc469a0bdae1372f09","observation_id":"2a745d27-1788-4f6c-9bd8-47e1b4265e34","resolution":{"observed_at":"2026-08-07T14:53:17.592637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:20.632051Z","title":"Convnext v2: Co-designing and scaling conv nets with masked autoencoders, 2023","venue":null,"work_id":"b19d4961-de0e-4efb-aad8-352bc5832e6c","year":2023},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.651875Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:d72ec61bddb03163a05bcc7f0daa53478532fc77c5829c56f9cc08a6d5435f1c","observation_id":"6b94630e-26d1-41bc-9996-33324ce4bddc","resolution":{"observed_at":"2026-08-07T14:53:20.707290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05377","last_updated":"2024-09-09T07:18:07Z","snapshot_observed_at":"2026-08-03T20:35:31.539481Z","submitted_at":"2024-09-09T07:18:07Z","title":"BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05377","snapshot_observed_at":"2026-08-07T14:53:17.728250Z","title":"Bigcodec: Pushing the limits of low-bitrate neural speech codec","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.728250Z"},"links":{"cited_paper":"/paper/2409.05377","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:f74d29a44c3f1e85f7e3ddc8807072501f832cdc8212a16a2be952b7ba6c5b65","observation_id":"bdc4cb98-4edf-4f45-80c6-4ec8e460e120","resolution":{"observed_at":"2026-08-07T14:53:17.728250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:53:17.785623Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.785623Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:7501633d771b0385987e1e809e1170acec902c34dfd0afd535918bb33f5ab5aa","observation_id":"0abc68c5-c879-4e25-ab80-8811ab6e65ca","resolution":{"observed_at":"2026-08-07T14:53:17.785623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-06T10:45:04.364170Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-07T14:53:17.856062Z","title":"Hiﬁ-codec: Group-residual vector quantization for high ﬁd elity audio codec","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.856062Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:16fb5aea940144715649c6e6acd41ce652c9581e2cfa268543696a928cc5dad2","observation_id":"c17515ea-574e-4cd3-9cdd-f3aa64e2267c","resolution":{"observed_at":"2026-08-07T14:53:17.856062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:20.496764Z","title":"Codec does matter: Explo ring the semantic shortcoming of codec for audio language model","venue":null,"work_id":"52f5613a-61d4-4927-97ce-fe4f6c91b971","year":2025},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.908432Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:0e81345f40f7e29e072e1e867608df7ac83c51dd45c5315eb123bfdd24f265f2","observation_id":"e3ba37b1-24a5-4a5c-a7e0-b44ff18477d7","resolution":{"observed_at":"2026-08-07T14:53:20.545166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-08T23:22:17.610458Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-07T14:53:17.983678Z","title":"Llasa: Scaling train-time a nd inference-time compute for llama-based speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:17.983678Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:c7a48989efc63c908c5f9b265d49baa0a16e1bebeab410d1cfe4d5a07d7281ef","observation_id":"7f6a92ec-8d1c-4ad1-af56-c56ba9d1e6b1","resolution":{"observed_at":"2026-08-07T14:53:17.983678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-07-06T11:56:10.689708Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-07T14:53:18.048407Z","title":"V ector-quan tized image modeling with improved vqgan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.048407Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:2e7117e2798c1f35127e8ae7b3aec0ebfb14360a1c6fb925d940a02a68b80705","observation_id":"e4532399-60e4-4eed-a94b-1a509428d199","resolution":{"observed_at":"2026-08-07T14:53:18.048407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:20.361768Z","title":"Soundstream: An end-to-end neural audio codec","venue":null,"work_id":"fe4b3631-5dde-445d-a981-280055d2bdac","year":2021},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.148272Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:fe571ef2f041d4e872a25c62166b292c59b7e85e7b832835bdffcdbfe4bf7cde","observation_id":"87603f81-26c6-43e7-9b68-d341b58d5cb1","resolution":{"observed_at":"2026-08-07T14:53:20.421251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-07T03:22:13.424379Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-07T14:53:18.271919Z","title":"Speechtokenizer: Uniﬁed speech tokenizer for speech large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.271919Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:3745c0a7313d4082874de05f861056e3ee5caec5fd75b6fb00c650c3fd1898b5","observation_id":"1af4cf71-c62d-4614-881a-7eb6c32833fc","resolution":{"observed_at":"2026-08-07T14:53:18.271919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11837","last_updated":"2024-06-17T17:59:57Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:57Z","title":"Scaling the Codebook Size of VQGAN to 100,000 with a Utilization Rate of 99%","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11837","snapshot_observed_at":"2026-08-07T14:53:18.403349Z","title":"Scaling th e codebook size of vqgan to 100,000 with a utilization rate of 99%","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.403349Z"},"links":{"cited_paper":"/paper/2406.11837","citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:f7c8d8ba52d026c41a8f6f8769db7f5b71089a5b1143fc6167d5fa990c446178","observation_id":"dee18e11-8a7f-4bf7-bd7a-55144e5b916e","resolution":{"observed_at":"2026-08-07T14:53:18.403349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:18.507278Z","title":"Autoregressive spe ech synthesis with next-distribution prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.507278Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:3331389858a58eb1ed5c297e46d5f73e5ef1f28d5509a34601b07c679a55efd7","observation_id":"bf398295-290a-4cd1-a408-de9d69fe6597","resolution":{"observed_at":"2026-08-07T14:53:18.507278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:20.169177Z","title":null,"venue":null,"work_id":"26ba1e9c-6711-464a-a8f8-df3bbc69b694","year":null},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.615503Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:0d0f1f4a50b2c4745f1f0fd2e17f6cae99ba9bc4bf718a6281c15e52a0c5c706","observation_id":"40441d08-839b-4330-9113-0461d391477a","resolution":{"observed_at":"2026-08-07T14:53:20.293072Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:19.982427Z","title":null,"venue":null,"work_id":"6869f2d4-ea00-4389-b866-695acb415547","year":null},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.743653Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:1bfa587c59a7ef543975ac747bc121302c00b0573ef5d538088b8ff84ee0427f","observation_id":"409776ea-b68d-4b8a-874b-af7b89ec1c41","resolution":{"observed_at":"2026-08-07T14:53:20.071455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:19.766938Z","title":null,"venue":null,"work_id":"07dd6d89-d041-4719-8c0e-1d8490b9d469","year":null},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.852069Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:f9b50cd7b7c3ab3aeee00d75cba825dd50d23405b0850f9a6d451f5d7d616779","observation_id":"04b30b9b-3f9c-483b-ab74-e59c35936428","resolution":{"observed_at":"2026-08-07T14:53:19.867514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:53:19.562304Z","title":"16 Table 13: Multi STFT Discriminator parameter settings of Di stilCodec","venue":null,"work_id":"21aef50e-93c3-4c6b-98f3-ff11cfcbbce5","year":2000},"citing_paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:53:18.993310Z"},"links":{"citing_paper":"/paper/2505.17426"},"observation_digest":"sha256:62a9afb0e85d8c74b57b5323dc3a7642258e1d50f75de63ef7c0a5f54c0585ba","observation_id":"173d7a8f-9474-45ea-9412-76d0b909fe51","resolution":{"observed_at":"2026-08-07T14:53:19.646311Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.17426","last_updated":"2025-05-23T03:13:46Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T01:56:34.167573Z","submitted_at":"2025-05-23T03:13:46Z","title":"UniTTS: An end-to-end TTS system without decoupling of acoustic and semantic information"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2505.17426."}