{"as_of":"2026-08-20T23:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:94aa1ae30e39538d25598a9fec33143f8f1b70beedaf92312f542c212322b047","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:17:25.271659Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.05159/citation-record","integrity":"/paper/2505.05159/integrity","json":"/paper/2505.05159/citation-record.json","paper":"/paper/2505.05159"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-15T23:17:25.024367Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.024367Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:3586ba22ea5c484255597955bb96c6b6a3ba07c817e6330535c1957e6271147d","observation_id":"a9490f9d-24f5-4afa-8103-79b7378c26f1","resolution":{"observed_at":"2026-08-15T23:17:25.024367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:26.191804Z","title":"Tyers, and Gregor Weber","venue":null,"work_id":"adc465c1-eb62-44bf-865b-4307d0506001","year":2020},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.028956Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:00e7faec82abff1dc33f63ce03a8c730e53cff350d11e8bcb255de960e62fa0c","observation_id":"7f315e98-c5e8-4d69-8a82-eacaca25f95c","resolution":{"observed_at":"2026-08-15T23:17:26.195369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-08-20T12:18:44.930688Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-15T23:17:25.033320Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.033320Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:ffa326aa5d46fb7699a8f86736ae0e86de719b7c3a50aa803a8b3d664e9551b3","observation_id":"47971306-ecbd-4448-9537-17ea147d8861","resolution":{"observed_at":"2026-08-15T23:17:25.033320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.037475Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.037475Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:548944050b51119d9c0d59eeebcf347d9cecbe79646eb29cb65af8f168a68a19","observation_id":"55329d24-ee78-40e2-8ad3-3820a221f0b7","resolution":{"observed_at":"2026-08-15T23:17:25.037475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:26.173980Z","title":null,"venue":null,"work_id":"e15b21cf-41fe-430e-a6e8-4c29b8399c25","year":2022},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.041341Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:d57eda337ae2a51796c76117e63e20c7a6328bc72d000fca5f0ef116fee14d10","observation_id":"78e2791f-d7a9-4f52-8f5d-0c02a4e264a9","resolution":{"observed_at":"2026-08-15T23:17:26.177988Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:26.162561Z","title":null,"venue":null,"work_id":"34c8e0a7-808a-48d1-a62e-5ba293ff28bc","year":null},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.045495Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:db40ab1884adc034a17979968fb1934761ab0bf984b4500f0dc708f2f3bef690","observation_id":"b28a1746-2ab3-4a8d-8d68-835476ebdca4","resolution":{"observed_at":"2026-08-15T23:17:26.166509Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-19T20:01:24.492737Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-15T23:17:25.053367Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.053367Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:25f8955ec6280c4b07c9ed906d6c221986ecb520df0270a744ac9eb59c40a053","observation_id":"07bbf205-96f3-4b14-a5ba-b6bd3c6cded2","resolution":{"observed_at":"2026-08-15T23:17:25.053367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:26.150869Z","title":null,"venue":null,"work_id":"5e524e21-4b85-4950-bba7-b1b0d8732738","year":2018},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.057095Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:74100ed921ca471c623542f2e32abfb34fd787c1f6c2495b4a00788b551baa4b","observation_id":"cc148e6e-d9ba-4144-b0b9-74d09a006111","resolution":{"observed_at":"2026-08-15T23:17:26.154640Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-16T05:58:47.061997Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-15T23:17:25.060752Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.060752Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:2a7960ff6eab4f27dd2c6f1ea63c2fd84c4bf4b0ab25c131981ec1101236047a","observation_id":"501070d8-e3ec-4521-bdd5-5ab4fd1102f4","resolution":{"observed_at":"2026-08-15T23:17:25.060752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.065429Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.065429Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:64db592a96f878db82b56a0a3b04fe6162639972681c0a140f144cc430f13020","observation_id":"5289587f-1e44-4194-833f-80fb612610e0","resolution":{"observed_at":"2026-08-15T23:17:25.065429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:26.132608Z","title":null,"venue":null,"work_id":"a1887f20-86c4-4793-ba56-625938275e2b","year":2020},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.069143Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:04e15474e6a2e8f9f2baf0f91ea70d938976f770b96fcf605941cfd73e3e2734","observation_id":"3a9bcbdf-5c84-4293-9fd9-fc4655b1a735","resolution":{"observed_at":"2026-08-15T23:17:26.136352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-15T23:17:25.072873Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.072873Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:7a83216b2d8f28fde885bdd83b8ffcf64c40c6a952e4209b32a089288bde878f","observation_id":"94ffb4b5-e451-41a1-8aa4-0fe2cf4d3bc9","resolution":{"observed_at":"2026-08-15T23:17:25.072873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-15T23:17:25.076827Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.076827Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:1d09c02b03bb2db69173bf078f6f02d31d58e996ba8e8278342b25563b387f3e","observation_id":"a9c77cef-4f8d-4e85-8431-c71a56cf7ca0","resolution":{"observed_at":"2026-08-15T23:17:25.076827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:26.120629Z","title":null,"venue":null,"work_id":"d79b47c3-b33b-4e56-b17e-3dcbc204b069","year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.081403Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:d5d76e9a0f558fe7da95010ed8172cdd6a437f66a6a405235ca30510b0d57060","observation_id":"233f2909-d7df-4113-8830-85c23646da5b","resolution":{"observed_at":"2026-08-15T23:17:26.124791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:26.108266Z","title":null,"venue":null,"work_id":"ecab6904-9f44-48c2-ad16-5d3eb2dda7d5","year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.085052Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:647a6f44e094e77e532b41e6aef4f4627eb99b12dc30471f1a83cafca1ea3770","observation_id":"79d3f9fd-10b0-49fd-92b0-8d599d4fddd7","resolution":{"observed_at":"2026-08-15T23:17:26.112869Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:26.094684Z","title":null,"venue":null,"work_id":"577d368f-514f-4c9a-9460-514b8c830b3e","year":2022},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.088569Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:1590a13e6f0024a45d2aa7961a6412fb3f03fc127f5fb5c530f9d9bb95940018","observation_id":"9cf70719-1813-41ab-a409-638b3458340c","resolution":{"observed_at":"2026-08-15T23:17:26.099757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:26.082329Z","title":null,"venue":null,"work_id":"99b55434-9276-4bc6-90d5-b06b3ec31b87","year":2021},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.092773Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:d7f5881d1a0fba0a3a5cb6ad00bf62771fca248e92ef8070184bce2c0463a826","observation_id":"16276d46-c644-45f0-995b-86a7fe915482","resolution":{"observed_at":"2026-08-15T23:17:26.086373Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-15T23:17:25.096810Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.096810Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:c787bfc742cb9f6607cad3059848614c14897d82df925073b386855a3a66d5f0","observation_id":"42c41b85-8d58-40f3-8f85-d0f2ee1bd6f1","resolution":{"observed_at":"2026-08-15T23:17:25.096810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02243","last_updated":"2024-07-02T13:04:04Z","snapshot_observed_at":"2026-08-16T13:37:45.320757Z","submitted_at":"2024-07-02T13:04:04Z","title":"Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02243","snapshot_observed_at":"2026-08-15T23:17:25.100800Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.100800Z"},"links":{"cited_paper":"/paper/2407.02243","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:451b6de7c1ef2ae902d0a30ef5a7ec91ce0bee4c89afbc87633d6cb7bc6cf0cb","observation_id":"126324db-0e16-4baa-9d02-9df7014944a0","resolution":{"observed_at":"2026-08-15T23:17:25.100800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:26.070702Z","title":null,"venue":null,"work_id":"35bd425f-ca42-48a7-aef1-756c81e37654","year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.104784Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:1796b2ba88eb521855fbfd04b99924a9446501937ffc6f049de909a8c10c0aa9","observation_id":"9ab3db31-3229-4947-a6d6-5a7685a65f82","resolution":{"observed_at":"2026-08-15T23:17:26.074415Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:26.058859Z","title":null,"venue":null,"work_id":"f9c97b10-70b7-4e07-8985-dc29c94cb277","year":null},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.108479Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:cf3cd63a31e4fa1fec0748059929caf29ba6d447ac3bd60ce99485c33806b382","observation_id":"c7451e47-a31a-433c-ad4b-0098950e221c","resolution":{"observed_at":"2026-08-15T23:17:26.062639Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03509","last_updated":"2023-06-06T08:54:49Z","snapshot_observed_at":"2026-08-20T00:04:16.560711Z","submitted_at":"2023-06-06T08:54:49Z","title":"Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03509","snapshot_observed_at":"2026-08-15T23:17:25.116474Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.116474Z"},"links":{"cited_paper":"/paper/2306.03509","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:88bea7edfdebbf3ec09659dd7c4aad3f06a48125af76dd796e6f12a072712d16","observation_id":"2326d4fb-f06a-423d-8975-28e7f84d62ad","resolution":{"observed_at":"2026-08-15T23:17:25.116474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:26.047279Z","title":null,"venue":null,"work_id":"09eb7b1a-211e-4859-9400-34719b0a15f1","year":null},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.120655Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:73b966896bea18d9def0943d777f2b6e450c059658f77c0f19f7d9b50b2131da","observation_id":"d172dc6c-58ef-4fc3-ad3a-b58e8d402168","resolution":{"observed_at":"2026-08-15T23:17:26.050879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.129432Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.129432Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:b3675d19ae2d3e1c57e9d47ecd5b8b86b215b9b2d0c9cddb07652e858ccf7fa0","observation_id":"faff6970-8737-4e8f-971f-d98d7235c3d8","resolution":{"observed_at":"2026-08-15T23:17:25.129432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:26.005364Z","title":null,"venue":null,"work_id":"d63bd86c-d5cc-444f-a191-1749d6e45777","year":2021},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.137141Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:0d650e2f825d054d54f1f8d27c73bd4272c91ffbbfd74e487c4c7cdd8b46ab29","observation_id":"ea2cfb0e-81bb-4b7f-8b79-2a9fccae81e6","resolution":{"observed_at":"2026-08-15T23:17:26.009314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:26.035755Z","title":"In Forty-first International Conference on Machine Learning, ICML 2024, Vienna, Austria, July 21-27, 2024","venue":null,"work_id":"3817d7db-2b37-4768-b148-69c42076f9c8","year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.125194Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:c40d2daf729b8897f6fcc5cea9be41c10a424fcf620cfbac642c760cb5f5af13","observation_id":"5263a8f7-cd24-4209-afbe-46c86ec8e671","resolution":{"observed_at":"2026-08-15T23:17:26.039710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.980861Z","title":null,"venue":null,"work_id":"59eacf9f-8caf-4ada-97cf-8d949fca9fd9","year":null},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.144914Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:2b33aca05f48997ee99a46bc383171b12dc24900a4d525bd69ec64b3f9974e2f","observation_id":"43d65f4b-9a9f-4c18-a096-d017b6dcdb45","resolution":{"observed_at":"2026-08-15T23:17:25.984811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.153279Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.153279Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:644578920e3200ce38cfea401ba6f9f10840ffb5136690a3b6769784d6605e35","observation_id":"8e81e9a7-447d-4a34-bc5f-5c61ff2f3b17","resolution":{"observed_at":"2026-08-15T23:17:25.153279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17081","last_updated":"2025-03-31T13:57:49Z","snapshot_observed_at":"2026-08-20T23:27:01.180787Z","submitted_at":"2024-10-22T15:02:37Z","title":"Continuous Speech Tokenizer in Text To Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17081","snapshot_observed_at":"2026-08-15T23:17:25.161455Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.161455Z"},"links":{"cited_paper":"/paper/2410.17081","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:78f1da634401a3187dbbc76b59ed8d630bbe1ec9ced5de7b3609afb528b63af0","observation_id":"c9f39c23-90da-4117-8f88-343804f73a6f","resolution":{"observed_at":"2026-08-15T23:17:25.161455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.993487Z","title":null,"venue":null,"work_id":"c8984adb-6b98-49b4-b42f-14975ca75f4b","year":2023},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.140962Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:0dbdf78f735249baca8d03c1c21067ec05e4074dc6b99f799e7922174f38a14e","observation_id":"b1f8f61f-8a88-4465-bca9-755d8118a00e","resolution":{"observed_at":"2026-08-15T23:17:25.997556Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.950669Z","title":null,"venue":null,"work_id":"e90e0e4b-4b3d-4e06-b58f-34613e86bf83","year":2023},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.171419Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:4a078185ddf25647c9ddb826ba91d2d3f1f20c717509639b319f3763992335d1","observation_id":"f7d54ad1-ba27-4e84-86e2-55e0312b3758","resolution":{"observed_at":"2026-08-15T23:17:25.954244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-08-16T20:07:00.407637Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-08-15T23:17:25.148966Z","title":"CoRR abs/2402.08093 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.148966Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:4c70b67c9702c9dcd310a727ccbbdb2c41083c65761bde298f5ccbbffd106e7f","observation_id":"c6759a81-8496-4955-9aaa-4033dba87444","resolution":{"observed_at":"2026-08-15T23:17:25.148966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.940244Z","title":null,"venue":null,"work_id":"f6bcb3a9-235f-4597-90c9-787a856abb2c","year":2021},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.180171Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:20b4800103aa8176748ea49ae899768865aa17e31deff6ea368594423e0194ab","observation_id":"368429bc-1add-4ea9-82b9-6e8cde7f4364","resolution":{"observed_at":"2026-08-15T23:17:25.943842Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.961153Z","title":"In The Eleventh International Conference on Learning Representations, ICLR 2023, Kigali, Rwanda, May 1-5, 2023","venue":null,"work_id":"fa9346a4-caba-4410-bd6b-917c7272d52e","year":2023},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.157451Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:f9dd5e639826d26e7e6c88a3a8c36ab246c99bcd9fbdd8d48782474d3886ae79","observation_id":"78a5465c-2da6-4ddd-8b59-3666eb41d44b","resolution":{"observed_at":"2026-08-15T23:17:25.965733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.919090Z","title":null,"venue":null,"work_id":"16520ce0-5352-470b-ba25-273810226aff","year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.192471Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:64285a6b5146ebcee6267aee91fdea8856d211db1974a87dc0e00f74994c194e","observation_id":"177df6cd-5081-4509-bda9-265e20a1f142","resolution":{"observed_at":"2026-08-15T23:17:25.922752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-15T23:17:25.165930Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.165930Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:60029425cfd2ecc52f9ca5947d931819b65b4b31ee384447911e0be586d3d6de","observation_id":"e8ed7c07-7ba5-4896-856a-ab21e0eb11b6","resolution":{"observed_at":"2026-08-15T23:17:25.165930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.893626Z","title":null,"venue":null,"work_id":"465d6119-0858-49f0-a19b-499304358acb","year":2021},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.202038Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:fd6ab9f75b4e1a993943eb88a28038bf08e8da087105dad458254c75fb8986ac","observation_id":"c3808849-4f14-4525-b6a1-07a3e14832f9","resolution":{"observed_at":"2026-08-15T23:17:25.897403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.176165Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.176165Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:84a2c11a48e20a9f7e8c7219a0eb19a1453688e8d15b5e8ca4392145d6bd3cef","observation_id":"a5a9018b-7524-49c7-9b88-4d334c05eeb7","resolution":{"observed_at":"2026-08-15T23:17:25.176165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.865721Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":"87450cf1-20ff-41cd-96c1-4df8ed0322f0","year":2023},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.210857Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:8261b235d4c1b5ff71a34fc2546daa6920c110406c92926b90aa945358e948bc","observation_id":"a72bcb5e-2b1c-4e37-aedb-830bce338cf9","resolution":{"observed_at":"2026-08-15T23:17:25.870707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.929383Z","title":null,"venue":null,"work_id":"f38f1f3a-c943-49ed-b539-85626f83dc83","year":null},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.184235Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:ae7a44573b58b676bca047173f8d1f8b1e5ab837875601740b56c5749f253013","observation_id":"e041d6ad-37a2-4169-961b-87ea194fce8b","resolution":{"observed_at":"2026-08-15T23:17:25.932905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08551","last_updated":"2025-05-27T05:07:56Z","snapshot_observed_at":"2026-08-17T17:09:21.212561Z","submitted_at":"2024-07-11T14:36:53Z","title":"Autoregressive Speech Synthesis without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08551","snapshot_observed_at":"2026-08-15T23:17:25.188076Z","title":"CoRR abs/2407.08551 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.188076Z"},"links":{"cited_paper":"/paper/2407.08551","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:b985558a1467426d4368f78338719d57a4f93e1bdb882436a778a21691d07536","observation_id":"9d458479-2df3-4c29-b479-039af330aee8","resolution":{"observed_at":"2026-08-15T23:17:25.188076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.222371Z","title":"Weiss, Mike Schuster, Navdeep Jaitly, Zongheng Yang, Zhifeng Chen, Yu Zhang, Yuxuan Wang, R","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.222371Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:5f4f31f24ab6e59cf122a1a99c086f323f024dd89796b73b6e0705025ccee873","observation_id":"9e53aeb0-b76c-4c91-bd7f-d23066248204","resolution":{"observed_at":"2026-08-15T23:17:25.222371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.907649Z","title":null,"venue":null,"work_id":"754e84b9-8dd2-4265-827d-5fa25a20953a","year":2023},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.197273Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:9815f2be7aa62f511e9cbb47f664902ce1a52e10edfdcaeaf07af5213e78109a","observation_id":"3e900965-a3e7-4b76-a2d3-7606abb7a2ef","resolution":{"observed_at":"2026-08-15T23:17:25.911672Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12403","last_updated":"2024-09-19T01:58:19Z","snapshot_observed_at":"2026-08-16T13:17:19.941639Z","submitted_at":"2024-09-19T01:58:19Z","title":"Preference Alignment Improves Language Model-Based TTS","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12403","snapshot_observed_at":"2026-08-15T23:17:25.230214Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.230214Z"},"links":{"cited_paper":"/paper/2409.12403","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:a5820fd62399a767edd7459badfc2e6d127f09270292903fc55f8c629cbc8b44","observation_id":"8c2eba9d-6f05-4273-924b-a1a22cd3e20e","resolution":{"observed_at":"2026-08-15T23:17:25.230214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.880837Z","title":null,"venue":null,"work_id":"3ccfba79-4e8d-4a26-9b65-50c090ac77c5","year":2023},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.206939Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:e88317863245b4e53509f14d42b54479ebeac48bd87f13f81da18452ac4e2b5f","observation_id":"c485c751-a2d2-4e37-98f4-2daee884d681","resolution":{"observed_at":"2026-08-15T23:17:25.884877Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.824374Z","title":null,"venue":null,"work_id":"bcffa617-ba7b-4ce1-a706-864b40d62e7d","year":2017},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.238834Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:cf3c63eda795457a95c0c29e2ace1fb4e03ea4cabebef2fb86c0b9de4fe95c74","observation_id":"04cd8926-2c33-4fcb-a368-f4a59a78ed46","resolution":{"observed_at":"2026-08-15T23:17:25.827936Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.853860Z","title":null,"venue":null,"work_id":"9b2fd00f-afcd-4697-a1d1-9eda4d88d795","year":2021},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.214679Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:f6dc6a8082cc21d21a1d2e1cd5c1d73a5e49b6fa38c8ad824c6ee8a0c7a8cb6d","observation_id":"da2a1e4f-cc12-4a8b-8a27-c1e10cac4c53","resolution":{"observed_at":"2026-08-15T23:17:25.857496Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.842763Z","title":null,"venue":null,"work_id":"4036bc2d-1516-4b2a-b1e3-276580497f54","year":2019},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.218619Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:0fd2c2172956d4b81a2637a61e35b24cf200d3273f2eed7c1d5132ac47ed91ef","observation_id":"872fd3d6-1e52-4de4-80c1-1ba13aab6c9b","resolution":{"observed_at":"2026-08-15T23:17:25.846310Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-16T14:56:06.586855Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-15T23:17:25.251071Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.251071Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:cd8fd3043ee6ecae262df359e67fad95f986b0d4dcafe94a4d9201381b328f95","observation_id":"e721eac9-0492-4384-9926-c7f0c9d8419f","resolution":{"observed_at":"2026-08-15T23:17:25.251071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.226168Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.226168Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:1b57dca99ce2492c98da4b4aa8fd06a75f34919e3754a1f4de3a6710d45f0de4","observation_id":"39638f6d-39c3-40b7-8ef1-1c49a73027a5","resolution":{"observed_at":"2026-08-15T23:17:25.226168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.799708Z","title":null,"venue":null,"work_id":"bf460f2d-f78f-41da-8656-259f8f3d0680","year":2022},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.259252Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:6cf8606bd3005fc81f098e130b262a11eb93b26e47028b8380158127cd4b42b2","observation_id":"cf870984-9d35-4a93-b939-a39f0cf600ba","resolution":{"observed_at":"2026-08-15T23:17:25.803893Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-15T23:17:25.234328Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.234328Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:6c353f9d96bcc44db1141f02fb5c6aaa0ec98b0b4c01000cd0631d45fc6711e9","observation_id":"83dbe4eb-e066-4bc6-8f35-6d34553c75a0","resolution":{"observed_at":"2026-08-15T23:17:25.234328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.771380Z","title":null,"venue":null,"work_id":"33da19a1-af2d-49d5-b431-227b8e92a117","year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.267769Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:b22c71f9c32034cb8fbf827eb0f83932b0fd11cbfc2452f56562cc53afaf5d6b","observation_id":"4b397100-866b-42f1-8035-b589747f1c33","resolution":{"observed_at":"2026-08-15T23:17:25.776375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-15T23:17:25.242589Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.242589Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:1596c27fadc45e2387abe22710a3e83df2d832f5988e36e6413c020b90a262f6","observation_id":"4648c6c9-9105-46a3-9050-85ee6376b56d","resolution":{"observed_at":"2026-08-15T23:17:25.242589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-16T15:35:40.710158Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-15T23:17:25.246725Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.246725Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:654675dcad4a1bbd3a76f7f5ab0a96def2b559f81283addb72e8266da0442e49","observation_id":"e7e3735f-62ec-4eb1-b101-c61ca7261c0c","resolution":{"observed_at":"2026-08-15T23:17:25.246725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.812693Z","title":null,"venue":null,"work_id":"2fe1baca-79ed-4016-9bf7-e7048438a018","year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.255469Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:b686eb343ba16766e2a62570ddd830074202577208e9fc71c6b4e86689e0a182","observation_id":"d4886e0b-8877-4bef-a76a-e7d8311bd623","resolution":{"observed_at":"2026-08-15T23:17:25.816676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.786025Z","title":null,"venue":null,"work_id":"99b3169b-15d6-4281-8592-be99ffb7408e","year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.263387Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:36fa129d3fe7afbfa924f396b308d84234af956650be61d645908011f5fc0da3","observation_id":"c37abb75-f70d-4d98-8de2-3918b7c75c1e","resolution":{"observed_at":"2026-08-15T23:17:25.790163Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:25.271659Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.271659Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:91502dbfcc846febbc4b9ac1e36b8914998027f238321de8021769634f715c09","observation_id":"b07c6bc7-f60f-4a27-b419-5d77b7a97369","resolution":{"observed_at":"2026-08-15T23:17:25.271659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:17:26.017107Z","title":null,"venue":null,"work_id":"387b4b85-b20f-4438-ac43-5d31204cc1e4","year":2023},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.133484Z"},"links":{"citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:a764b788b490b59602b8f01381ca2f5c7409047c12f286793244ffd631dd0a00","observation_id":"64be8acc-0ce3-4cdd-b726-5f6024bece62","resolution":{"observed_at":"2026-08-15T23:17:26.020959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-08-16T13:47:03.288626Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-15T23:17:25.049265Z","title":"CoRR abs/2406.00654 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.049265Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:7fa7202935d4e757b84049b5c5230dded2c705c9ea5711cd6930b377612a67a8","observation_id":"629f9cd0-9994-4a76-8b3c-c4bdabb64aa6","resolution":{"observed_at":"2026-08-15T23:17:25.049265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18924","last_updated":"2025-03-28T05:34:33Z","snapshot_observed_at":"2026-08-16T12:55:06.202467Z","submitted_at":"2025-02-26T08:22:00Z","title":"MegaTTS 3: Sparse Alignment Enhanced Latent Diffusion Transformer for Zero-Shot Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18924","snapshot_observed_at":"2026-08-15T23:17:25.112300Z","title":"CoRR abs/2502.18924 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T23:17:25.112300Z"},"links":{"cited_paper":"/paper/2502.18924","citing_paper":"/paper/2505.05159"},"observation_digest":"sha256:2f21b4c2e5c6bac599718aeee2bb37dbf851f1f990b66fed1b109147a8085716","observation_id":"2e77d247-b361-440c-8a45-8d12cfda49e6","resolution":{"observed_at":"2026-08-15T23:17:25.112300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.05159","last_updated":"2025-05-15T08:28:37Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-16T11:39:46.802851Z","submitted_at":"2025-05-08T11:55:19Z","title":"FlexSpeech: Towards Stable, Controllable and Expressive Text-to-Speech"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2505.05159."}