{"as_of":"2026-08-20T08:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:812d6a18113d0e838cff5456cfcd83285b341d20f8c0f6e3f279598f08b12ac0","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:08:22.468176Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:22:08.946434Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:10:07.248893Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08237","snapshot_observed_at":"2026-08-11T11:18:33.039702Z","title":"Touchtts: An embarrassingly simple tts framework that everyone can touch","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15622","last_updated":"2024-12-20T07:28:04Z","snapshot_observed_at":"2026-08-13T18:08:12.828161Z","submitted_at":"2024-12-20T07:28:04Z","title":"TouchASP: Elastic Automatic Speech Perception that Everyone Can Touch","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T11:18:33.039702Z"},"links":{"cited_paper":"/paper/2412.08237","citing_paper":"/paper/2412.15622"},"observation_digest":"sha256:b61c214ebf7694a4730fe66c3a97b91319d41498228e4d72808cf36fc8430432","observation_id":"b8573576-e615-4d8f-a016-8e8b90ae8429","resolution":{"observed_at":"2026-08-11T11:18:33.039702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08237","snapshot_observed_at":"2026-08-11T10:50:49.009679Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16102","last_updated":"2025-08-09T10:01:51Z","snapshot_observed_at":"2026-08-17T04:17:21.239733Z","submitted_at":"2024-12-20T17:43:50Z","title":"Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T10:50:49.009679Z"},"links":{"cited_paper":"/paper/2412.08237","citing_paper":"/paper/2412.16102"},"observation_digest":"sha256:f7ceb74e6781ed6cb40700b10a83a8ec47a6b4a9cbaa1ccee8d98afdce71d7cf","observation_id":"06bef987-0894-470b-9668-add4ed54f302","resolution":{"observed_at":"2026-08-11T10:50:49.009679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"cited_work":{"arxiv_id":"2412.08237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08237","snapshot_observed_at":"2026-07-04T20:10:07.248893Z","title":"Touchtts: An embarrassingly simple tts framework that everyone can touch","venue":null,"work_id":"4fe9677a-984a-49f2-b1fc-759524eef994","year":2024},"citing_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T05:27:25.425188Z"},"links":{"cited_paper":"/paper/2412.08237","citing_paper":"/paper/2505.17589"},"observation_digest":"sha256:4556ec5ec0112bc202babc9812872208827f65df6208cbf054811ba8f17d96a0","observation_id":"649e4fff-8935-4783-895b-cab52ba5cc8d","resolution":{"observed_at":"2026-05-16T05:27:25.549297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08237","snapshot_observed_at":"2026-08-06T16:30:09.691792Z","title":"Available: https://arxiv.org/abs/2412.08237","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13563","last_updated":"2026-06-23T14:05:34Z","snapshot_observed_at":"2026-08-17T13:02:47.275121Z","submitted_at":"2025-07-17T22:41:40Z","title":"Balalaika: Data-Centric, Prosody-Aware Annotation Pipeline for Russian Speech","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T16:30:09.691792Z"},"links":{"cited_paper":"/paper/2412.08237","citing_paper":"/paper/2507.13563"},"observation_digest":"sha256:ecdd6d6801d171ca0ef7adc296bd65e11e6cbbf91bc21052ab7d74bb8a57f2d9","observation_id":"ae15d67d-1ce5-49f0-a8db-e26d0cd91dcd","resolution":{"observed_at":"2026-08-06T16:30:09.691792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08237","snapshot_observed_at":"2026-08-06T15:48:20.978975Z","title":"Touchtts: An embarrassingly simple tts framework that everyone can touch","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:20.978975Z"},"links":{"cited_paper":"/paper/2412.08237","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:8a27a7ea1ca914afaa8a34b9b6563266408c53937be856285601fd24efe2ba85","observation_id":"4b5bb2d7-2828-4156-b580-53b0b7c92847","resolution":{"observed_at":"2026-08-06T15:48:20.978975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"cited_work":{"arxiv_id":"2412.08237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08237","snapshot_observed_at":"2026-07-04T20:10:07.248893Z","title":"Touchtts: An embarrassingly simple tts framework that everyone can touch","venue":null,"work_id":"4fe9677a-984a-49f2-b1fc-759524eef994","year":2024},"citing_paper":{"arxiv_id":"2603.19798","last_updated":"2026-04-03T08:41:19Z","snapshot_observed_at":"2026-08-14T11:54:15.610874Z","submitted_at":"2026-03-20T09:37:54Z","title":"Borderless Long Speech Synthesis","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T07:39:45.386208Z"},"links":{"cited_paper":"/paper/2412.08237","citing_paper":"/paper/2603.19798"},"observation_digest":"sha256:7bb6093a43389b70a111feae300edbe0a9ef8b35a531319b7c94f578aacc0dbe","observation_id":"8fbcb36f-463e-406c-b347-f32bcbc11b1e","resolution":{"observed_at":"2026-05-15T07:39:50.196070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"cited_work":{"arxiv_id":"2412.08237","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08237","snapshot_observed_at":"2026-07-04T20:10:07.248893Z","title":"Touchtts: An embarrassingly simple tts framework that everyone can touch","venue":null,"work_id":"4fe9677a-984a-49f2-b1fc-759524eef994","year":2024},"citing_paper":{"arxiv_id":"2606.25369","last_updated":"2026-06-24T03:57:21Z","snapshot_observed_at":"2026-08-13T02:20:11.511748Z","submitted_at":"2026-06-24T03:57:21Z","title":"Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-25T20:43:29.118351Z"},"links":{"cited_paper":"/paper/2412.08237","citing_paper":"/paper/2606.25369"},"observation_digest":"sha256:c9ec457138d3fba4f048d06a04f214018f89bb372ccedde4518954905f4f8711","observation_id":"d48e1a1e-4f92-43dc-9f48-dbc23b520d2e","resolution":{"observed_at":"2026-07-04T20:10:07.250749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08237","snapshot_observed_at":"2026-08-15T15:22:08.946434Z","title":"arXiv preprint arXiv:2412.08237 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00722","last_updated":"2026-08-01T15:41:55Z","snapshot_observed_at":"2026-08-19T12:18:54.514431Z","submitted_at":"2026-08-01T15:41:55Z","title":"Experience-Calibrated Contrastive Decoding for Mitigating Hallucinations in LM-Based Text-to-Speech","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T15:22:08.946434Z"},"links":{"cited_paper":"/paper/2412.08237","citing_paper":"/paper/2608.00722"},"observation_digest":"sha256:2e0b0ffc20ca1920ed358b7eed4dee569ffbfce21ac5a038c4b6dfcd101a6e08","observation_id":"849841b5-c2c5-445e-be47-e9310f0da1e6","resolution":{"observed_at":"2026-08-15T15:22:08.946434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08237/citation-record","integrity":"/paper/2412.08237/integrity","json":"/paper/2412.08237/citation-record.json","paper":"/paper/2412.08237"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-11T18:08:21.220313Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.220313Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:f24d22effac843b1b50a498b297e5986289a51f609fa41ceff8de3cecfb65076","observation_id":"9c0f2c5a-92cd-4bf5-a35f-dcc129a8f942","resolution":{"observed_at":"2026-08-11T18:08:21.220313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:08:23.943274Z","title":"Matcha-tts: A fast tts architecture with conditional flow matching","venue":null,"work_id":"b4974efd-5b57-4508-97cb-7d1218e36411","year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.283284Z"},"links":{"citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:b7ac4bf3ac4d82692c2a1f47b266358ba9c459a46320186e314f54bdf4349bd0","observation_id":"e5d6af9a-26b2-4955-be85-259db7942f6a","resolution":{"observed_at":"2026-08-11T18:08:23.948746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-11T18:08:21.290547Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.290547Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:32876fbd638dca5cd38446db456eb26c79746c3e1cd9b3a3619e1b73fe2dbb4a","observation_id":"7e53d2af-665a-4a8a-b9a9-a03dd1d7563e","resolution":{"observed_at":"2026-08-11T18:08:21.290547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:08:23.831906Z","title":"Tensorrt-llm, https://github.com/nvidia/tensorrt-llm, 2024","venue":null,"work_id":"3db17507-337e-400c-8b1f-9f4b09710da6","year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.296528Z"},"links":{"citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:e00554faca75c76afd047b41062c79862d9519808f9f8bb4d2ffaa2830b4eef9","observation_id":"00377421-e3be-43b9-814f-606104334678","resolution":{"observed_at":"2026-08-11T18:08:23.873058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:08:21.302797Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.302797Z"},"links":{"citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:1b50544e2377fd4d1f385ba3f5974a23e003db72c35450a8c15307509ba07408","observation_id":"b9ce65ba-d788-4f68-a602-44dc3328224e","resolution":{"observed_at":"2026-08-11T18:08:21.302797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-11T18:08:21.360766Z","title":"A survey on in-context learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.360766Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:25981b39e8012e370c906d76069f94b9460a65a91ce90ab4c2fb99564c5a578e","observation_id":"76716d8a-b0b7-4683-b004-930eec04fc31","resolution":{"observed_at":"2026-08-11T18:08:21.360766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-08-17T17:32:23.161927Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-11T18:08:21.514869Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.514869Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:ef4a0a06c1d7cf14ade93dd63a492b2016876f453cbff5d8df8c45dd1a2be71c","observation_id":"14708426-a94d-4b89-b445-2ee36eab8058","resolution":{"observed_at":"2026-08-11T18:08:21.514869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-08-19T09:44:27.064800Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-11T18:08:21.521139Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.521139Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:dd8c7f61e7106110d0656db32583661960053768b757a493ca4466281fe0a8b3","observation_id":"a36ebeec-3cd5-4aee-872c-8f34e3681db2","resolution":{"observed_at":"2026-08-11T18:08:21.521139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12139","last_updated":"2024-09-24T02:00:54Z","snapshot_observed_at":"2026-08-19T12:18:29.155827Z","submitted_at":"2024-09-18T17:03:12Z","title":"Takin: A Cohort of Superior Quality Zero-shot Speech Generation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12139","snapshot_observed_at":"2026-08-11T18:08:21.526764Z","title":"Takin: A cohort of superior quality zero-shot speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.526764Z"},"links":{"cited_paper":"/paper/2409.12139","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:ec411b4356ae1d6498ecdd3f19a2efd96d4673aaf30149eff4af33012e30be19","observation_id":"ecb87789-7171-4a96-8948-f07973122c76","resolution":{"observed_at":"2026-08-11T18:08:21.526764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:08:23.792817Z","title":"Wenetspeech4tts: A 12,800-hour mandarin tts corpus for large speech generation model benchmark, 2024","venue":null,"work_id":"b7600b3d-37f7-4b80-97c9-a9de97e8fc0f","year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.533197Z"},"links":{"citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:7b3de48cb04f43da1cc81ab07c7db6600a815c795b9b288093d23196313fc4e3","observation_id":"7f4dffea-ff9c-4850-aeaf-e92507e95c58","resolution":{"observed_at":"2026-08-11T18:08:23.798628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-19T13:44:12.385881Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-11T18:08:21.539179Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.539179Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:a703c8c6884c8449abb795e4988de47aa5aad344385dcf8198069b0378984e79","observation_id":"4f15adfc-e4a4-470c-883a-e7813dc1edb5","resolution":{"observed_at":"2026-08-11T18:08:21.539179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:08:23.775722Z","title":"Autoprep: An automatic preprocessing framework for in-the-wild speech data","venue":null,"work_id":"de7a7b4b-cc8a-4f8d-898d-45b730460ca9","year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.544007Z"},"links":{"citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:d2eb557620c75c86f104e47693c1773e127371b5a2bba36901666fa9cab2516e","observation_id":"71f22068-6a51-4ae3-ab9e-631c43399a61","resolution":{"observed_at":"2026-08-11T18:08:23.781474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-11T18:08:21.670486Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.670486Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:69e7a63c37ba2829045844c2492bbb4cb98673a298a863821abddd663c14596b","observation_id":"9524d2cb-d989-4da6-9acf-a538ec5c9f44","resolution":{"observed_at":"2026-08-11T18:08:21.670486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:08:23.689374Z","title":"Dnsmos p","venue":null,"work_id":"eb0cac6d-0313-42a4-98f3-f443eb3124c5","year":2022},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.726313Z"},"links":{"citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:efecbba8f5b7a6490892bb64a7c134b4323574ff5075e4065544d5a6947b12af","observation_id":"85701e04-db90-4a23-9fd6-ce4d017651e8","resolution":{"observed_at":"2026-08-11T18:08:23.733607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-11T18:08:21.732047Z","title":"Audiopalm: A large language model that can speak and listen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.732047Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:4cd3b1d70e864383e9e5443d64accb746fe8ae964973693bb27023e1533b2596","observation_id":"8538d50f-60f3-444b-afd5-da95ded1fda2","resolution":{"observed_at":"2026-08-11T18:08:21.732047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07341","last_updated":"2024-04-12T18:23:35Z","snapshot_observed_at":"2026-08-19T12:19:30.969829Z","submitted_at":"2024-04-10T20:40:24Z","title":"Conformer-1: Robust ASR via Large-Scale Semisupervised Bootstrapping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07341","snapshot_observed_at":"2026-08-11T18:08:21.738126Z","title":"Conformer-1: Robust asr via large-scale semisupervised bootstrapping","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.738126Z"},"links":{"cited_paper":"/paper/2404.07341","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:2793f91994dcd91082cf51940fbe7c56382e5da55b34de9067edf8ffbb6d46c1","observation_id":"e7907a02-61d0-4b53-a45f-ecd6273793c0","resolution":{"observed_at":"2026-08-11T18:08:21.738126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09841","last_updated":"2024-04-16T14:55:13Z","snapshot_observed_at":"2026-08-16T14:00:48.202348Z","submitted_at":"2024-04-15T14:48:43Z","title":"Anatomy of Industrial Scale Multilingual ASR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09841","snapshot_observed_at":"2026-08-11T18:08:21.743850Z","title":"Anatomy of industrial scale multilingual asr","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.743850Z"},"links":{"cited_paper":"/paper/2404.09841","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:a8df476b4f971dcf90d5f93adea91920dcb40c955de6ff0020fc4e2f07271ac1","observation_id":"0fee4344-9b68-48e6-905d-4b0eaa6ce871","resolution":{"observed_at":"2026-08-11T18:08:21.743850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:08:23.534048Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"bcd8e4c6-f650-49e7-96fd-4ad8e6cd13c6","year":2023},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.750379Z"},"links":{"citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:61e8767355501c6b867151eb533b33b10398348f8050f28a3149ffe94fc2244d","observation_id":"6098f619-c285-4b20-bb0e-e7f1852d105a","resolution":{"observed_at":"2026-08-11T18:08:23.589187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-19T12:18:48.675787Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-11T18:08:21.797820Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.797820Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:a31104a8bf9aa4ee59104395ca8a4b84197ab4322e751512291e072369218407","observation_id":"f2025600-be32-418c-900e-0c687c575d17","resolution":{"observed_at":"2026-08-11T18:08:21.797820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15455","last_updated":"2022-07-05T07:47:22Z","snapshot_observed_at":"2026-08-19T12:18:49.190073Z","submitted_at":"2022-03-29T11:54:34Z","title":"WeNet 2.0: More Productive End-to-End Speech Recognition Toolkit","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15455","snapshot_observed_at":"2026-08-11T18:08:21.882088Z","title":"Wenet 2.0: More productive end-to-end speech recognition toolkit","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.882088Z"},"links":{"cited_paper":"/paper/2203.15455","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:8462018735eb10dc3bced20545d527dfe84b85d614881275d9dc86a0f0f299eb","observation_id":"ff202718-2327-4c02-839a-e0ca95c00bef","resolution":{"observed_at":"2026-08-11T18:08:21.882088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-11T18:08:21.919160Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.919160Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:aeec6458c0411ee98e2788bc830542fb22f65836c11569995b639eaec0fd9fa7","observation_id":"d6265433-5bf9-4479-acd3-589ade9fe126","resolution":{"observed_at":"2026-08-11T18:08:21.919160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:08:23.517357Z","title":"Conditional variational autoencoder with adversar- ial learning for end-to-end text-to-speech","venue":null,"work_id":"4b5a418f-6ac7-4bf3-820b-b0169551b501","year":2021},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.927770Z"},"links":{"citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:82be3b0a22d86539226c43375d1777a5797fc123077834df5da1c0d25e47df3a","observation_id":"2e1f8654-d813-465f-92f4-eba1ea976522","resolution":{"observed_at":"2026-08-11T18:08:23.522689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:08:23.491227Z","title":"FastSpeech: Fast, robust and controllable text to speech","venue":null,"work_id":"279df038-0453-418b-b1c9-89b207406dc3","year":2019},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.933675Z"},"links":{"citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:88418c4e33d72bf9ba6bebecb752973597dde8098ebc89be013ccf0b6f64ebca","observation_id":"9b60a389-9c89-4723-9c16-42610d48c005","resolution":{"observed_at":"2026-08-11T18:08:23.505291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:08:23.282764Z","title":null,"venue":null,"work_id":"886715d1-5ce9-4d65-bde1-9b359981c411","year":2020},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.938510Z"},"links":{"citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:09ceb4819dca9c58f0edb8bd958217242aa7f5b79a078400f5c55d46bcdf5b05","observation_id":"013ba208-de80-4ee5-81bd-29eda3a8bcd1","resolution":{"observed_at":"2026-08-11T18:08:23.407059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:08:23.266189Z","title":"Flow- TTS: A non-autoregressive network for text to speech based on flow","venue":null,"work_id":"80005381-e686-4592-8d96-bbc674a499e9","year":2020},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:21.943925Z"},"links":{"citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:59ecabdc855d052c8bae5584d126a8788957b5b9d961c5a495a0b013b34411f4","observation_id":"74e0850d-acf8-4e64-b6e7-a75d99f1b7ad","resolution":{"observed_at":"2026-08-11T18:08:23.271402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-16T14:18:48.581750Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-08-11T18:08:22.019176Z","title":"An embarrassingly simple approach for llm with strong asr capacity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:22.019176Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:3dcc616986154d03bae2fe42b5444a452e454f40ac97c07ccd15ee7b354d711e","observation_id":"e0f7b5e2-e811-47fb-8381-d9442528c73a","resolution":{"observed_at":"2026-08-11T18:08:22.019176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-16T14:54:18.806254Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-11T18:08:22.096260Z","title":"Lauragpt: Listen, attend, understand, and regenerate audio with gpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:22.096260Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:07ada1087ae9e7c164e54f60b368cd67c8aa7c7cef443b55041adb1672049a2d","observation_id":"ee79a058-2e8c-4acf-9ec8-70da2858fa0a","resolution":{"observed_at":"2026-08-11T18:08:22.096260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04675","last_updated":"2024-07-10T09:01:17Z","snapshot_observed_at":"2026-08-16T13:36:42.713695Z","submitted_at":"2024-07-05T17:38:03Z","title":"Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04675","snapshot_observed_at":"2026-08-11T18:08:22.102985Z","title":"Seed-asr: Understanding diverse speech and contexts with llm-based speech recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:22.102985Z"},"links":{"cited_paper":"/paper/2407.04675","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:6aa55a869eefa1b8c32faa7d465e6b582108776976e4bcd93345147d33f2b68f","observation_id":"647a6ebd-3673-4ad8-b35c-6f63a7df5f33","resolution":{"observed_at":"2026-08-11T18:08:22.102985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15835","last_updated":"2025-05-21T16:55:34Z","snapshot_observed_at":"2026-08-16T20:32:03.446600Z","submitted_at":"2024-07-22T17:51:53Z","title":"dMel: Speech Tokenization made Simple","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15835","snapshot_observed_at":"2026-08-11T18:08:22.110679Z","title":"dmel: Speech tokenization made simple","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:22.110679Z"},"links":{"cited_paper":"/paper/2407.15835","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:ac5ef0a4114607981d83c03443f5aef7eb59e92e7f8e7ea642b9645a325a0dbb","observation_id":"1ee258fb-61d1-43ac-bc9a-339dfb8e6b5c","resolution":{"observed_at":"2026-08-11T18:08:22.110679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:08:22.117560Z","title":"Librispeech: an asr corpus based on public domain audio books","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:22.117560Z"},"links":{"citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:6e6074dbb94543d78359ea5d65ac82e5b55a7a29b77dbea8a95c1e35b68438f7","observation_id":"07d337c4-65c0-46ef-a01c-3a652fbb48a8","resolution":{"observed_at":"2026-08-11T18:08:22.117560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17607","last_updated":"2024-12-02T16:13:24Z","snapshot_observed_at":"2026-08-19T05:24:09.876190Z","submitted_at":"2024-11-26T17:19:09Z","title":"Scaling Speech-Text Pre-training with Synthetic Interleaved Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17607","snapshot_observed_at":"2026-08-11T18:08:22.122969Z","title":"Scaling speech-text pre-training with synthetic interleaved data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:22.122969Z"},"links":{"cited_paper":"/paper/2411.17607","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:a576a7e425ffa75e2af35ad0c77f114d1f44e5fcc56d84bf5d9f9aa18b1ccab4","observation_id":"fc953978-061d-4e64-af49-b7fe1ea0dfed","resolution":{"observed_at":"2026-08-11T18:08:22.122969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05755","last_updated":"2024-10-18T19:18:41Z","snapshot_observed_at":"2026-08-18T17:55:18.228697Z","submitted_at":"2024-02-08T15:39:32Z","title":"Spirit LM: Interleaved Spoken and Written Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05755","snapshot_observed_at":"2026-08-11T18:08:22.225106Z","title":"Spirit-lm: Interleaved spoken and written language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:22.225106Z"},"links":{"cited_paper":"/paper/2402.05755","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:c7945f9728275e808f5ae5bfb9eb56930c22dfd009c7122ebfab89a31e4254a1","observation_id":"bbd21626-3df2-46ed-b674-41b41737dec3","resolution":{"observed_at":"2026-08-11T18:08:22.225106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-11T18:08:22.349166Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:22.349166Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:502221f95b8a94e1638b58c532a3e478f6dbd8ffcf001777e1d12a248d44fb83","observation_id":"3eec4792-0ce4-4306-95c5-512c23899f9f","resolution":{"observed_at":"2026-08-11T18:08:22.349166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:08:22.357484Z","title":"Didispeech: A large scale mandarin speech corpus","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:22.357484Z"},"links":{"citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:57895a2b944abbf17f5498130fc4ba83a76e999c00c54e3478ca2a2b20d6a194","observation_id":"d8acfa9a-6753-4159-8d29-c7345c7d2d95","resolution":{"observed_at":"2026-08-11T18:08:22.357484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-11T18:08:22.362702Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:22.362702Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:3104096a054c70727ce6b846c9341c6b2d1f24ed3be9686ffd64e0e1bf8e331e","observation_id":"1ba52b68-e7f6-4832-9721-4ba82c72dc29","resolution":{"observed_at":"2026-08-11T18:08:22.362702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-16T05:58:47.061997Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-11T18:08:22.371436Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:22.371436Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:ca68d224e7f1018469595526eea26a585ae0d25c030ee2e8161216d2962e4cb2","observation_id":"a72a38ed-83fb-46f8-851e-bcfa8cea037e","resolution":{"observed_at":"2026-08-11T18:08:22.371436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-16T13:22:17.818052Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-11T18:08:22.378032Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:22.378032Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:e846a7141d8ca607f44d472864e6f0a4c8cd9ead4a4d3811e5d2ec0dc0953f7c","observation_id":"7ac6d73c-4f62-49b0-a77c-5a5d04a92fbf","resolution":{"observed_at":"2026-08-11T18:08:22.378032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:08:23.165325Z","title":"Wespeaker: A research and production oriented speaker embedding learning toolkit","venue":null,"work_id":"6864a018-e3ce-4005-ae6e-2cc4e7e6658c","year":2023},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:22.435225Z"},"links":{"citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:e833b54ab78c731a1101430a9c98560ed628aaa60fca3182c4f9be591788b4cf","observation_id":"a228842c-9982-4f5b-ad87-6d326cb7bbf1","resolution":{"observed_at":"2026-08-11T18:08:23.231266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:08:22.998094Z","title":"Speechcolab leaderboard, https://github.com/speechcolab/leaderboard, 2021","venue":null,"work_id":"73edf953-850a-4302-b405-f89b6a36e0b0","year":2021},"citing_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T18:08:22.468176Z"},"links":{"citing_paper":"/paper/2412.08237"},"observation_digest":"sha256:06859d35521991cb789f56e32de2d14d3ccaf9ec40dc1b2f8ca1d4ae092d2900","observation_id":"0707ff01-6773-4813-950f-d5ec9cff023c","resolution":{"observed_at":"2026-08-11T18:08:23.031107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T21:05:04.479423Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 8 inbound Pith citation observations for arXiv:2412.08237."}