{"as_of":"2026-08-10T04:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:44ed5fb5be425cddc04f740efd9faec7d8d4c87b47f653120217e15cfecf0d21","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:15:56.850541Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:15:54.536075Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T11:22:28.361623Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19669","snapshot_observed_at":"2026-08-07T14:15:54.536075Z","title":"𝑥#𝑥$y! 𝑦","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.536075Z"},"links":{"cited_paper":"/paper/2505.19669","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:e475f6d91e27ba1320d7414ceeca3a50714ef8d32fa618b26f835048fa60a18f","observation_id":"b157e099-92a6-4c5f-86fa-8feddde23ab5","resolution":{"observed_at":"2026-08-07T14:15:54.536075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19669","snapshot_observed_at":"2026-08-07T00:52:02.492729Z","title":"Zero-shot streaming text to speech synthesis with transducer and auto-regressive modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-09T04:18:05.919282Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.492729Z"},"links":{"cited_paper":"/paper/2505.19669","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:16fc843ab0189de01199f00471b88ce0995bebef955b5bafb82910e872ae8721","observation_id":"ad5cbb77-9e8e-4f73-ad1a-344020d4bdf4","resolution":{"observed_at":"2026-08-07T00:52:02.492729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"cited_work":{"arxiv_id":"2505.19669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19669","snapshot_observed_at":"2026-08-06T11:22:28.361623Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","venue":"cs.LG","work_id":"198e2c51-d3be-4195-8a87-b6c703fbe641","year":2025},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:27.182862Z"},"links":{"cited_paper":"/paper/2505.19669","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:4dd21e18b68252b2eea1a0814982a6ee9a0a82fd750aa2a4657c83be3962dd81","observation_id":"4706dce0-0b29-472a-80c5-38080d13a8c1","resolution":{"observed_at":"2026-08-06T11:22:28.411634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19669/citation-record","integrity":"/paper/2505.19669/integrity","json":"/paper/2505.19669/citation-record.json","paper":"/paper/2505.19669"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:00.670410Z","title":"<eos> <bos> 𝑦! <eos> 𝑦#<bos> 𝑦","venue":null,"work_id":"9c118a43-ed60-4dde-99dd-0ed260ea63e2","year":null},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.302540Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:7410d47dd11042f2a3168f4bf405421cc4d09ce41c287d0a278c1727ed5b33e8","observation_id":"3db29749-9a2b-4027-bf1f-044ab8826a08","resolution":{"observed_at":"2026-08-07T14:16:00.735947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:00.500461Z","title":"Specifically, it uses a Transducer to convert the text into a sequence of se- mantic token in real time","venue":null,"work_id":"ef89b027-c857-4939-b462-3b2254a98450","year":null},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.368789Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:0ffe0a53c2edbe820c20e948ecce82cbeefb0915d588e79aa2974aa28f887929","observation_id":"1ca17757-54e9-4855-a3da-83635fb401c5","resolution":{"observed_at":"2026-08-07T14:16:00.561077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:00.221125Z","title":"Delete ⟨Bos⟩ Mechanism","venue":null,"work_id":"083b3798-1faa-4d2f-a790-1757e2b8c41a","year":null},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.457220Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:0f12bc4209f504f15cbb81e5453cc35f7d7ea2224c7f4bdc23a8faa33d80b8a5","observation_id":"abd7dcf7-bf08-4280-a845-e12a5cd2ab21","resolution":{"observed_at":"2026-08-07T14:16:00.399535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19669","snapshot_observed_at":"2026-08-07T14:15:54.536075Z","title":"𝑥#𝑥$y! 𝑦","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.536075Z"},"links":{"cited_paper":"/paper/2505.19669","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:e475f6d91e27ba1320d7414ceeca3a50714ef8d32fa618b26f835048fa60a18f","observation_id":"b157e099-92a6-4c5f-86fa-8feddde23ab5","resolution":{"observed_at":"2026-08-07T14:15:54.536075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:59.981795Z","title":"𝑚# 𝑚$ 𝑚% 𝑚& 𝑚'…… 𝑚! 𝑚% 𝑚","venue":null,"work_id":"bccbe26a-a92d-4a48-976d-eb763c58ecc5","year":null},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.612074Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:ddf8b1c499844fcfa864f6602978f62d12027c945f6c339be662127b1563f707","observation_id":"b7359fb2-2924-46d9-ac34-68d8b76debfa","resolution":{"observed_at":"2026-08-07T14:16:00.102532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:59.672214Z","title":"Training Datasets We train SMLLE on the LibriSpeech dataset [27]","venue":null,"work_id":"13462b1a-68c7-4030-a10f-70a8a086ebd0","year":null},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.679034Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:2f9372a22363b4389cc46f42f0f4c33b17da9abdf2f6fdd130884e5dec4ea2af","observation_id":"10fe7834-ee62-4958-a01f-13f37865905d","resolution":{"observed_at":"2026-08-07T14:15:59.849141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:59.386420Z","title":"SMLLE-R5","venue":null,"work_id":"315e1590-cecc-4a10-aa61-545b93920a49","year":null},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.734281Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:ff46262355b9587c5279d24e39609c9b8f79cf64d1bc669a7a8e582b7677185a","observation_id":"637d4ad4-31c2-4e52-a91e-db1f8143081f","resolution":{"observed_at":"2026-08-07T14:15:59.537632Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:59.214748Z","title":"It uses a Transducer model to convert text into semantic tokens in real time and reconstructs them into mel-spectrograms frame by frame using an AR model","venue":null,"work_id":"6e9413f3-8521-474a-bc84-10aea3e31a90","year":null},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.800671Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:0fafcfba47939ae61e39cb84a45d1520a43969d9e36b4e65310717b336da29cf","observation_id":"660d2a3d-5bc9-4dc2-b223-71d37dbf1aaa","resolution":{"observed_at":"2026-08-07T14:15:59.284368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T14:15:54.839595Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.839595Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:e86af6ca529ef11bab2dd57b2e08fa2107a5f728439588e0323fe863f3847cb9","observation_id":"e61516d7-dcd4-4687-81c3-8ab1b49cc20a","resolution":{"observed_at":"2026-08-07T14:15:54.839595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:15:54.910526Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.910526Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:0e56968c61631300d2349bbd0cb215e335d6971df888e8e8adade7a97138f7b3","observation_id":"10855297-8798-4096-83be-7c47490509e8","resolution":{"observed_at":"2026-08-07T14:15:54.910526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:54.998181Z","title":"Zero-shot text-to-image generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.998181Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:11298c17335e2b5549b3436b7ce6a199ce3fe529660b2ac4f47af94f9b386bea","observation_id":"e3a2c76e-35c3-4c52-be70-1536443c2ff4","resolution":{"observed_at":"2026-08-07T14:15:54.998181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:55.105958Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.105958Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:d99344ebb11863a16d5223aa9456ac49567aba5e993bfcbcbfbfc832c450efc5","observation_id":"91e8bcbc-9c99-4d09-9708-81e495670817","resolution":{"observed_at":"2026-08-07T14:15:55.105958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T14:15:55.172894Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.172894Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:5e233368fed5721e497168fb2b89a8f90a1dbf8847c8a4ec576a7fd2fc4b1f31","observation_id":"8688be3c-dae8-4999-810d-adf59919d480","resolution":{"observed_at":"2026-08-07T14:15:55.172894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-07T14:15:55.227783Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.227783Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:f463d950e75d93000cb3e29ba3add7725048661d4bfb0853681907b66406153a","observation_id":"fab4a743-7c6c-42bb-a1ab-0ef3ae3e293a","resolution":{"observed_at":"2026-08-07T14:15:55.227783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08551","last_updated":"2025-05-27T05:07:56Z","snapshot_observed_at":"2026-08-05T05:08:56.833881Z","submitted_at":"2024-07-11T14:36:53Z","title":"Autoregressive Speech Synthesis without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08551","snapshot_observed_at":"2026-08-07T14:15:55.347789Z","title":"Autoregressive speech synthesis without vector quantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.347789Z"},"links":{"cited_paper":"/paper/2407.08551","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:4731c6bc479b60453d9782007aa9141c3ac6eb938cbd05785f9256441a1a4e71","observation_id":"d5d276c2-d1f9-4b0d-b676-8d33a54b07dd","resolution":{"observed_at":"2026-08-07T14:15:55.347789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T14:15:55.424547Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.424547Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:34ca096b7b113a937e6ee0561ba56a03d0210cd589c6ef723cf878e9471cce11","observation_id":"ba626b19-461e-4a04-8d57-da15f014d083","resolution":{"observed_at":"2026-08-07T14:15:55.424547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-07T14:15:55.510988Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.510988Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:91927b9e38d15b25ac93b40507bfffcf8de0deeaefb93d6aff8dbd9a0d5cf019","observation_id":"a56efe66-560a-4033-8703-cdd811a4327f","resolution":{"observed_at":"2026-08-07T14:15:55.510988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T14:15:55.598942Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.598942Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:9cbb761e9f238034d534cb83784e34801100678760f96e0f7eb9258aabe1bbbf","observation_id":"132089e7-bcf9-4ff1-ada2-857a733acffe","resolution":{"observed_at":"2026-08-07T14:15:55.598942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-07T14:15:55.630686Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.630686Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:fc8658b90ac73d7c6f09f509bcf8f59882508cf742664abec961d61118b63c23","observation_id":"6bc85ce0-590c-4bb0-9971-49c256c354fc","resolution":{"observed_at":"2026-08-07T14:15:55.630686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T14:15:55.684869Z","title":"Qwen-audio: Advancing universal audio understand- ing via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.684869Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:8f853d2bf18a6fc521f1ea3ad0549bb28ad8ce530c8c2499e6df8676af5e9391","observation_id":"b5c68240-e06e-4395-a491-797cb4e11261","resolution":{"observed_at":"2026-08-07T14:15:55.684869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-09T20:04:27.847882Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T14:15:55.743399Z","title":"Wavllm: Towards ro- bust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.743399Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:d54f7be678f35b7f7f732fcffda20e79997645b0a09de0c9e3b41d46d24d8f96","observation_id":"0f9d2bf0-68e8-41e4-8fa5-9059d48c1758","resolution":{"observed_at":"2026-08-07T14:15:55.743399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02897","last_updated":"2024-06-10T05:50:53Z","snapshot_observed_at":"2026-07-31T21:41:43.347268Z","submitted_at":"2024-06-05T03:36:11Z","title":"LiveSpeech: Low-Latency Zero-shot Text-to-Speech via Autoregressive Modeling of Audio Discrete Codes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02897","snapshot_observed_at":"2026-08-07T14:15:55.806875Z","title":"Livespeech: Low- latency zero-shot text-to-speech via autoregressive modeling of audio discrete codes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.806875Z"},"links":{"cited_paper":"/paper/2406.02897","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:33ec1814096bc8d6acae577320f62c3a1a948de1cc2aee1a8bb0d714494b9d52","observation_id":"943ecc01-d9c2-4724-a43d-1676c5147316","resolution":{"observed_at":"2026-08-07T14:15:55.806875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:58.994892Z","title":"Speech-t: Transducer for text to speech and beyond,","venue":null,"work_id":"b24ded36-b150-4796-9e43-71f9625494be","year":2021},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.885997Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:bc0a7f1142e59b40df9babe5f70b53e65fa3badd01b01e9d35f95a151f6beac9","observation_id":"f0f38e56-6acc-4499-aa22-b0ff256ed87f","resolution":{"observed_at":"2026-08-07T14:15:59.070271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:58.686727Z","title":"Transduce and speak: Neural transducer for text-to-speech with semantic to- ken prediction,","venue":null,"work_id":"20020706-4284-49d7-b859-7e51b6378f5d","year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.955500Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:76822f8754ece20e4de59087d098ea49bae19b72589cd953baa0b2c1a0374821","observation_id":"d76bc8fa-d7af-4976-923f-a96854527548","resolution":{"observed_at":"2026-08-07T14:15:58.838464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17310","last_updated":"2024-06-25T06:46:47Z","snapshot_observed_at":"2026-07-06T18:36:34.369503Z","submitted_at":"2024-06-25T06:46:47Z","title":"High Fidelity Text-to-Speech Via Discrete Tokens Using Token Transducer and Group Masked Language Model","version":1},"cited_work":{"arxiv_id":"2406.17310","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.17310","snapshot_observed_at":"2026-08-07T14:15:57.324517Z","title":"High Fidelity Text-to-Speech Via Discrete Tokens Using Token Transducer and Group Masked Language Model","venue":"eess.AS","work_id":"cd68a3ae-ee9e-4577-be4c-41b875107ae8","year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.035770Z"},"links":{"cited_paper":"/paper/2406.17310","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:c5fa46997e41ce3d2d4e0b18eaf324e622039c5fbcd7c4ae03ebd89cae5e3860","observation_id":"d8ca4da6-6379-4673-9cd4-4329b7ea5d42","resolution":{"observed_at":"2026-08-07T14:15:57.452738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06320","last_updated":"2025-01-10T19:50:32Z","snapshot_observed_at":"2026-08-04T05:22:43.756074Z","submitted_at":"2025-01-10T19:50:32Z","title":"TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer","version":1},"cited_work":{"arxiv_id":"2501.06320","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.06320","snapshot_observed_at":"2026-08-07T14:15:57.171500Z","title":"TTS-Transducer: End-to-End Speech Synthesis with Neural Transducer","venue":"eess.AS","work_id":"22b545b3-378e-4a98-a028-5a96699af0d9","year":2025},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.168758Z"},"links":{"cited_paper":"/paper/2501.06320","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:69f466e0504ef611494e4dc634fe5b9c8279ae0de02f99d3d527030b6932e349","observation_id":"a5d1a7e1-0a42-4b77-9bae-a43bb0475ee4","resolution":{"observed_at":"2026-08-07T14:15:57.238904Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-07T03:22:13.424379Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-07T14:15:56.248113Z","title":"Speechtok- enizer: Unified speech tokenizer for speech large language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.248113Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:9d208735eebefacf8ada87442187964b3d7ab1f981197b6e56c153121566db56","observation_id":"042c7359-715b-468c-98a5-c2a1e3645329","resolution":{"observed_at":"2026-08-07T14:15:56.248113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-07T19:28:41.853565Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-08-07T14:15:56.310389Z","title":"ELLA-V: Sta- ble neural codec language modeling with alignment-guided se- quence reordering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.310389Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:30280a2773ea61fac0aad9ec1db6d143e8ee9b01cc972e255ff4923718a5ba59","observation_id":"b835ee00-fb8d-4e72-8092-748c120d4af8","resolution":{"observed_at":"2026-08-07T14:15:56.310389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07855","last_updated":"2024-06-12T04:09:44Z","snapshot_observed_at":"2026-08-05T04:07:33.037081Z","submitted_at":"2024-06-12T04:09:44Z","title":"VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07855","snapshot_observed_at":"2026-08-07T14:15:56.366851Z","title":"V ALL-E R: Robust and efficient zero- shot text-to-speech synthesis via monotonic alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.366851Z"},"links":{"cited_paper":"/paper/2406.07855","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:196a0f3585872c9f9e010627b0ecd3d8b28c8ae3d614d3fe3907bcb57ac1c566","observation_id":"2ae8e0e9-d909-44bc-b465-2e2e7fd95af7","resolution":{"observed_at":"2026-08-07T14:15:56.366851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03204","last_updated":"2024-05-19T21:34:28Z","snapshot_observed_at":"2026-07-06T17:55:28.812944Z","submitted_at":"2024-04-04T05:15:07Z","title":"RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03204","snapshot_observed_at":"2026-08-07T14:15:56.438913Z","title":"RALL-E: Robust codec language modeling with chain-of-thought prompting for text-to- speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.438913Z"},"links":{"cited_paper":"/paper/2404.03204","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:c4582ae1a24ace5063f42e91259bcef0c30f7aa88328d41c529930bfb6e7e2b0","observation_id":"fb0d1b7d-887d-45c5-a7ff-2646d3a864b2","resolution":{"observed_at":"2026-08-07T14:15:56.438913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:58.454760Z","title":"CLaM-TTS: Improving neural codec language model for zero-shot text-to-speech,","venue":null,"work_id":"682770c1-bd95-4f8a-860a-dd6700044703","year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.518067Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:0d61a2074f33760fbe130a6ae785509114a182451d523e4d35999cc8bdca0b03","observation_id":"9181c0a4-cfee-4a30-b9b8-fe8424ceb737","resolution":{"observed_at":"2026-08-07T14:15:58.542504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-08T07:23:06.245954Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-07T14:15:56.602314Z","title":"V ALL-E 2: Neural codec language models are hu- man parity zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.602314Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:84bfa5b346059ac4c92705c363a8da49dff90c5eb3760c5fb41070cadddc6303","observation_id":"f6446f42-6a4d-4da2-8133-f9a06b7a46a7","resolution":{"observed_at":"2026-08-07T14:15:56.602314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:58.120659Z","title":"V oicebox: Text-guided multilingual universal speech gen- eration at scale,","venue":null,"work_id":"dfaff12c-da3e-4cb0-bad0-1b49f6cfcc0e","year":2023},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.695232Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:d4b6626b2ff344d97bf462ae56bbf82c1b7c4158545a68ba2cc53d355438db1e","observation_id":"01897a29-0ba8-4177-8598-5b7d749b6ec3","resolution":{"observed_at":"2026-08-07T14:15:58.207909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:57.935873Z","title":"Lib- rispeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"c953f27d-502e-4587-861b-864bb24477aa","year":2015},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.756041Z"},"links":{"citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:f845fcf9dbd8fca4be58ba4731c369413a296f4b624e6fd1100fe64ae29bcf2a","observation_id":"187165c8-e0e0-453a-9c32-094d0596e4c6","resolution":{"observed_at":"2026-08-07T14:15:58.035412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-07T14:15:56.797055Z","title":"LibriTTS: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.797055Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:35511ab2f7095b9db56e3b4ac1cd5042f831df1901cb91978bee48557c107844","observation_id":"4f863876-8cb1-4ca8-a1ed-7fe38cb5bdd7","resolution":{"observed_at":"2026-08-07T14:15:56.797055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00767","last_updated":"2024-10-01T15:04:21Z","snapshot_observed_at":"2026-08-08T20:44:37.961271Z","submitted_at":"2024-10-01T15:04:21Z","title":"Zero-Shot Text-to-Speech from Continuous Text Streams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00767","snapshot_observed_at":"2026-08-07T14:15:56.850541Z","title":"Zero- shot text-to-speech from continuous text streams,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:56.850541Z"},"links":{"cited_paper":"/paper/2410.00767","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:ed00b62191ce3c20d0f0bc81ace12bef753d274ab5f6a36f048fd443765d323b","observation_id":"041daa36-4dc0-4883-aa0a-bc187e0c0483","resolution":{"observed_at":"2026-08-07T14:15:56.850541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 3 inbound Pith citation observations for arXiv:2505.19669."}