Pith. sign in

Paper Citation Record · LEDGER

Next Tokens Denoising for Speech Synthesis

As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2507.22746.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.22746 v2

Coverage vector

measured 36 of 36 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T11:22:27.950994Z

measured 36 of 36 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

36 of 36 outbound references displayed

  • verified exact5
  • verified fuzzy1
  • unresolved30
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 6229081c-1426-49c8-90a8-da36704ba759 · outbound

This paper cites Better speech synthesis through scaling.

Next Tokens Denoising for Speech Synthesis Better speech synthesis through scaling

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:25.341706Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:25.341706Z digest=sha256:d2d08c2f0d2e9c4651a79d3422515729c88fd523cbe136a44963792802642fe5

Observation 3b306d4d-dbb8-43b9-b58d-7acdf6d27af1 · outbound

This paper cites High Fidelity Neural Audio Compression.

Next Tokens Denoising for Speech Synthesis High Fidelity Neural Audio Compression

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:25.630747Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:25.630747Z digest=sha256:7bb5089712037c0ff0c3b6edc603d940d804fcd4d0f81dd55b49b5208fbf086b

Observation 4c112359-d552-43bb-9d01-693ec47a680d · outbound

This paper cites Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback.

Next Tokens Denoising for Speech Synthesis Improving Dynamic Object Interactions in Text-to-Video Generation with AI Feedback

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:25.922271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:25.922271Z digest=sha256:1c954c9c041f2f9d9a43377238a4e7ded6cb282129b03a3c7df7d932d8a45ad2

Observation 3265b4f7-b4a9-463f-9301-ac12a400f9da · outbound

This paper cites Mean Flows for One-step Generative Modeling.

Next Tokens Denoising for Speech Synthesis Mean Flows for One-step Generative Modeling

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:25.951018Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:25.951018Z digest=sha256:c02bb56c600712aaf4f97d6ca9bde546526ecd1222e804f6fdb9ffab7fc4f480

Observation ce0731a6-61e7-4eb0-bc97-2580a1e39188 · outbound

This paper cites Ditar: Diffusion transformer autoregressive modeling for speech generation.

Next Tokens Denoising for Speech Synthesis Ditar: Diffusion transformer autoregressive modeling for speech generation

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:26.029534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:26.029534Z digest=sha256:bf17908f726f566f36b59a38c8ba692fe296691d74109dbaf4b958b433e349b7

Observation 42b581fd-1e21-41bf-b2d1-564f140f6444 · outbound

This paper cites NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models.

Next Tokens Denoising for Speech Synthesis NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:26.095836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:26.095836Z digest=sha256:1d1efc30f4d936089d0cdb12ee12b400c23c8e2294f8db0769238629f0e4916f

Observation a5fa5a1c-84dd-47af-8e12-f28339bbaec8 · outbound

This paper cites Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like.

Next Tokens Denoising for Speech Synthesis Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:26.208323Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:26.208323Z digest=sha256:a74689f2c4aec38e488a1ad4a5505679f8ff696f00054ab524805cef2659090a

Observation aa2df25a-9a0d-4912-8631-37d282ff4376 · outbound

This paper cites istftnet: Fast and lightweight mel-spectrogram vocoder incorporating inverse short-time fourier transform.

Next Tokens Denoising for Speech Synthesis istftnet: Fast and lightweight mel-spectrogram vocoder incorporating inverse short-time fourier transform

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T11:22:29.105049Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T11:22:26.324190Z digest=sha256:3135c79983908f4d6dbabbc13c8e345c12e2fbbb3ce110ab5cdc1779fd5cc172

Observation 16933749-f487-4e28-8067-c097a54726a6 · outbound

This paper cites Understanding DDPM Latent Codes Through Optimal Transport.

Next Tokens Denoising for Speech Synthesis Understanding DDPM Latent Codes Through Optimal Transport

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:26.402690Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:26.402690Z digest=sha256:6264e6341fd868dcebe8fe8ef12ebadc57b92180b0dd3ce66ee819210d5522d6

Observation 3763f71c-b841-4b96-8274-d7fe01dee4d1 · outbound

This paper cites PromptTTS 2: Describing and Generating Voices with Text Prompt.

Next Tokens Denoising for Speech Synthesis PromptTTS 2: Describing and Generating Voices with Text Prompt

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:26.482050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:26.482050Z digest=sha256:d7de0dce6cde32bcabdf6dc6d585d7ffcb56a4110487502ccc6cfb0c2671b6a8

Observation 2d8b244c-560b-408d-a460-e5e525c30581 · outbound

This paper cites Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation.

Next Tokens Denoising for Speech Synthesis Investigating Neural Audio Codecs for Speech Language Model-Based Speech Generation

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-08-06T11:22:28.855073Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T11:22:26.545205Z digest=sha256:196acb5a23c425365e3e1b52a3da282fc6ba0d047c41184e4647c3698c7b9980

Observation 1877fbd7-3822-4a5d-95c0-d4b452f46c9f · outbound

This paper cites Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow.

Next Tokens Denoising for Speech Synthesis Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:26.665411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:26.665411Z digest=sha256:bd0de632ea0d178acce11e773842ae87cbc7294a424d77e13736e287abeea0a9

Observation 5c6132fe-1c44-4db0-a7a9-dc422b4ccf88 · outbound

This paper cites DelightfulTTS 2: End-to-End Speech Synthesis with Adversarial Vector-Quantized Auto-Encoders.

Next Tokens Denoising for Speech Synthesis DelightfulTTS 2: End-to-End Speech Synthesis with Adversarial Vector-Quantized Auto-Encoders

Reference 20

Resolution
verified exact
local_arxiv, observed 2026-08-06T11:22:28.570689Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T11:22:26.737905Z digest=sha256:5c808beca0d22a00618a4ffb88288695509c978af6be607def99fb7c46404715

Observation d3549354-974d-4d53-b100-5142f17f4f53 · outbound

This paper cites Autoregressive Speech Synthesis without Vector Quantization.

Next Tokens Denoising for Speech Synthesis Autoregressive Speech Synthesis without Vector Quantization

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:26.796662Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:26.796662Z digest=sha256:af93b3951d96d54f306672f2ba2c58925b150d6a3e5562cb8ad9772dc6b917b2

Observation d4b868e7-0546-4ed3-be84-a08794a3fc41 · outbound

This paper cites Finite Scalar Quantization: VQ-VAE Made Simple.

Next Tokens Denoising for Speech Synthesis Finite Scalar Quantization: VQ-VAE Made Simple

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:26.883167Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:26.883167Z digest=sha256:2a8db871ec81cc1462dce97095ca731c81ea1762e233fc0a27e3e5ccab7dd774

Observation f01925d6-4100-4867-b4ef-5eb009bfc73c · outbound

This paper cites Scaling Transformers for Low-Bitrate High-Quality Speech Coding.

Next Tokens Denoising for Speech Synthesis Scaling Transformers for Low-Bitrate High-Quality Speech Coding

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:26.987973Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:26.987973Z digest=sha256:b28e7bb0313d4ceac96230f00dab07696f183f2067e719dacaddb9ac067160c3

Observation d123e31a-3705-44d4-864b-225d16ba3970 · outbound

This paper cites Mo\^usai: Text-to-Music Generation with Long-Context Latent Diffusion.

Next Tokens Denoising for Speech Synthesis Mo\^usai: Text-to-Music Generation with Long-Context Latent Diffusion

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:27.053403Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:27.053403Z digest=sha256:a3d2487f76915df952a15cb420de47093ad2ac2b742e43481996e01663de7385

Observation faba2588-9e08-487e-b264-81415b3455e9 · outbound

This paper cites NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers.

Next Tokens Denoising for Speech Synthesis NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:27.121148Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:27.121148Z digest=sha256:1426a2893eae456d446c196660610bcafc63076f37ab2e36c295f2f187dd2853

Observation 4706dce0-0b29-472a-80c5-38080d13a8c1 · outbound

This paper cites Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling.

Next Tokens Denoising for Speech Synthesis Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling

Reference 26

Resolution
verified exact
local_arxiv, observed 2026-08-06T11:22:28.411634Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T11:22:27.182862Z digest=sha256:228425fbae863d2155b9d1fa35f973822bf8ccf5b1cdb34ceca3be0203843dcb

Observation d503ec9f-d481-4f10-aab6-d5a8b36a0787 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

Next Tokens Denoising for Speech Synthesis Gemini: A Family of Highly Capable Multimodal Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:27.280963Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:27.280963Z digest=sha256:cd3bc4a89d68e62f32996885027111ca1a83157225d185ae6e01fdad453542cc

Observation 7001ad77-5a82-47ef-a1b7-01fb19ad16d9 · outbound

This paper cites Improving and generalizing flow-based generative models with minibatch optimal transport.

Next Tokens Denoising for Speech Synthesis Improving and generalizing flow-based generative models with minibatch optimal transport

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:27.357575Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:27.357575Z digest=sha256:1f4f7c9628e00048661196c90dac26c92ca8172f248f7eeb5c4944efb17f7633

Observation efbba303-682e-4bdb-9678-fe4e6a456f05 · outbound

This paper cites FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching.

Next Tokens Denoising for Speech Synthesis FELLE: Autoregressive Speech Synthesis with Token-Wise Coarse-to-Fine Flow Matching

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:27.493156Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:27.493156Z digest=sha256:60a7cc893788c99b5a7645756041094e99d6ca9de521540155b88d1e93255f41

Observation b2a6f30a-9185-4d39-bc60-d608c1c65b1c · outbound

This paper cites Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis.

Next Tokens Denoising for Speech Synthesis Pseudo-Autoregressive Neural Codec Language Models for Efficient Zero-Shot Text-to-Speech Synthesis

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:27.528989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:27.528989Z digest=sha256:427eef657f2bd9863ecf1bf33de193496bb58326eb287a8fd65b0969b07a1946

Observation f3d6bb98-fc36-488c-8faf-0489bb1a1767 · outbound

This paper cites Lumos-1: On autoregressive video generation from a unified model perspective.

Next Tokens Denoising for Speech Synthesis Lumos-1: On autoregressive video generation from a unified model perspective

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:27.625768Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:27.625768Z digest=sha256:78d7619ee2580ba771673a15fc3ff996076206ffaaf81d9e748ad3c87eaf6501

Observation 57703305-fd3c-4bd1-8837-dd90a5334c5e · outbound

This paper cites Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners.

Next Tokens Denoising for Speech Synthesis Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:27.693175Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:27.693175Z digest=sha256:c0750c8ade6889313ee9c0fd64b57b73112fb575a94ee05880ec3aaf91df1d9b

Observation 12782ae2-731c-4d75-bc15-cfd92c294d8f · outbound

This paper cites Boosting Diffusion Model for Spectrogram Up-sampling in Text-to-speech: An Empirical Study.

Next Tokens Denoising for Speech Synthesis Boosting Diffusion Model for Spectrogram Up-sampling in Text-to-speech: An Empirical Study

Reference 34

Resolution
verified exact
local_arxiv, observed 2026-08-06T11:22:28.145958Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T11:22:27.789945Z digest=sha256:70d993444b5589b5c0aacac85a7bcd397f51b14e67531e5fa9e5471c4436e380

Observation 53ce42bb-f56c-4f05-b7e7-2ad9bf1494fd · outbound

This paper cites Mixed-Phoneme BERT: Improving BERT with Mixed Phoneme and Sup-Phoneme Representations for Text to Speech.

Next Tokens Denoising for Speech Synthesis Mixed-Phoneme BERT: Improving BERT with Mixed Phoneme and Sup-Phoneme Representations for Text to Speech

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:27.883606Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:27.883606Z digest=sha256:93c8bf16734510eecfbd689ec42f1f9b18b23438b9a9313f93d9050a19c7f57b

Observation d4517a79-8173-4f65-8551-ffcd886f9f98 · outbound

This paper cites Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling.

Next Tokens Denoising for Speech Synthesis Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:27.950994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:27.950994Z digest=sha256:ee953d5afb602ebf165073b9e68cfd63f5837dcb93c1a946a6dbfdf74eaaceee

Observation 2e844282-1ca3-4230-b734-949e062f358f · outbound

This paper cites Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers.

Next Tokens Denoising for Speech Synthesis Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:27.428195Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:27.428195Z digest=sha256:2592aa80068a9dea41ecc7a3d3b93e647de7e37a0804f1a7231d8ff02dd5e0b8

Observation ebfe630b-423b-4645-a172-64b64bff40ab · outbound

This paper cites MoBoAligner: a Neural Alignment Model for Non-autoregressive TTS with Monotonic Boundary Search.

Next Tokens Denoising for Speech Synthesis MoBoAligner: a Neural Alignment Model for Non-autoregressive TTS with Monotonic Boundary Search

Reference 2019

Resolution
verified exact
local_arxiv, observed 2026-08-06T11:22:28.701598Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-06T11:22:26.621996Z digest=sha256:911c1d422c9a6b3bcbdf1150fbd3cfd83197829ae367745f607687c756be7d73

Observation d8d21cbe-36a0-4a83-ae5c-37f0360f7ef3 · outbound

This paper cites AdaSpeech: Adaptive Text to Speech for Custom Voice.

Next Tokens Denoising for Speech Synthesis AdaSpeech: Adaptive Text to Speech for Custom Voice

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:25.496315Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:25.496315Z digest=sha256:d61e9ca3cc3ce3bd545f2eda1b11fee7a17e73c25d77bc2c7772834b1246ffa5

Observation 0c650765-46aa-4e7f-868f-ebc596c3d331 · outbound

This paper cites VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers.

Next Tokens Denoising for Speech Synthesis VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:25.548417Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:25.548417Z digest=sha256:eb2e88268516ebf83eb0908963fa483312d67e24f0a13a78b0d0ad7b095368cc

Observation 572e330a-4104-4d2b-b35e-f211c1787355 · outbound

This paper cites E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS.

Next Tokens Denoising for Speech Synthesis E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:25.706245Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:25.706245Z digest=sha256:61b3a5d308182e080fa0d6372465e5539d25697d9e004df970bc29e869931365

Observation 9e9ba83c-6772-4838-9f60-dc93aea1ba61 · outbound

This paper cites Language models are few-shot learners.

Next Tokens Denoising for Speech Synthesis Language models are few-shot learners

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:25.418317Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:25.418317Z digest=sha256:7fb1f5ae28e93e42e30c5db423fa3456e8cf6e24e7ca56668924503545be70ca

Observation 68f10129-0acc-4fc5-a3d2-d6a4e1b0060c · outbound

This paper cites One Step Diffusion via Shortcut Models.

Next Tokens Denoising for Speech Synthesis One Step Diffusion via Shortcut Models

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:25.814243Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:25.814243Z digest=sha256:18c9008be09c3f037e64abc031560b957ef9aa69b33cb8bdf8fe46e354ae8b0f

Observation 0b58e0cd-015b-4b9c-a206-ecd55188d95f · outbound

This paper cites VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment.

Next Tokens Denoising for Speech Synthesis VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-06T11:22:25.974745Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T11:22:25.974745Z digest=sha256:7ffc3a11e6b8367e432cd90eebe7ed21fe0ebf0cf4c9f6b23a5b140c977e1938

Pith citing papers

No inbound Pith citation observations are available.