Pith. sign in

Paper Citation Record · LEDGER

LatentSpeech: Latent Diffusion for Text-To-Speech Generation

As of 16 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2412.08117.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.08117 v1

Coverage vector

measured 21 of 21 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T18:16:12.952995Z

measured 21 of 21 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

21 of 21 outbound references displayed

  • verified exact0
  • verified fuzzy7
  • unresolved14
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 8f711594-054f-4465-b33b-08feedcfa46a · outbound

This paper cites Generative adversarial networks,.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation Generative adversarial networks,

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-11T18:16:12.887746Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:16:12.887746Z digest=sha256:26ecb1ce6b1f372d0587f17600445aac0df1b259adf221c2abf1bd13234eddce

Observation 9b3d9a24-927e-49c2-b31d-8966c22dab90 · outbound

This paper cites Auto-Encoding Variational Bayes.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation Auto-Encoding Variational Bayes

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-11T18:16:12.891891Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:16:12.891891Z digest=sha256:a2925e987ef4994dbab4eed10ef15656308f8e13c927800d9d4ab88fca0d00ab

Observation df2212d3-512f-44a9-b4eb-3266bc94de1c · outbound

This paper cites High-resolution image synthesis with latent diffu- sion models,.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation High-resolution image synthesis with latent diffu- sion models,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-11T18:16:12.894872Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:16:12.894872Z digest=sha256:edc27b1d7139c4fa02d087a81fd1c585baa990f50aadd4c296a5ba13cc14b6cb

Observation 720960e0-eec0-4241-93e2-80741af4382f · outbound

This paper cites Hierarchical Text-Conditional Image Generation with CLIP Latents.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation Hierarchical Text-Conditional Image Generation with CLIP Latents

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-11T18:16:12.897783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:16:12.897783Z digest=sha256:0c452e134cbd7c8585946709f85461932bd91bedfffc585b6acdcbb649a9fbba

Observation 7793e79e-f2e5-444f-86c5-1434dd298a43 · outbound

This paper cites Imagen Video: High Definition Video Generation with Diffusion Models.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation Imagen Video: High Definition Video Generation with Diffusion Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T18:16:12.901379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:16:12.901379Z digest=sha256:6c1ebe99c2dcebe373b5190f51da2c1f5c0c9c80cb732febe92ae65a9f8fea25

Observation 5a410033-4c77-4bd8-9410-ed42a2f2ea06 · outbound

This paper cites Tacotron: Towards End-to-End Speech Synthesis.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation Tacotron: Towards End-to-End Speech Synthesis

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T18:16:12.905818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:16:12.905818Z digest=sha256:77042df9c914a9d039dc196ce71be5b6261b6840f6ecde9bf665ee5cad2bfa44

Observation 6fb9159b-4922-41f7-9d6b-bf0387be0815 · outbound

This paper cites Fastspeech: Fast, robust and controllable text to speech,.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation Fastspeech: Fast, robust and controllable text to speech,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:16:13.099427Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-11T18:16:12.909401Z digest=sha256:43b68bba6ae7e769194b7794b069eaffafd238ef294f2da934e3d2e6623fc344

Observation ba92aff8-39ac-46cf-b0ce-2aa378d59444 · outbound

This paper cites Stylespeech: Parameter-efficient fine tuning for pre-trained controllable text-to- speech,.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation Stylespeech: Parameter-efficient fine tuning for pre-trained controllable text-to- speech,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:16:13.091228Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-11T18:16:12.912772Z digest=sha256:3fe1fdbaa4e287922d2f6e63c1cfd7e0956f982eac8112306191c26f8fd00a72

Observation 1aa292d8-1074-403e-871c-d66fb6638db9 · outbound

This paper cites A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation A Survey on Audio Diffusion Models: Text To Speech Synthesis and Enhancement in Generative AI

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T18:16:12.915500Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:16:12.915500Z digest=sha256:7c184a357f4dbf2bbb9272cfe11d7c568678eb538a3d7681fe3e933ac2b5b3e6

Observation 2dca5006-86dc-4fda-ad66-2cd78ebf63e9 · outbound

This paper cites Diffvoice: Text-to-speech with latent diffusion,.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation Diffvoice: Text-to-speech with latent diffusion,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:16:13.082528Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-11T18:16:12.918495Z digest=sha256:a98bdf1f7dca7c4b7c76d9e17d5c90c6fdd2798bcf4c7ed9f190e29bef474428

Observation 46ba7a1e-1aaf-4d62-9f4f-a52768b8babd · outbound

This paper cites FastSpeech 2: Fast and High-Quality End-to-End Text to Speech.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation FastSpeech 2: Fast and High-Quality End-to-End Text to Speech

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T18:16:12.922242Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:16:12.922242Z digest=sha256:e3ca9a73387d53b1680cb75fc2b573df57797994d22c760b068d5a351d05a491

Observation a5167604-be12-4ec3-8600-53b7c9ad8409 · outbound

This paper cites RAVE: A variational autoencoder for fast and high-quality neural audio synthesis.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation RAVE: A variational autoencoder for fast and high-quality neural audio synthesis

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-11T18:16:12.925172Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:16:12.925172Z digest=sha256:43201e05979c35a2804333525acc698d4f521a230970f04f1fd8684b027630a6

Observation 4452742f-99ad-484f-93d4-bd6b6a6209bc · outbound

This paper cites Near-perfect-reconstruction pseudo-qmf banks,.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation Near-perfect-reconstruction pseudo-qmf banks,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:16:13.074367Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-11T18:16:12.928155Z digest=sha256:431aa3cd6e8bba9e966ab4a86aa45902f579dd7f7d7758e8376a0f998b5652f4

Observation 9a2ae4ed-71a9-434c-be2c-6c8cfe5022d9 · outbound

This paper cites DDSP: Differentiable Digital Signal Processing.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation DDSP: Differentiable Digital Signal Processing

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T18:16:12.931744Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:16:12.931744Z digest=sha256:2f7fe61a02ca44177df52426f474424f422b1c4f9db893175d3a7f9b20a7c5b0

Observation 5ac8cbd3-03e8-4a65-a23e-ce9710f0a6ec · outbound

This paper cites Attention is all you need,.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation Attention is all you need,

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T18:16:12.934513Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:16:12.934513Z digest=sha256:6c7b3528b5fc94672b4330bdf37ebe5f99b63551cf87c6be35427b186cbe382c

Observation 8ee89e17-3e0b-44b8-9b61-b8b59403121a · outbound

This paper cites DiffWave: A Versatile Diffusion Model for Audio Synthesis.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation DiffWave: A Versatile Diffusion Model for Audio Synthesis

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T18:16:12.937149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:16:12.937149Z digest=sha256:4b513c9840eed10a474ca8ce429d43cbbea1b58665ab4795b1cf8c7f5b0591c0

Observation 91d0d1b1-92b8-4264-a173-22593ea28d62 · outbound

This paper cites Denoising diffusion prob- abilistic models,.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation Denoising diffusion prob- abilistic models,

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T18:16:12.940666Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:16:12.940666Z digest=sha256:69e1f23786e28be4e7a3b1f9fafba7a5510372a04c74bbdb8522229f3acc3519

Observation ef073fe5-4583-4c29-bfb8-01d8622775aa · outbound

This paper cites Chinese mandarin female corpus,.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation Chinese mandarin female corpus,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:16:13.057057Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-11T18:16:12.944179Z digest=sha256:51d21a26e341bffed02050b1975989eb08d5e069ea16d2119f95ea26e483fdaa

Observation 00b0e12f-de65-47b2-a4c6-5fc694175c6d · outbound

This paper cites Mel-cepstral distance measure for objective speech quality assessment,.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation Mel-cepstral distance measure for objective speech quality assessment,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:16:13.049135Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-11T18:16:12.946901Z digest=sha256:6e45b64bf7244671b44217f1c3a690dec648ec2966705997b65505be5f3a916b

Observation e9f7d144-ad7a-433b-baf2-703df0e7e363 · outbound

This paper cites Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T18:16:13.040205Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-11T18:16:12.949545Z digest=sha256:3fc122d687898936e841d6a51cb7965990d0d17eb1d75e5881c2c096b928dcff

Observation 86cd6324-93e4-4bac-adf1-32dd78709c14 · outbound

This paper cites Robust speech recognition via large- scale weak supervision,.

LatentSpeech: Latent Diffusion for Text-To-Speech Generation Robust speech recognition via large- scale weak supervision,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-11T18:16:12.952995Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T18:16:12.952995Z digest=sha256:ecd91aa4ba1b9fdd8f1b3b2b775a42da46c5ab481a249920c256fa908ea3c033

Pith citing papers

No inbound Pith citation observations are available.