Pith. sign in

Paper Citation Record · LEDGER

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis

As of 18 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 1 inbound Pith citation observation for arXiv:2412.19259.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.19259 v1

Coverage vector

measured 47 of 47 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T00:50:14.477869Z

measured 48 of 48 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T04:45:18.672137Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-07T04:45:19.541066Z

Reference resolution

47 of 47 outbound references displayed

  • verified exact0
  • verified fuzzy39
  • unresolved8
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 6b32beb8-aab1-4eac-bc9f-74fb71444762 · outbound

This paper cites Diffsound: Discrete diffusion model for text-to-sound generation,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Diffsound: Discrete diffusion model for text-to-sound generation,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:15.124916Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.285199Z digest=sha256:181938eec7587e77e967e36e114d301d385f322459b42b9e6231a8d4343e055d

Observation 094f55ab-107d-41e0-9c48-8717f5112feb · outbound

This paper cites Audiogen: T extually guided audio generation,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Audiogen: T extually guided audio generation,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:15.112100Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.290054Z digest=sha256:1d3a72702006945c869434a93b3611c06c65dc0cf10377c5cf9d7a6c58435105

Observation 3ad2f980-d9d0-4127-a929-4660690f676a · outbound

This paper cites Make-an-audio: Text-to-audio generation with prompt-enhanced diffusion models,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Make-an-audio: Text-to-audio generation with prompt-enhanced diffusion models,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:15.099260Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.294326Z digest=sha256:a904f90695fcf2303027e67febc3e3e8650b6c9026e29263d33217295574cbfc

Observation a5f91e7a-310c-4ed2-8aee-62127335f342 · outbound

This paper cites Text-to-audio generation using instruction-tuned llm and latent diffusion model,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Text-to-audio generation using instruction-tuned llm and latent diffusion model,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:15.085800Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.298857Z digest=sha256:ce484c97d5ad9604284b263a1a24d8fdfd5f80cca3d452cba751cb5be361b60e

Observation f7fb3555-bf53-43f4-914c-512933627bd9 · outbound

This paper cites Fast timing-conditioned latent audio diffusion,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Fast timing-conditioned latent audio diffusion,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:15.072634Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.303120Z digest=sha256:ef733ac925bf00ce200ef32ec60ca081e573b47c522a05669b170617d0156ab6

Observation 5826aceb-20be-4475-9594-38094d696869 · outbound

This paper cites Audiolcm: T ext-to-audio generation with latent consistency models,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Audiolcm: T ext-to-audio generation with latent consistency models,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:15.059342Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.307957Z digest=sha256:0f082b9e4baefa10824760be9173c945329f3c41bd68fff91fad69086eb3883e

Observation 96161442-fdb3-4d2c-a669-0a7587eedd84 · outbound

This paper cites Auffusion: Leveraging the power of diffusion and large language models for text-to-audio generation,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Auffusion: Leveraging the power of diffusion and large language models for text-to-audio generation,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:15.046238Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.312383Z digest=sha256:06818e801c6f58a690ef061abac4f06fa8f59cc08742020f3a859f5d815ea4c9

Observation 866bf51f-7348-4d09-b6a3-f98108cbacce · outbound

This paper cites Grad-tts: A diffusion probabilistic model for text-to-speech,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Grad-tts: A diffusion probabilistic model for text-to-speech,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:15.033376Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.316352Z digest=sha256:cf03873ef3c9867f9596c2377ceb5d2ac2e125b2fe033a0cc3b35e465f9b4ef5

Observation b83ad586-66bd-442f-aa2f-57da8d966bdf · outbound

This paper cites Glow-tts: A generative flow for text-to-speech via monotonic alignment search,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Glow-tts: A generative flow for text-to-speech via monotonic alignment search,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:15.020033Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.320357Z digest=sha256:cacb7545a6b80059c1cc9b66ab59aadaff9bf2a1ccc20be4e0a2b1a395745d81

Observation 3570f116-6a1e-4efe-91f6-b6190acf802a · outbound

This paper cites Guided-tts: A diffusion model for text-to-speech via classifier guidance,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Guided-tts: A diffusion model for text-to-speech via classifier guidance,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:15.007031Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.324155Z digest=sha256:705e35cd29510738d1d17678142faf7b34937587dffc3d8df3e0e2ba3fb25d6d

Observation a07c7764-289b-4eb4-8d11-7ed93878560e · outbound

This paper cites Prosody- tts: Improving prosody with masked autoencoder and conditional diffusion model for expressive text-to-speech,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Prosody- tts: Improving prosody with masked autoencoder and conditional diffusion model for expressive text-to-speech,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.993879Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.328390Z digest=sha256:112bd040c56990fa0c9a695dca1312e9e0408940d2bc12b4fca104f24ee6edbb

Observation 05595412-d585-489b-a585-a3e52d1ffac4 · outbound

This paper cites Crossspeech: Speaker-independent acoustic representation for cross-lingual speech synthesis,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Crossspeech: Speaker-independent acoustic representation for cross-lingual speech synthesis,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.980344Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.332526Z digest=sha256:5bf10080955beaf525c527ae7d629b4fdaacb9903df4c42fecf714f139af2c9c

Observation 8d2cf736-2145-48f0-8635-ceb07a5fbd8a · outbound

This paper cites Fregrad: Lightweight and fast frequency-aware diffusion vocoder,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Fregrad: Lightweight and fast frequency-aware diffusion vocoder,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.967136Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.337405Z digest=sha256:c04b7a2693e2458b70848d7c141795a16f7fd8d91940ffef074f3772f93f7607

Observation 5a9ab71d-c656-4bb3-a954-3049b1c08c85 · outbound

This paper cites Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.953843Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.342219Z digest=sha256:cb52cb9c45bbb1dff532cff8188f08ff53516d94d90199c3038b4bcaf342d6a1

Observation 8b8859f6-5518-4147-b656-d74c0e71beab · outbound

This paper cites DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T00:50:14.346101Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:50:14.346101Z digest=sha256:0034482439f4958f75c2062cb9a29c831a84c32c078cc2add3c7dbcd27b25ddf

Observation 054bde7a-7c6c-4ef6-be1c-69dc370506ee · outbound

This paper cites High-resolution image synthesis with latent diffusion models,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis High-resolution image synthesis with latent diffusion models,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.940192Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.350510Z digest=sha256:19b21800699c5f1a337939132281fb9211fa4fe0f78675d2c22480804126cac9

Observation 5b16b0d9-ce4a-441c-aec6-5333b0a9a7fd · outbound

This paper cites Score-based generative modeling through stochastic differential equations,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Score-based generative modeling through stochastic differential equations,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.927210Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.354537Z digest=sha256:8424ef6c93425e54a30d2f75d6b942764b463b252b89023541a5675449231bc0

Observation 2f27dd73-d8ea-47e4-888a-189716c5e863 · outbound

This paper cites Denoising diffusion probabilistic models,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Denoising diffusion probabilistic models,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.912435Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.358663Z digest=sha256:27f21b4c8d457eb92f1074b4818dec09042332950d4db0a554db2c9d2e136883

Observation 0dde5b27-b2bd-42bf-af60-0cb16a1b94d0 · outbound

This paper cites Audioldm: Text-to-audio generation with latent diffusion models,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Audioldm: Text-to-audio generation with latent diffusion models,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.898991Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.362662Z digest=sha256:c65b8e04b3b3da1260a4f5cab303123b90e5a33d60162cfd5d469d1d189aac89

Observation 97ac5869-fa74-40a9-90c8-df348e62accd · outbound

This paper cites V oiceldm: T ext-to-speech with environmental context,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis V oiceldm: T ext-to-speech with environmental context,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.886192Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.366658Z digest=sha256:1d3851e951624401b1456a68023fb1431f083a37fb7c09301d72c95470202999

Observation 61f37537-7038-4ae3-bf5a-78615cee647e · outbound

This paper cites Audiobox: Unified Audio Generation with Natural Language Prompts.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Audiobox: Unified Audio Generation with Natural Language Prompts

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-11T00:50:14.370607Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:50:14.370607Z digest=sha256:656750c1845b452ec4879efd2b89d237f8ab22c03d7d27d31aa05eb92266b390

Observation df5d3f5d-cf88-4c99-ba04-0127df0485c3 · outbound

This paper cites Audi- oldm 2: Learning holistic audio generation with self-supervised pretraining,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Audi- oldm 2: Learning holistic audio generation with self-supervised pretraining,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.872832Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.374929Z digest=sha256:1df9a0a5418c0de5057229736fb20b280eafad6265d15931111f65e05d670e1b

Observation a18ce097-5470-44c5-ae28-1137c2850153 · outbound

This paper cites UniAudio: An Audio Foundation Model Toward Universal Audio Generation.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis UniAudio: An Audio Foundation Model Toward Universal Audio Generation

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-11T00:50:14.378957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:50:14.378957Z digest=sha256:ab210ea204dc1c42dc0407435ee90914c719bcc1f06502bab7fe463682a6ec1f

Observation 59acc64c-a9fd-4fcb-8d5f-e372abf275de · outbound

This paper cites Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.860530Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.383444Z digest=sha256:9029337d03aca3e12306bd1e65f2fba225448bc6444fdc1f7214cdcebffe9777

Observation 417bc99a-a84f-4c07-9d38-b7b5b5545f87 · outbound

This paper cites Libritts: A corpus derived from librispeech for text-to-speech,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Libritts: A corpus derived from librispeech for text-to-speech,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.847581Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.387534Z digest=sha256:a1061f8ee03e33ea26d8e79d2927bf67870776e397f123c92d7c7dfc7faca1da

Observation eb003fc7-c6f4-4ad0-8706-355b6141c441 · outbound

This paper cites Common Voice: A Massively-Multilingual Speech Corpus.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Common Voice: A Massively-Multilingual Speech Corpus

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-11T00:50:14.391612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:50:14.391612Z digest=sha256:4be354b95ebe30d259cd45aa2c1298c52da2c0595bcb724cb4ad97e0e01391bf

Observation f48a203c-1e89-48c3-af62-8f8be0893b2e · outbound

This paper cites VoxCeleb: a large-scale speaker identification dataset.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis VoxCeleb: a large-scale speaker identification dataset

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-11T00:50:14.395957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:50:14.395957Z digest=sha256:da03255fc63a72f2883951c57a141f54318471c5d811d384572168f8e6bf11fe

Observation 1291cacf-1c3f-403c-b3b0-680ff8d89c55 · outbound

This paper cites V oxceleb2: Deep speaker recognition,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis V oxceleb2: Deep speaker recognition,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.834321Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.400648Z digest=sha256:f144e8d2aa85771e48f9b05f51bdbb978ff1d5499f3099d4018fb0e0a44759d8

Observation 073bab1a-186b-4873-9d8f-be69211a50e8 · outbound

This paper cites V oxmm: Rich transcription of conversations in the wild,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis V oxmm: Rich transcription of conversations in the wild,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.820678Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.404600Z digest=sha256:80ea3e854895cb8879ef0da32163bdb5f74f6119f53f0e9dc4f3ed91651432dd

Observation 13e62add-ba5f-4567-b03b-edbb80afbbda · outbound

This paper cites W avcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis W avcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.807779Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.408344Z digest=sha256:7a177e691885b34232937deb47a51f11d7ee58267148ec645a89141c53fd37bb

Observation e317840c-6275-4d3c-a7b4-45af724f4a20 · outbound

This paper cites Libritts-r: A restored multi-speaker text-to-speech corpus,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Libritts-r: A restored multi-speaker text-to-speech corpus,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.794012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.412656Z digest=sha256:99c6c25da662ec8e129cd66e1746eb0feebdb752b189424029ec50c4777a4896

Observation 5a5c5051-1778-4204-baf2-c1a8100db60b · outbound

This paper cites Metric learning for user-defined keyword spotting,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Metric learning for user-defined keyword spotting,

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.781400Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.416531Z digest=sha256:2850e79d8f15ac73ea9fbdeeb7e220d5b81bcca008760140e8e5568af4bbeda6

Observation ea8cbf64-ed8d-4d1b-99b0-a6c1311caa85 · outbound

This paper cites Robust speech recognition via large-scale weak supervision,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Robust speech recognition via large-scale weak supervision,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.768232Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.420471Z digest=sha256:74a9947313abdb3e2e6907c937a8d36aa33d40eed1c116a54cb6911b164a70e2

Observation da3a4373-5002-4315-b025-6d3554c11bd4 · outbound

This paper cites Scalable diffusion models with transformers,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Scalable diffusion models with transformers,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.755313Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.424659Z digest=sha256:45aa0c99fb4cfdff1115257d92ba32afcef161c40278d8e0879bb8ca828d284e

Observation b67da38a-ce2c-4d72-b657-6310103773a3 · outbound

This paper cites PixArt-$\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis PixArt-$\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-11T00:50:14.428844Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:50:14.428844Z digest=sha256:77b4cfd5595e3c1abb235d49298e20e3ff3ae0673a2094696aa01f8ab73abe3b

Observation 01d1a473-d10b-49d5-829f-0ee88de9051c · outbound

This paper cites Longformer: The Long-Document Transformer.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Longformer: The Long-Document Transformer

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-11T00:50:14.433279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:50:14.433279Z digest=sha256:bb71e40529e8d05accb66e625fcf8632d2448ade2a15cc08d32c1edf4190574f

Observation 27796288-61a8-4e45-9c4b-e705bfd00286 · outbound

This paper cites Attention is all you need,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Attention is all you need,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.741388Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.437550Z digest=sha256:232593186fe08d0196b6250b7ca8e62b0b7ab974ed1245820488c698cb937f08

Observation 7f9b4b55-19c7-44e7-bb70-2f55a367775e · outbound

This paper cites Film: Visual reasoning with a general conditioning layer,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Film: Visual reasoning with a general conditioning layer,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.727942Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.441705Z digest=sha256:9bd6121d2e4d830cb21efbc4ecaee04513ad42ed2b2e9537c3759cd21db0fda4

Observation 88288ab1-4d2f-4530-916b-5ed8639edebf · outbound

This paper cites V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foundation models,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foundation models,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.714049Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.445594Z digest=sha256:469ee56e104ab75b36ec09a8fd2a1d443cae47a6120b8a2f00f1876d25117a3d

Observation 1c70662f-3fda-493c-9a53-3376fb623a9c · outbound

This paper cites Learning transferable visual models from natural language supervision,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Learning transferable visual models from natural language supervision,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.700597Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.449576Z digest=sha256:46b8148b97ac78b1f5f5c49c024a4c7196080479e62eb7fd25d1fb130377fc5b

Observation 8e850ab3-abff-44bd-b0cb-c6e4e8a0759c · outbound

This paper cites Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.687058Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.453543Z digest=sha256:4dba2d426e8cdec93e26678d4f73e9fb7be86cd1ee0f14c3688d2808f203f958

Observation 325ff93c-b15e-402e-ae75-a33f32770a4e · outbound

This paper cites W avlm: Large-scale self-supervised pre-training for full stack speech processing,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis W avlm: Large-scale self-supervised pre-training for full stack speech processing,

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.672277Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.457609Z digest=sha256:33c6cfdd14daa68c6f507beef868d81dacc0a0b8f21e91fce3d820faaf14eacf

Observation 92de90e0-cda9-4b98-97db-384300238ca1 · outbound

This paper cites Espnet-spk: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Espnet-spk: full pipeline speaker embedding toolkit with reproducible recipes, self-supervised front-ends, and off-the-shelf models,

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.658468Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.461602Z digest=sha256:a5ea8fa8fdb0eeb9706a3f21913a5c2cb7952892d2b22578ad07c785aab768a7

Observation d0e2697d-9dc6-444d-be79-6328668b6409 · outbound

This paper cites Decoupled weight decay regularization,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Decoupled weight decay regularization,

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.644247Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.465673Z digest=sha256:1fa6516a75f76c61ae58f030f40553926509014edbe18b47d2a5dc98711d4bd1

Observation c405fef8-c725-4275-a956-6b3578d0e8b1 · outbound

This paper cites Fr\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis Fr\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-11T00:50:14.469689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T00:50:14.469689Z digest=sha256:7f253333d971f45e7177d8f206e4a4a6997f58c3867dc5fa31d33b3b989aafe0

Observation 8aff6a2c-f666-456c-bdb0-52c603beb41d · outbound

This paper cites I hear your true colors: Image guided audio generation,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis I hear your true colors: Image guided audio generation,

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.630750Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.473809Z digest=sha256:74b8e47ebfa2f504a0a5ea77916a227c1f075cc51e3a30642ae432a57609d121

Observation a1446cfc-b7be-493a-b313-a8e7e3f96f16 · outbound

This paper cites T aming visually guided sound generation,.

VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis T aming visually guided sound generation,

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T00:50:14.616648Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-11T00:50:14.477869Z digest=sha256:6c41cab008ac8f7e9488f6ab908f6a1d923d407a2f6b0b4c507e348494685532

Pith citing papers

Observation 0176a76c-24a2-4bec-b123-ff19bb18f4bf · inbound

UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching cites this paper.

UmbraTTS: Adapting Text-to-Speech to Environmental Contexts with Flow Matching VoiceDiT: Dual-Condition Diffusion Transformer for Environment-Aware Speech Synthesis

Reference 2023

Resolution
metadata mismatch
local_arxiv, observed 2026-08-07T04:45:19.546105Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T04:45:18.672137Z digest=sha256:e9fccfde453623dcaacc893be9166006b4031b8b37ea746ca1ba303cd25924a3