Pith. sign in

Paper Citation Record · LEDGER

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion

As of 18 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 3 inbound Pith citation observations for arXiv:2505.22106.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.22106 v1

Coverage vector

measured 41 of 41 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T13:21:11.797874Z

measured 44 of 44 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T13:21:08.234057Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-11T15:46:43.538548Z

Reference resolution

41 of 41 outbound references displayed

  • verified exact2
  • verified fuzzy25
  • unresolved14
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation d6304768-44fd-463d-9ff2-886fe2eee27b · outbound

This paper cites The audio generated by TTA systems is primarily categorized into three types: speech, sound effects, and music.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion The audio generated by TTA systems is primarily categorized into three types: speech, sound effects, and music

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:16.912318Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:08.126646Z digest=sha256:6c37ee1409b15b2254ace6a021409934be9def86c7c46c9dd8ebeba6c85da292

Observation 3cff68ac-83e2-4e74-a213-17a4a2a700b8 · outbound

This paper cites an unresolved cited work.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:21:16.657206Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:08.315871Z digest=sha256:0b06888c80f04705a6b09d024cb480696b559900cd5ea6ecc18cc1efb4452299

Observation 188b390f-9bf8-4812-a1e7-2cb7eeafea2e · outbound

This paper cites an unresolved cited work.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-07T13:21:16.369102Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:08.381010Z digest=sha256:39e14e340036a6e33938f75f3c627980bb1a951c44797b041e574991ee3da14f

Observation 449c3509-6295-4986-8fa8-3428ff23a207 · outbound

This paper cites Experimental Setup 4.1.1.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Experimental Setup 4.1.1

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:16.256670Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:08.490860Z digest=sha256:b8353dc1afd51d5a3beec86f01795097e7e1b7eff8062e392fb50380fb2f2772

Observation 70c680c0-050c-49b8-9323-c2f85c9414c3 · outbound

This paper cites Experiments show that by combining SOTA TTA models with rectified dif- fusion, AudioTurbo surpasses baseline models in both objec- tive and subjective evaluations.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Experiments show that by combining SOTA TTA models with rectified dif- fusion, AudioTurbo surpasses baseline models in both objec- tive and subjective evaluations

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:16.014805Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:08.604528Z digest=sha256:6de3ffc4c2ddd0ace50181783361fd65058b161e410a55611cdc1ef8b1ce3497

Observation e18e24ed-cd8b-4d7d-8e63-2bf24d17ae8d · outbound

This paper cites Text-to- speech and speech-to-text converter—voice assistant,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Text-to- speech and speech-to-text converter—voice assistant,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:15.393706Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:09.174219Z digest=sha256:a86166b97bf2094bdbfbe2a1d22a69a0e8165d0b3a392fa6f79cc1e2509f9ded

Observation 996763e3-ead4-4ff1-ac9d-5384786a0b32 · outbound

This paper cites AudioGen: Textu- ally guided audio generation,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion AudioGen: Textu- ally guided audio generation,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:15.840924Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:08.694625Z digest=sha256:64f047338d72ae48376a947421f15e405f10336af8950763f608c2bf013f9827

Observation 48e7124c-05e4-43c9-bb0d-10ed4f8b5f88 · outbound

This paper cites UniAudio: An Audio Foundation Model Toward Universal Audio Generation.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion UniAudio: An Audio Foundation Model Toward Universal Audio Generation

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T13:21:08.829562Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:21:08.829562Z digest=sha256:906cc8d416995a20f75aeec3700da247a59d2998605f2e0268368168df01daed

Observation a410e71b-55ac-4f22-90e5-3cddaabb01e0 · outbound

This paper cites Diffsound: Discrete diffusion model for text-to-sound genera- tion,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Diffsound: Discrete diffusion model for text-to-sound genera- tion,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:15.636832Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:08.918467Z digest=sha256:c22f68daa11a5d46afa8a863e6414e9a300f0194ff3d28482fc3b28827194f39

Observation 8fa498a3-943f-43af-bedc-20bed2a17b9e · outbound

This paper cites AudioLDM: text-to-audio generation with latent diffusion models,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion AudioLDM: text-to-audio generation with latent diffusion models,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T13:21:08.977066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:21:08.977066Z digest=sha256:9616267e97490da128bc8641f8312c4099ddb17123619202fa77e40a01844c4f

Observation ecd636f1-098b-43a6-bcfa-3be362a7d582 · outbound

This paper cites Text-to- audio generation using instruction guided latent diffusion model,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Text-to- audio generation using instruction guided latent diffusion model,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:15.474788Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:09.067774Z digest=sha256:82e7ce320d7b7d02576f71f102bf4eeafbcdcbcc11f5239b7072a9a8f070e731

Observation 324cf7b1-8a97-45d3-b539-fe17446ad53e · outbound

This paper cites Auffusion: Leveraging the power of diffusion and large language models for text-to-audio generation,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Auffusion: Leveraging the power of diffusion and large language models for text-to-audio generation,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:14.965027Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:09.576858Z digest=sha256:61021c6d562bf05f45a30b625439b1db66d9e01a316cd03075dc35c206cee2c9

Observation 2364a185-a311-47ac-8138-ba5b99cdf58f · outbound

This paper cites A Survey of Deep Learning Audio Generation Methods.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion A Survey of Deep Learning Audio Generation Methods

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-08-07T13:21:12.508986Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:09.219476Z digest=sha256:307b4daef5646a14e1c6d495087d73e4e6f6e7d9372ca0f802b5be8bd02663cf

Observation 1dc413e4-7aa3-4b26-939f-d7aa7b8798a4 · outbound

This paper cites Leveraging AI to Generate Audio for User-generated Content in Video Games.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Leveraging AI to Generate Audio for User-generated Content in Video Games

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T13:21:09.271962Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:21:09.271962Z digest=sha256:5584db17af84fe101651248ff6d38f03b738eede6e7dadd0046e7bf94a3862a0

Observation f5385b2f-81a6-4a07-ba71-c9234fdec4b1 · outbound

This paper cites MusicLM: Generating Music From Text.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion MusicLM: Generating Music From Text

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T13:21:09.317308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:21:09.317308Z digest=sha256:f444ffffacbb872a7f10ffd9564f30285aab9a1da0a114ef11c8ad90328e8228

Observation abab167c-2d2b-4f13-b3c8-cd455917149c · outbound

This paper cites Neural discrete representa- tion learning,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Neural discrete representa- tion learning,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:15.252714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:09.421624Z digest=sha256:f49ccfd354c8161c7a50bf03f0d7ef7d386b83a6ac2c12193203fcb41732fee1

Observation 5bc62098-92a7-45ed-b6b2-9cba5573bef3 · outbound

This paper cites High-resolution image synthesis with latent diffusion models,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion High-resolution image synthesis with latent diffusion models,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:15.108186Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:09.522549Z digest=sha256:6ac0a82d8d9ebdeff86332591f5e5c012f8203df5e98bf75b2b614838f62182b

Observation 46e480b0-65a8-49e1-ab75-95129389b619 · outbound

This paper cites FlashSpeech: Efficient zero-shot speech synthesis,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion FlashSpeech: Efficient zero-shot speech synthesis,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:14.428965Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:10.261567Z digest=sha256:9179730f06669950b868d728e61f035c0e598574c41208225c89c892265bc2c6

Observation 0e16c682-6918-498c-b935-cff2bebc2bca · outbound

This paper cites AudioLDM 2: Learn- ing holistic audio generation with self-supervised pretraining,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion AudioLDM 2: Learn- ing holistic audio generation with self-supervised pretraining,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T13:21:09.620536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:21:09.620536Z digest=sha256:664a1d797e3b0aef44e4a3993eb0cf375a012cc315e7f0724de50051201fa6ca

Observation 16b46a8c-60f9-4f40-b30b-ba41836a6fb7 · outbound

This paper cites AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T13:21:08.234057Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:21:08.234057Z digest=sha256:bc65fcce9b630f2fd0d1195ab26a743667da1fa91f8fe1badf00e7017666b5fe

Observation a2f193fd-a9b1-4eb2-ac91-66b71ca819eb · outbound

This paper cites Make-an-Audio: Text-to-audio generation with prompt-enhanced diffusion models,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Make-an-Audio: Text-to-audio generation with prompt-enhanced diffusion models,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:14.820084Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:09.651250Z digest=sha256:3180b7360e4df4c43bf967bbe31d4e92e55df3ecc0e4c86ac403c84f246c89f9

Observation b2d9abc9-eb29-49b2-ae2a-6724abd38d96 · outbound

This paper cites Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T13:21:09.950564Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:21:09.950564Z digest=sha256:5f9c1ae77e127263c94cf7da4d15050a845aa39acdb7de77ce3373d9aa61281b

Observation a13c1315-f2f5-4809-80ad-cd8b0256f01e · outbound

This paper cites ProDiff: Progressive fast diffusion model for high-quality text-to-speech,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion ProDiff: Progressive fast diffusion model for high-quality text-to-speech,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:14.635611Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:10.029525Z digest=sha256:f4c96899c703ebea6bbf369b68cbc7a50a5932273d820cb38a491b5b12c94e29

Observation 3ada13ed-a7d1-4caa-9419-a39c7fc9f046 · outbound

This paper cites Matcha-TTS: A fast TTS architecture with conditional flow matching,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Matcha-TTS: A fast TTS architecture with conditional flow matching,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:14.540426Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:10.165933Z digest=sha256:62e6bae0907f8728338e163e7ab8e727814e712b3a49544e3bdc943a7c2508e3

Observation 5ffc9e00-4f0e-45d8-b9bc-1fe82064984c · outbound

This paper cites LAFMA: A Latent Flow Matching Model for Text-to-Audio Generation.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion LAFMA: A Latent Flow Matching Model for Text-to-Audio Generation

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T13:21:10.350455Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:21:10.350455Z digest=sha256:3a2e2b05828cbdb33f8bd871b710b1023ba922354475bd4f10db3557e35bdb4b

Observation 7ec3dad7-ef41-4a30-9919-bcc876b8f32d · outbound

This paper cites Flow matching for generative modeling,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Flow matching for generative modeling,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:14.285099Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:10.475766Z digest=sha256:345c90259cea8bedd035158d1f670b0027ad63d0423543ca72264aaf2648e269

Observation fbe88115-e341-4950-bd3f-e90f055a59e9 · outbound

This paper cites Rectified Diffusion: Straightness Is Not Your Need in Rectified Flow.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Rectified Diffusion: Straightness Is Not Your Need in Rectified Flow

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T13:21:10.583271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:21:10.583271Z digest=sha256:91c3e67c377655934be76da6214ced8a30a78f144beeabedc7edeb7d05bbdee9

Observation f9c77d8b-0246-4051-a7e4-d45db0f0135c · outbound

This paper cites Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T13:21:10.677989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:21:10.677989Z digest=sha256:22f9e2a5436d75ae1d08aa8cf2c078d3ebd907003255d5cd665732e991f116c6

Observation 0a6d5771-71db-472b-82bb-92b006bdf3e7 · outbound

This paper cites Classifier-Free Diffusion Guidance.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Classifier-Free Diffusion Guidance

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T13:21:10.774097Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:21:10.774097Z digest=sha256:6b9e34c7b6478c15983daa000e994a47b52618174f0d388add822cdb7a190432

Observation 6763064e-4091-4233-8841-c78fdc0626aa · outbound

This paper cites Score-based generative modeling through stochas- tic differential equations,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Score-based generative modeling through stochas- tic differential equations,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:14.116228Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:10.866890Z digest=sha256:18091cbafab3bae664393021c5b5edb9d9d09626cb7a219741b3e3f23ba87293

Observation 9943b528-6d4d-4b51-9a29-6f2cf98a9b33 · outbound

This paper cites DPM-Solver: A fast ODE solver for diffusion probabilistic model sampling in around 10 steps,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion DPM-Solver: A fast ODE solver for diffusion probabilistic model sampling in around 10 steps,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:13.983818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:10.950164Z digest=sha256:6a0d9949839b202a68f1c3d475d3c3ad30902db1288ad73e817c3cc20e34431a

Observation 523944d1-a27b-4916-bfa7-6d27f49aa0ce · outbound

This paper cites Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:13.872434Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:11.066100Z digest=sha256:129f63aab0132292328cf5de02f16eeb9f9c8898ca9462ca79dc8ff87e1d80f4

Observation e986f037-d254-4f90-ae00-b759ad7727fe · outbound

This paper cites Learning transferable visual models from natural language supervision,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Learning transferable visual models from natural language supervision,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:13.716985Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:11.139122Z digest=sha256:ae6779baee004598723a93c3ecb084ecbba657b050baa99709e861cc475778f6

Observation 9cdd219a-716d-46a8-bdd4-f91de6dcc23d · outbound

This paper cites U-Net: Convolutional networks for biomedical image segmentation,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion U-Net: Convolutional networks for biomedical image segmentation,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:13.596152Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:11.211420Z digest=sha256:86a078b2d735ad6b617f42b83fb01a100559adffa325ca4b63722f65e41bca95

Observation 96918202-d1eb-4c71-8db5-fdef4e68f3a3 · outbound

This paper cites Denoising diffusion implicit models,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Denoising diffusion implicit models,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:13.437880Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:11.294535Z digest=sha256:ba89ef71e99532883c8c71092ca5fa095f164ffc01e4de9e59c51613cb2678a2

Observation 9bda180c-d77b-43b2-a26f-7612f08fa36a · outbound

This paper cites Pseudo numerical methods for diffusion models on manifolds,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Pseudo numerical methods for diffusion models on manifolds,

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T13:21:11.382160Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:21:11.382160Z digest=sha256:26c063469ae23363213cf724a4856a3e571c9d2ce7100bdf8f68d11e03eea978

Observation 2a330639-1401-4678-853c-985e8a1b624b · outbound

This paper cites AudioCaps: Generat- ing captions for audios in the wild,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion AudioCaps: Generat- ing captions for audios in the wild,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:13.304432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:11.427230Z digest=sha256:84ea1baf378d8e88f8032ffbb2f83b1b9a02b8053879493b37551dc6a37046fc

Observation a975a37b-535a-496c-97cb-93161ad656b1 · outbound

This paper cites PANNs: Large-scale pretrained audio neural networks for audio pattern recognition,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion PANNs: Large-scale pretrained audio neural networks for audio pattern recognition,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:13.105140Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:11.509960Z digest=sha256:e0a0ebf659699cf1bb351b9a141760ebb82af020086e61aba26b959aabd30f89

Observation 6f32bb52-1ab9-450c-b936-ce9cdc111e65 · outbound

This paper cites Diffusion models beat GANs on im- age synthesis,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Diffusion models beat GANs on im- age synthesis,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:12.950137Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:11.594091Z digest=sha256:e5058807ead8193f5dbbc7105ada9239b9c93c98abf7f317c70b869873993e7f

Observation 95b6400c-3078-4e02-9dba-45955906ecd4 · outbound

This paper cites Universal sound separation with self-supervised audio masked autoencoder,.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion Universal sound separation with self-supervised audio masked autoencoder,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:21:12.731719Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:11.717342Z digest=sha256:38c443a3166e49e5c27c6b34dea37583a01147efc9f5bf136ffc26939bf71d29

Observation 35bd27e7-b1db-4ae1-8f9d-d0c34ea7aa96 · outbound

This paper cites SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer

Reference 41

Resolution
verified exact
local_arxiv, observed 2026-08-07T13:21:12.016943Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T13:21:11.797874Z digest=sha256:f27a18c7bb101556335d3019cba23724e7bffdfbbf8b699d21df01be373616e8

Pith citing papers

Observation 16b46a8c-60f9-4f40-b30b-ba41836a6fb7 · inbound

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion cites this paper.

AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T13:21:08.234057Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:21:08.234057Z digest=sha256:bc65fcce9b630f2fd0d1195ab26a743667da1fa91f8fe1badf00e7017666b5fe

Observation e1c9d323-e989-4711-81ed-a990793ad6f7 · inbound

Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation cites this paper.

Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-11T15:46:43.615417Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-09T19:17:09.247932Z digest=sha256:26cd0d605409e61b18e23c25a802c472f37a4d8cdad11e9a5b902419a41fdece

Observation 4836bf38-4f4a-4b3e-974a-49ec1ab4827e · inbound

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation cites this paper.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion

Reference 14

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:e194830a80787d912c117cefcf5d72a23f1f85125172fc4cfd5f813aeb0bd202