Pith. sign in

Paper Citation Record · LEDGER

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation

As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2607.10421.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.10421 v1

Coverage vector

measured 40 of 40 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-14T11:52:50.598080Z

measured 40 of 40 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

40 of 40 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved40
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 9b3fc724-f212-4470-a95c-1e1e5c606eda · outbound

This paper cites Diffused responsibility: Analyzing the energy consumption of gen- erative text-to-audio diffusion models,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Diffused responsibility: Analyzing the energy consumption of gen- erative text-to-audio diffusion models,

Reference 1

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:27a827309819bad4facd65e001ef212a388e6cb154f857a7f110604743361190

Observation e6a288de-c2f6-4954-a82e-4dbfac3e3d92 · outbound

This paper cites Denoising diffusion probabilistic models,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Denoising diffusion probabilistic models,

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:dae72c3396affbc2e7cb7a85fbb37c2278ba72db9d3dbc61a1ac95c81564d97b

Observation c342c0a4-bc17-4eea-be6b-f55cbbc08972 · outbound

This paper cites Flow matching for generative modeling,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Flow matching for generative modeling,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:7814eb66324d5f435bbb953f5817c6da5364e3d6065660f27fc5fcff3233db34

Observation 0b8edfd2-2c7b-48ec-90d0-4d4028f8f01b · outbound

This paper cites Audioldm 2: Learning holistic audio generation with self-supervised pretraining,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Audioldm 2: Learning holistic audio generation with self-supervised pretraining,

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:8adcf9e5eb3e8d6571c8c25dcd2789a0822edaeda5cb087fc7cace516b257535

Observation f1630e7b-902a-4ded-885f-20542620c3c8 · outbound

This paper cites Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:748f4445df7b44cf48e031e56bee705bdf717f248bab3777380d32e1799ecaa8

Observation 8f8bcb6a-d5b0-4c67-809a-332b91dc07f7 · outbound

This paper cites Tango 2: Aligning diffusion-based text-to-audio generations through direct preference optimization,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Tango 2: Aligning diffusion-based text-to-audio generations through direct preference optimization,

Reference 6

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:99df98301fd1aa55d07dcae42ef612481305ed6df9313eb57752fa0ccffc02a0

Observation 5225392a-18c1-4d74-bb3a-67134f339fb3 · outbound

This paper cites TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization

Reference 7

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:34137184c4a505722856672b296b25f13abcae7fe6a6a7308229689bea87863a

Observation e2b5beb3-0265-45b8-bdae-30cdb9109561 · outbound

This paper cites Impact: Iterative mask- based parallel decoding for text-to-audio generation with diffusion mod- eling,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Impact: Iterative mask- based parallel decoding for text-to-audio generation with diffusion mod- eling,

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:f2b384f6d5c9e1da5c0ba19836e466b10298f19f9a2734bdaab915c9f4880b49

Observation 32b5affa-9fcf-4104-9966-5aad433aeb18 · outbound

This paper cites Generative audio language modeling with continuous-valued tokens and masked next- token prediction,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Generative audio language modeling with continuous-valued tokens and masked next- token prediction,

Reference 9

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:df619b4932cd490eaca6520ba301bacd081c94eec64c086b5958f9597703f1f8

Observation 91139c4a-cb0e-4156-86fc-d0997f70839c · outbound

This paper cites EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:fdc163c3aeac252e30621379d8b2ce159feae5812b49782b16ccbb77be536212

Observation 787e77e3-43c1-41c2-9d41-7ce15f754e33 · outbound

This paper cites Resonate: Reinforcing text-to-audio generation via online feedback from large audio language models,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Resonate: Reinforcing text-to-audio generation via online feedback from large audio language models,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:3ba0e10d0e55e88e9ed71f8ac7aee15e87a9d4c3ce81cf5aade701e2102d3588

Observation 6564cabb-cb6a-43b4-95e3-db7286f4326d · outbound

This paper cites Consisten- cyTTA: Accelerating Diffusion-Based Text-to-Audio Generation with Consistency Distillation,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Consisten- cyTTA: Accelerating Diffusion-Based Text-to-Audio Generation with Consistency Distillation,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:aceb6d430401860b79c0907af388c39db48d91a5b5d84723a480a1f8a56459d1

Observation 448a95b5-f72f-46fa-8bb6-02ad2c8b0be9 · outbound

This paper cites AudioLCM: Text-to-Audio Generation with Latent Consistency Models.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation AudioLCM: Text-to-Audio Generation with Latent Consistency Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:a8bbe8296d73bf649abbb837ec0b863de45c96e13115cc679c30fe3b2a278e64

Observation 4836bf38-4f4a-4b3e-974a-49ec1ab4827e · outbound

This paper cites AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion

Reference 14

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:86f5ab90615e885aff29b91a17e381974e68079a279b23ccf52e7f9bdee41771

Observation 9a0e3136-f195-497d-9cde-37a243fb63c7 · outbound

This paper cites Soundctm: Uniting score-based and consistency models for text-to-sound generation,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Soundctm: Uniting score-based and consistency models for text-to-sound generation,

Reference 15

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:c2b2bbca529c0945548cbddeb0f72054cd0a41ac51af8798a694737bd5cf955b

Observation 79a2d7b3-b564-4331-a444-46dfa7549aa6 · outbound

This paper cites Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation

Reference 16

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:d78aba26157eb14b5867e8336974b97cfaefe6adc6b403c8984ef37688ea98bf

Observation 84884172-5761-4be8-94fb-e307d06c3304 · outbound

This paper cites Meanaudio: Fast and faithful text-to-audio generation with mean flows,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Meanaudio: Fast and faithful text-to-audio generation with mean flows,

Reference 17

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:4cca6954ec948e51d6988b31250b96bd5a0a7a764f101197b9948cf57ef236c1

Observation 2ce94d7e-4383-4606-a290-c826b768d528 · outbound

This paper cites Representation Fr\'echet Loss for Visual Generation.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Representation Fr\'echet Loss for Visual Generation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:fb3e7921b6efe2e7ea051e67d9db62470c432739f1a0c88d54e90559e086cee9

Observation 41936e17-7ad3-4898-8b0f-5829edb40ab1 · outbound

This paper cites One-step Latent-free Image Generation with Pixel Mean Flows.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation One-step Latent-free Image Generation with Pixel Mean Flows

Reference 19

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:4091d507e3d3def28ab26918b1faed40db9e2738e3ef2662e2ab39b8911c8f6f

Observation 2cf87a7e-7209-4421-9242-379dbae502c2 · outbound

This paper cites Improved mean flows: On the challenges of fastforward generative models,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Improved mean flows: On the challenges of fastforward generative models,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:ba0274934cec02e10532d6f1c75b793492ff41c069472f2fee09ab751b66cd68

Observation 9cb6e32e-3213-4e95-bfd7-79fd88cbda9f · outbound

This paper cites Rethinking the inception architecture for computer vision,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Rethinking the inception architecture for computer vision,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:9bea66a2fec73e5ba620a72aef4c075a1953ea62d5cd1a1fe10e8034c6693fe1

Observation 5389094d-485c-43dd-9e7b-e3beda2007f8 · outbound

This paper cites A convnet for the 2020s,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation A convnet for the 2020s,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:bb3118172eec14c583011b4de7c757b74ce1b63ce9675b1a9f7d9773a1e8e288

Observation cc496b24-9abc-41da-b947-1af532dd2de9 · outbound

This paper cites Masked au- toencoders are scalable vision learners,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Masked au- toencoders are scalable vision learners,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:7ecf98581a965547111d3dac5a35ec74836296a8739e85bed737e3e556219dad

Observation 14000e90-98c1-4845-8fe8-becba052302f · outbound

This paper cites DINOv2: Learning Robust Visual Features without Supervision.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation DINOv2: Learning Robust Visual Features without Supervision

Reference 24

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:ee707ec9ecede0bfb57b8f0fc15c20161a203cc55f9b9bdb0bd673992dac41bd

Observation 1df227df-61fa-433e-918f-8991112aeb6c · outbound

This paper cites SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features

Reference 25

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:fca7b6afe9a545e38bbcd9655109cdf7cd717854b2a5d8ea334f16212dce546a

Observation 3a6dce11-03d4-493f-a423-7b12a6b009b4 · outbound

This paper cites Learning transferable visual models from natural language supervision,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Learning transferable visual models from natural language supervision,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:046c045590a9cb778aa19db599874ac6a65f4f33cc2a48641e65487ffc7ae04f

Observation 80f65fbd-d9d9-438b-9f20-c2fceea7d0c6 · outbound

This paper cites Panns: Large-scale pretrained audio neural networks for audio pattern recognition,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Panns: Large-scale pretrained audio neural networks for audio pattern recognition,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:cc4873ef6facd64827b9be851e2f418ceb8beafa65032241f46cf55eb05cac3a

Observation 3f25018d-04b1-4c8d-957b-3f56b043c333 · outbound

This paper cites Efficient Training of Audio Transformers with Patchout.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Efficient Training of Audio Transformers with Patchout

Reference 28

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:b1d60cc60782b8887aa05508e30f6da88e266f78ed952af66e6f407ce065f4d4

Observation 35666e69-0923-4e17-9b60-173abe7283e8 · outbound

This paper cites BEATs: Audio Pre-Training with Acoustic Tokenizers.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation BEATs: Audio Pre-Training with Acoustic Tokenizers

Reference 29

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:041cf4877d36ec7db83bea1364c4efb81b745ad1bfdff40f94493d39bf312af4

Observation 5445dba3-c174-45bb-ba8e-1d0b7b374042 · outbound

This paper cites Masked autoencoders that listen,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Masked autoencoders that listen,

Reference 30

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:40a28218683700d6da8f1a7ed00cb342db49ad4897c452d1f167c7ed181bcf6d

Observation e2adef9c-7570-46fb-80b7-f5cff6c37478 · outbound

This paper cites Mean flows for one- step generative modeling,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Mean flows for one- step generative modeling,

Reference 31

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:482263ed648dfbd6833de2b05329344371224d2f9cc43488c98c50836c8f113e

Observation 4ad7b97e-fa98-496e-a94b-9ecddec4c3bd · outbound

This paper cites Consistency models,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Consistency models,

Reference 32

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:3cb5dbf0e56ffa020050127c20ec4f28dc7c024b822e7e8990a39ba82de25bbb

Observation c7f7f1ae-7dde-48a0-9dc6-f6afcaa0ef75 · outbound

This paper cites Classifier-Free Diffusion Guidance.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Classifier-Free Diffusion Guidance

Reference 33

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:6ddfc9bdf1bdfc2eea0c35441dfc9f0838143f92fb35831f9a381d8b886e8fe1

Observation b5c39f40-ce4e-49fa-ab65-4b6b2850d562 · outbound

This paper cites Cnn architectures for large-scale audio classification,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Cnn architectures for large-scale audio classification,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:3d60580f9bb03daa4006f886254408763ad9577209511e2cd8a3215e9e54ed32

Observation 31071348-ec9d-4de3-ab60-b9d04e90aa26 · outbound

This paper cites Fr ´echet Audio Distance: A Reference-Free Metric for Evaluating Music Enhancement Algorithms,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Fr ´echet Audio Distance: A Reference-Free Metric for Evaluating Music Enhancement Algorithms,

Reference 35

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:5a3d0d29563b978b25f94bde981631b8437e3c08368afbd48b8f50594dd77513

Observation 6f1c48ba-5e77-4be8-a438-f33b33454261 · outbound

This paper cites Audiocaps: Generating captions for audios in the wild,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Audiocaps: Generating captions for audios in the wild,

Reference 36

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:d1fdc4f22007db7a42801ac96d2dda2db0379dba3eb71ffa24db11fb5a78ad6e

Observation f456aa68-c034-4fe6-8362-323bf9306d49 · outbound

This paper cites Wavcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Wavcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research,

Reference 37

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:7f2c81f0632f1bf02c04d8815f4b4e0830facd13bf81f245a221fd52e21ef133

Observation cefcfe44-49ef-498a-89d2-a368fb3c3f47 · outbound

This paper cites Improved techniques for training gans,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Improved techniques for training gans,

Reference 38

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:c6e1e65f956f42b84db26b73b1071ce688b612a244f6ba5d1cf15ababf14bdea

Observation 9e25f93f-cb18-4481-9ff8-7f32405e7f25 · outbound

This paper cites Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,

Reference 39

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:25eda28cbaad33981ecc0fe227fa270f2d7461fb3f38dee91a35f9b7192fb58c

Observation eeee2452-af75-4daf-80e5-0033f521df71 · outbound

This paper cites Scaling instruction-finetuned language models,.

FdAudio: MeanFlow-Anchored Fr\'echet-Distance Post-Training for One-Step Text-to-Audio Generation Scaling instruction-finetuned language models,

Reference 40

Resolution
unresolved
no resolver link, observed 2026-07-14T11:52:50.598080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T11:52:50.598080Z digest=sha256:08a88f2041ac54121bdba24d210ee24ea2beb8ecfa80b66682636d4b55eb5641

Pith citing papers

No inbound Pith citation observations are available.