{"as_of":"2026-08-09T14:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f009c4e7ad017b6a1dd6d05617fedf21a45cf722d037d9d7d08e382e6a832eb3","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T11:52:50.598080Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10421/citation-record","integrity":"/paper/2607.10421/integrity","json":"/paper/2607.10421/citation-record.json","paper":"/paper/2607.10421"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Diffused responsibility: Analyzing the energy consumption of gen- erative text-to-audio diffusion models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:27a827309819bad4facd65e001ef212a388e6cb154f857a7f110604743361190","observation_id":"9b3fc724-f212-4470-a95c-1e1e5c606eda","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:dae72c3396affbc2e7cb7a85fbb37c2278ba72db9d3dbc61a1ac95c81564d97b","observation_id":"e6a288de-c2f6-4954-a82e-4dbfac3e3d92","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:7814eb66324d5f435bbb953f5817c6da5364e3d6065660f27fc5fcff3233db34","observation_id":"c342c0a4-bc17-4eea-be6b-f55cbbc08972","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Audioldm 2: Learning holistic audio generation with self-supervised pretraining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:8adcf9e5eb3e8d6571c8c25dcd2789a0822edaeda5cb087fc7cace516b257535","observation_id":"0b8edfd2-2c7b-48ec-90d0-4d4028f8f01b","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-08-08T06:05:53.280034Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Make-an-audio 2: Temporal-enhanced text-to- audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:748f4445df7b44cf48e031e56bee705bdf717f248bab3777380d32e1799ecaa8","observation_id":"f1630e7b-902a-4ded-885f-20542620c3c8","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Tango 2: Aligning diffusion-based text-to-audio generations through direct preference optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:99df98301fd1aa55d07dcae42ef612481305ed6df9313eb57752fa0ccffc02a0","observation_id":"8f8bcb6a-d5b0-4c67-809a-332b91dc07f7","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-03T09:49:19.218280Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21037","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2412.21037","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:34137184c4a505722856672b296b25f13abcae7fe6a6a7308229689bea87863a","observation_id":"5225392a-18c1-4d74-bb3a-67134f339fb3","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Impact: Iterative mask- based parallel decoding for text-to-audio generation with diffusion mod- eling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:f2b384f6d5c9e1da5c0ba19836e466b10298f19f9a2734bdaab915c9f4880b49","observation_id":"e2b5beb3-0265-45b8-bdae-30cdb9109561","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Generative audio language modeling with continuous-valued tokens and masked next- token prediction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:df619b4932cd490eaca6520ba301bacd081c94eec64c086b5958f9597703f1f8","observation_id":"32b5affa-9fcf-4104-9966-5aad433aeb18","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"EzAudio: Enhancing Text-to-Audio Generation with Efficient Diffusion Transformer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:fdc163c3aeac252e30621379d8b2ce159feae5812b49782b16ccbb77be536212","observation_id":"91139c4a-cb0e-4156-86fc-d0997f70839c","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Resonate: Reinforcing text-to-audio generation via online feedback from large audio language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:3ba0e10d0e55e88e9ed71f8ac7aee15e87a9d4c3ce81cf5aade701e2102d3588","observation_id":"787e77e3-43c1-41c2-9d41-7ce15f754e33","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Consisten- cyTTA: Accelerating Diffusion-Based Text-to-Audio Generation with Consistency Distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:aceb6d430401860b79c0907af388c39db48d91a5b5d84723a480a1f8a56459d1","observation_id":"6564cabb-cb6a-43b4-95e3-db7286f4326d","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00356","last_updated":"2024-07-09T14:49:02Z","snapshot_observed_at":"2026-07-06T18:23:44.289062Z","submitted_at":"2024-06-01T08:19:56Z","title":"AudioLCM: Text-to-Audio Generation with Latent Consistency Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00356","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Audiolcm: Text-to-audio generation with latent consistency models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2406.00356","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:a8bbe8296d73bf649abbb837ec0b863de45c96e13115cc679c30fe3b2a278e64","observation_id":"448a95b5-f72f-46fa-8bb6-02ad2c8b0be9","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-07T13:12:43.270911Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22106","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Audioturbo: Fast text-to-audio generation with rectified diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2505.22106","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:86f5ab90615e885aff29b91a17e381974e68079a279b23ccf52e7f9bdee41771","observation_id":"4836bf38-4f4a-4b3e-974a-49ec1ab4827e","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Soundctm: Uniting score-based and consistency models for text-to-sound generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:c2b2bbca529c0945548cbddeb0f72054cd0a41ac51af8798a694737bd5cf955b","observation_id":"9a0e3136-f195-497d-9cde-37a243fb63c7","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-08-04T21:56:38.114801Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00329","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Fast text-to-audio generation with one-step sampling via energy-scoring and auxiliary contextual representation distillation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2605.00329","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:d78aba26157eb14b5867e8336974b97cfaefe6adc6b403c8984ef37688ea98bf","observation_id":"79a2d7b3-b564-4331-a444-46dfa7549aa6","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Meanaudio: Fast and faithful text-to-audio generation with mean flows,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:4cca6954ec948e51d6988b31250b96bd5a0a7a764f101197b9948cf57ef236c1","observation_id":"84884172-5761-4be8-94fb-e307d06c3304","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.28190","last_updated":"2026-04-30T17:59:51Z","snapshot_observed_at":"2026-07-30T01:53:26.758901Z","submitted_at":"2026-04-30T17:59:51Z","title":"Representation Fr\\'echet Loss for Visual Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.28190","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Representation fr ´echet loss for visual generation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2604.28190","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:fb3e7921b6efe2e7ea051e67d9db62470c432739f1a0c88d54e90559e086cee9","observation_id":"2ce94d7e-4383-4606-a290-c826b768d528","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.22158","last_updated":"2026-05-09T16:47:56Z","snapshot_observed_at":"2026-07-06T22:43:35.226546Z","submitted_at":"2026-01-29T18:59:56Z","title":"One-step Latent-free Image Generation with Pixel Mean Flows","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.22158","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"One-step latent-free image generation with pixel mean flows,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2601.22158","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:4091d507e3d3def28ab26918b1faed40db9e2738e3ef2662e2ab39b8911c8f6f","observation_id":"41936e17-7ad3-4898-8b0f-5829edb40ab1","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Improved mean flows: On the challenges of fastforward generative models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:ba0274934cec02e10532d6f1c75b793492ff41c069472f2fee09ab751b66cd68","observation_id":"2cf87a7e-7209-4421-9242-379dbae502c2","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Rethinking the inception architecture for computer vision,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:9bea66a2fec73e5ba620a72aef4c075a1953ea62d5cd1a1fe10e8034c6693fe1","observation_id":"9cb6e32e-3213-4e95-bfd7-79fd88cbda9f","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"A convnet for the 2020s,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:bb3118172eec14c583011b4de7c757b74ce1b63ce9675b1a9f7d9773a1e8e288","observation_id":"5389094d-485c-43dd-9e7b-e3beda2007f8","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Masked au- toencoders are scalable vision learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:7ecf98581a965547111d3dac5a35ec74836296a8739e85bed737e3e556219dad","observation_id":"cc496b24-9abc-41da-b947-1af532dd2de9","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:ee707ec9ecede0bfb57b8f0fc15c20161a203cc55f9b9bdb0bd673992dac41bd","observation_id":"14000e90-98c1-4845-8fe8-becba052302f","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:fca7b6afe9a545e38bbcd9655109cdf7cd717854b2a5d8ea334f16212dce546a","observation_id":"1df227df-61fa-433e-918f-8991112aeb6c","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:046c045590a9cb778aa19db599874ac6a65f4f33cc2a48641e65487ffc7ae04f","observation_id":"3a6dce11-03d4-493f-a423-7b12a6b009b4","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:cc4873ef6facd64827b9be851e2f418ceb8beafa65032241f46cf55eb05cac3a","observation_id":"80f65fbd-d9d9-438b-9f20-c2fceea7d0c6","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-04T12:25:56.734801Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Effi- cient training of audio transformers with patchout,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:b1d60cc60782b8887aa05508e30f6da88e266f78ed952af66e6f407ce065f4d4","observation_id":"3f25018d-04b1-4c8d-957b-3f56b043c333","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:041cf4877d36ec7db83bea1364c4efb81b745ad1bfdff40f94493d39bf312af4","observation_id":"35666e69-0923-4e17-9b60-173abe7283e8","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Masked autoencoders that listen,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:40a28218683700d6da8f1a7ed00cb342db49ad4897c452d1f167c7ed181bcf6d","observation_id":"5445dba3-c174-45bb-ba8e-1d0b7b374042","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Mean flows for one- step generative modeling,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:482263ed648dfbd6833de2b05329344371224d2f9cc43488c98c50836c8f113e","observation_id":"e2adef9c-7570-46fb-80b7-f5cff6c37478","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Consistency models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:3cb5dbf0e56ffa020050127c20ec4f28dc7c024b822e7e8990a39ba82de25bbb","observation_id":"4ad7b97e-fa98-496e-a94b-9ecddec4c3bd","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:6ddfc9bdf1bdfc2eea0c35441dfc9f0838143f92fb35831f9a381d8b886e8fe1","observation_id":"c7f7f1ae-7dde-48a0-9dc6-f6afcaa0ef75","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Cnn architectures for large-scale audio classification,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:3d60580f9bb03daa4006f886254408763ad9577209511e2cd8a3215e9e54ed32","observation_id":"b5c39f40-ce4e-49fa-ab65-4b6b2850d562","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Fr ´echet Audio Distance: A Reference-Free Metric for Evaluating Music Enhancement Algorithms,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:5a3d0d29563b978b25f94bde981631b8437e3c08368afbd48b8f50594dd77513","observation_id":"31071348-ec9d-4de3-ab60-b9d04e90aa26","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Audiocaps: Generating captions for audios in the wild,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:d1fdc4f22007db7a42801ac96d2dda2db0379dba3eb71ffa24db11fb5a78ad6e","observation_id":"6f1c48ba-5e77-4be8-a438-f33b33454261","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Wavcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal research,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:7f2c81f0632f1bf02c04d8815f4b4e0830facd13bf81f245a221fd52e21ef133","observation_id":"f456aa68-c034-4fe6-8362-323bf9306d49","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Improved techniques for training gans,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:c6e1e65f956f42b84db26b73b1071ce688b612a244f6ba5d1cf15ababf14bdea","observation_id":"cefcfe44-49ef-498a-89d2-a368fb3c3f47","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:25eda28cbaad33981ecc0fe227fa270f2d7461fb3f38dee91a35f9b7192fb58c","observation_id":"9e25f93f-cb18-4481-9ff8-7f32405e7f25","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Scaling instruction-finetuned language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:08a88f2041ac54121bdba24d210ee24ea2beb8ecfa80b66682636d4b55eb5641","observation_id":"eeee2452-af75-4daf-80e5-0033f521df71","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2607.10421."}