{"as_of":"2026-08-13T02:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:68c393db12124d3045bf7290de24acc5e932f518fd080490fb1fd1a909ad1bc5","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:21:11.797874Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:21:08.234057Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T15:46:43.538548Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22106","snapshot_observed_at":"2026-08-07T13:21:08.234057Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.234057Z"},"links":{"cited_paper":"/paper/2505.22106","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:58fe585a8eae45228b23223cbee5f048777f1ea24f5b8324cef498098100d46f","observation_id":"16b46a8c-60f9-4f40-b30b-ba41836a6fb7","resolution":{"observed_at":"2026-08-07T13:21:08.234057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"cited_work":{"arxiv_id":"2505.22106","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22106","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audioturbo: Fast text-to- audio generation with rectified diffusion.arXiv preprint arXiv:2505.22106","venue":null,"work_id":"68455081-6c5e-450f-93ae-61584afeb0f1","year":null},"citing_paper":{"arxiv_id":"2605.00329","last_updated":"2026-05-01T01:13:50Z","snapshot_observed_at":"2026-08-11T06:31:47.003544Z","submitted_at":"2026-05-01T01:13:50Z","title":"Fast Text-to-Audio Generation with One-Step Sampling via Energy-Scoring and Auxiliary Contextual Representation Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-09T19:17:09.247932Z"},"links":{"cited_paper":"/paper/2505.22106","citing_paper":"/paper/2605.00329"},"observation_digest":"sha256:ffab5d8c61f317a2213ef50447b38d826471167754aea0a5078e0486300b357e","observation_id":"e1c9d323-e989-4711-81ed-a990793ad6f7","resolution":{"observed_at":"2026-05-11T15:46:43.615417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22106","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Audioturbo: Fast text-to-audio generation with rectified diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2505.22106","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:aada8ca37a0066a54c5d942b57c5ca92ddb500069f4347ad08fced1059e18afa","observation_id":"4836bf38-4f4a-4b3e-974a-49ec1ab4827e","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22106/citation-record","integrity":"/paper/2505.22106/integrity","json":"/paper/2505.22106/citation-record.json","paper":"/paper/2505.22106"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:16.771179Z","title":"The audio generated by TTA systems is primarily categorized into three types: speech, sound effects, and music","venue":null,"work_id":"a3506633-8a25-4f72-adf8-742cf1ab04b8","year":null},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.126646Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:20e64f43e656b324d381ba32cc5a5460945d49d8083f6fdc5c4bca516c0cf333","observation_id":"d6304768-44fd-463d-9ff2-886fe2eee27b","resolution":{"observed_at":"2026-08-07T13:21:16.912318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:16.535497Z","title":null,"venue":null,"work_id":"1e6d6de2-82e4-4213-8189-80adae3c51e2","year":null},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.315871Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:58f97711ddaf96b70a8c69707622a50c2d41f1eb50b578b7ac59c305de0d791c","observation_id":"3cff68ac-83e2-4e74-a213-17a4a2a700b8","resolution":{"observed_at":"2026-08-07T13:21:16.657206Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:16.319728Z","title":null,"venue":null,"work_id":"aec91d30-0ee8-4883-8767-5138390cc02d","year":null},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.381010Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:ef212e60c3373126524d8073c777aa0389b459479aed56a4692bd04590443d71","observation_id":"188b390f-9bf8-4812-a1e7-2cb7eeafea2e","resolution":{"observed_at":"2026-08-07T13:21:16.369102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:16.165015Z","title":"Experimental Setup 4.1.1","venue":null,"work_id":"7ed2af7d-7129-4ff6-95c2-72f14ab1f6e4","year":null},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.490860Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:84aa07648335b4a8a1b36e1bb2c510c3e73412ba4a62c5b4c50f5cbdd5786770","observation_id":"449c3509-6295-4986-8fa8-3428ff23a207","resolution":{"observed_at":"2026-08-07T13:21:16.256670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.933166Z","title":"Experiments show that by combining SOTA TTA models with rectified dif- fusion, AudioTurbo surpasses baseline models in both objec- tive and subjective evaluations","venue":null,"work_id":"a0c9d34a-8201-4c8b-936b-3342c2cb184f","year":null},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.604528Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:894f74fbdc3715759feeecaf0ceacd9a340b19ff215807187661958a5618162f","observation_id":"70c680c0-050c-49b8-9323-c2f85c9414c3","resolution":{"observed_at":"2026-08-07T13:21:16.014805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.331563Z","title":"Text-to- speech and speech-to-text converter—voice assistant,","venue":null,"work_id":"dc936632-3870-4f83-8315-5ae67b57f3c0","year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.174219Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:c3da1af3bece14e1dfb1613a631725d10d151183c498c1225a1bd6eb44917e96","observation_id":"e18e24ed-cd8b-4d7d-8e63-2bf24d17ae8d","resolution":{"observed_at":"2026-08-07T13:21:15.393706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.766670Z","title":"AudioGen: Textu- ally guided audio generation,","venue":null,"work_id":"f2776aec-198d-43bb-85d3-6102790918cd","year":null},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.694625Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:d3aeed8b4d00ca2f3fc63daf25726eef81994e4debe19db4d1632547db50fc33","observation_id":"996763e3-ead4-4ff1-ac9d-5384786a0b32","resolution":{"observed_at":"2026-08-07T13:21:15.840924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-12T14:58:46.296119Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T13:21:08.829562Z","title":"UniAudio: An audio founda- tion model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.829562Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:0df28de742bf8ccd1d0a1647eee3de89680d3d85f5740b472f3297ffc28052f7","observation_id":"48e7124c-05e4-43c9-bb0d-10ed4f8b5f88","resolution":{"observed_at":"2026-08-07T13:21:08.829562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.528350Z","title":"Diffsound: Discrete diffusion model for text-to-sound genera- tion,","venue":null,"work_id":"4c3fcd21-cff9-40b6-8828-fb319c2bc338","year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.918467Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:5c8d4756712b04a9868d9e2ae444d41cf793c141b94d6dabc5ea91e60d8de562","observation_id":"a410e71b-55ac-4f22-90e5-3cddaabb01e0","resolution":{"observed_at":"2026-08-07T13:21:15.636832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:08.977066Z","title":"AudioLDM: text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.977066Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:91331aa035df029458375e49706e9c620ee7230b611d7cbee1471506edbac6bd","observation_id":"8fa498a3-943f-43af-bedc-20bed2a17b9e","resolution":{"observed_at":"2026-08-07T13:21:08.977066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.453145Z","title":"Text-to- audio generation using instruction guided latent diffusion model,","venue":null,"work_id":"e4b4f333-7d2c-4cda-95fc-6b9dd4417300","year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.067774Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:a343d713663ac50003e6173dee2538a7b14914654401ac7dddacfa091178b71f","observation_id":"ecd636f1-098b-43a6-bcfa-3be362a7d582","resolution":{"observed_at":"2026-08-07T13:21:15.474788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:14.894634Z","title":"Auffusion: Leveraging the power of diffusion and large language models for text-to-audio generation,","venue":null,"work_id":"fbdee150-129c-4a67-8ffe-47ca47902007","year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.576858Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:2fd10fa70007c8f59d2779f5d2cfd37bb1a47ff2861a8a3e5c0ec42fade831f7","observation_id":"324cf7b1-8a97-45d3-b539-fe17446ad53e","resolution":{"observed_at":"2026-08-07T13:21:14.965027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00146","last_updated":"2024-05-31T19:20:27Z","snapshot_observed_at":"2026-08-12T23:52:52.162998Z","submitted_at":"2024-05-31T19:20:27Z","title":"A Survey of Deep Learning Audio Generation Methods","version":1},"cited_work":{"arxiv_id":"2406.00146","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.00146","snapshot_observed_at":"2026-08-07T13:21:12.403378Z","title":"A Survey of Deep Learning Audio Generation Methods","venue":"cs.SD","work_id":"6898fd66-44d7-428b-aaf5-247b342f9235","year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.219476Z"},"links":{"cited_paper":"/paper/2406.00146","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:28bce0a8cdbd8095ed810508c7eb2d754654d8bd795903e83173cb5eee1991df","observation_id":"2364a185-a311-47ac-8138-ba5b99cdf58f","resolution":{"observed_at":"2026-08-07T13:21:12.508986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17018","last_updated":"2024-04-25T20:24:08Z","snapshot_observed_at":"2026-08-13T00:21:56.274936Z","submitted_at":"2024-04-25T20:24:08Z","title":"Leveraging AI to Generate Audio for User-generated Content in Video Games","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17018","snapshot_observed_at":"2026-08-07T13:21:09.271962Z","title":"Lever- aging AI to generate audio for user-generated content in video games,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.271962Z"},"links":{"cited_paper":"/paper/2404.17018","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:82152fa3f08c75f892ae5459e6eac5f70e57b2f0b08d4e21b6cb4930454d58de","observation_id":"1dc413e4-7aa3-4b26-939f-d7aa7b8798a4","resolution":{"observed_at":"2026-08-07T13:21:09.271962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-12T18:49:23.347422Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-07T13:21:09.317308Z","title":"MusicLM: Generating music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.317308Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:fa0647b866100e090c5b835e4794aabbd8d678ed4dcb2cf078555a5b9c82b115","observation_id":"f5385b2f-81a6-4a07-ba71-c9234fdec4b1","resolution":{"observed_at":"2026-08-07T13:21:09.317308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.171918Z","title":"Neural discrete representa- tion learning,","venue":null,"work_id":"ecdd865d-045f-4e9e-82db-04e40517a10e","year":2017},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.421624Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:23a93e345434ba89fdc92af45ceb1299e876a3c20ce1f23dea2bf4775ad3a2ba","observation_id":"abab167c-2d2b-4f13-b3c8-cd455917149c","resolution":{"observed_at":"2026-08-07T13:21:15.252714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.058021Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":"fa659ad1-00e4-4938-b4f7-bdb437ecc356","year":2022},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.522549Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:841ee09ea0871ed0efdb0573768b47dff23463b74d6e7a885089aa4b9383be5a","observation_id":"5bc62098-92a7-45ed-b6b2-9cba5573bef3","resolution":{"observed_at":"2026-08-07T13:21:15.108186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:14.366702Z","title":"FlashSpeech: Efficient zero-shot speech synthesis,","venue":null,"work_id":"6ae64f64-02cd-4132-8d0c-0af41120d638","year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.261567Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:c8fd95f66f7d412c9343f6035df7661857f1d0d4eb8917d99d506bbe33311216","observation_id":"46e480b0-65a8-49e1-ab75-95129389b619","resolution":{"observed_at":"2026-08-07T13:21:14.428965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:09.620536Z","title":"AudioLDM 2: Learn- ing holistic audio generation with self-supervised pretraining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.620536Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:0934726fd0667d8631db1c3ffa7f62f75f45473f4ad957dc00adac952d92fccb","observation_id":"0e16c682-6918-498c-b935-cff2bebc2bca","resolution":{"observed_at":"2026-08-07T13:21:09.620536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22106","snapshot_observed_at":"2026-08-07T13:21:08.234057Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:08.234057Z"},"links":{"cited_paper":"/paper/2505.22106","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:58fe585a8eae45228b23223cbee5f048777f1ea24f5b8324cef498098100d46f","observation_id":"16b46a8c-60f9-4f40-b30b-ba41836a6fb7","resolution":{"observed_at":"2026-08-07T13:21:08.234057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:14.769161Z","title":"Make-an-Audio: Text-to-audio generation with prompt-enhanced diffusion models,","venue":null,"work_id":"9982f7b1-0e4b-4ca7-aa10-026eb8489508","year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.651250Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:8596d49341cedfd34eac6de0cbe2f1f7746c4992b2e058f91619bb3849033e0d","observation_id":"a2f193fd-a9b1-4eb2-ac91-66b71ca819eb","resolution":{"observed_at":"2026-08-07T13:21:14.820084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-08-08T06:05:53.280034Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-07T13:21:09.950564Z","title":"Make-an-Audio 2: Temporal-enhanced text-to-audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:09.950564Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:9be76bcd7624d4bda0ba3a73c6c86d26a8dfa0aec28996f3a8c5df668583e295","observation_id":"b2d9abc9-eb29-49b2-ae2a-6724abd38d96","resolution":{"observed_at":"2026-08-07T13:21:09.950564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:14.592729Z","title":"ProDiff: Progressive fast diffusion model for high-quality text-to-speech,","venue":null,"work_id":"65e636fb-609f-44fe-b208-34d1230d44ba","year":2022},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.029525Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:c3e3c423ecbc1e0682710ae0ea3bb1c83abc9ef63e4c927e0ef18f82bc943757","observation_id":"a13c1315-f2f5-4809-80ad-cd8b0256f01e","resolution":{"observed_at":"2026-08-07T13:21:14.635611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:14.504422Z","title":"Matcha-TTS: A fast TTS architecture with conditional flow matching,","venue":null,"work_id":"0824b052-ac60-4340-8c50-d3f3e8c02589","year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.165933Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:16dcc144c589f352d9c32a52ae4d4327e369fc3442b637472dba8b4da2659c25","observation_id":"3ada13ed-a7d1-4caa-9419-a39c7fc9f046","resolution":{"observed_at":"2026-08-07T13:21:14.540426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08203","last_updated":"2024-06-12T13:36:03Z","snapshot_observed_at":"2026-08-12T23:44:34.618845Z","submitted_at":"2024-06-12T13:36:03Z","title":"LAFMA: A Latent Flow Matching Model for Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08203","snapshot_observed_at":"2026-08-07T13:21:10.350455Z","title":"LAFMA: A latent flow matching model for text-to-audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.350455Z"},"links":{"cited_paper":"/paper/2406.08203","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:99e05d48dd2cf8dcecf0bca944fcf03f3fae29c77c69a6b554f09e2b06bf9e1f","observation_id":"5ffc9e00-4f0e-45d8-b9bc-1fe82064984c","resolution":{"observed_at":"2026-08-07T13:21:10.350455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:14.238255Z","title":"Flow matching for generative modeling,","venue":null,"work_id":"8a941491-48f9-4892-8f18-46274e7b0d31","year":null},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.475766Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:30fd04e6385fb98db57e876abc78858f30b61d07cb1ab38eb1f86f25159542e8","observation_id":"7ec3dad7-ef41-4a30-9919-bcc876b8f32d","resolution":{"observed_at":"2026-08-07T13:21:14.285099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07303","last_updated":"2024-10-11T16:17:53Z","snapshot_observed_at":"2026-08-12T22:27:00.163000Z","submitted_at":"2024-10-09T17:43:38Z","title":"Rectified Diffusion: Straightness Is Not Your Need in Rectified Flow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07303","snapshot_observed_at":"2026-08-07T13:21:10.583271Z","title":"Rectified diffusion: Straightness is not your need in rectified flow,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.583271Z"},"links":{"cited_paper":"/paper/2410.07303","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:6c4146750caa7f46b46126f6c53b4fec218c6a85fefca29310c3bfa63f29b8de","observation_id":"fbe88115-e341-4950-bd3f-e90f055a59e9","resolution":{"observed_at":"2026-08-07T13:21:10.583271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-07T13:21:10.677989Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.677989Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:8574f91528f01d349aca0fcbe1d082f13b8dd8db45d995e4f11416746f682ce1","observation_id":"f9c77d8b-0246-4051-a7e4-d45db0f0135c","resolution":{"observed_at":"2026-08-07T13:21:10.677989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-12T19:28:23.372660Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T13:21:10.774097Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.774097Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:b00cecaa6d323f8c517fd890a5a0c1bd9483f938aeacb7a952485dde700913b8","observation_id":"0a6d5771-71db-472b-82bb-92b006bdf3e7","resolution":{"observed_at":"2026-08-07T13:21:10.774097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:14.066421Z","title":"Score-based generative modeling through stochas- tic differential equations,","venue":null,"work_id":"97c1122d-8e1a-43a5-b2a2-d567689ac3f8","year":2021},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.866890Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:aea9d44dbb3e3ffcd15f7b844066ab2534558e2ceecb89061e3e8d1d62346a8e","observation_id":"6763064e-4091-4233-8841-c78fdc0626aa","resolution":{"observed_at":"2026-08-07T13:21:14.116228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:13.948783Z","title":"DPM-Solver: A fast ODE solver for diffusion probabilistic model sampling in around 10 steps,","venue":null,"work_id":"ad250cb6-d4ee-4228-86ec-149052518faa","year":2022},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:10.950164Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:b344411f6608fe1af7ef650bc5ac7b0babe8c1f850155189cd5cbc266eb9247f","observation_id":"9943b528-6d4d-4b51-9a29-6f2cf98a9b33","resolution":{"observed_at":"2026-08-07T13:21:13.983818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:13.804524Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":"70e3d6a7-2caa-498b-90d2-0c27111e3978","year":2023},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.066100Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:dadd60a01759e85b4051e7ff3492c9812e77f562e5131d01fe97c6af0589d12a","observation_id":"523944d1-a27b-4916-bfa7-6d27f49aa0ce","resolution":{"observed_at":"2026-08-07T13:21:13.872434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:13.656672Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"b204bc59-4d68-4ce6-9fe1-70eeef75405f","year":2021},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.139122Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:754a318185419ed24e5f250aeea7bb6fcd72582aa73f552be868bd1bc9b33f54","observation_id":"e986f037-d254-4f90-ae00-b759ad7727fe","resolution":{"observed_at":"2026-08-07T13:21:13.716985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:13.551082Z","title":"U-Net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":"f03b9bcd-89d6-47e3-a1f8-0303dfd201d1","year":2015},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.211420Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:5c346bfabc030a95ca080ef3e08bcba484a361d63ad80d5db54deb16a5799381","observation_id":"9cdd219a-716d-46a8-bdd4-f91de6dcc23d","resolution":{"observed_at":"2026-08-07T13:21:13.596152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:13.392146Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":"da8decea-1f72-4e17-b38f-afc6765bae41","year":2021},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.294535Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:8bd5d48f04ddb4a61381f2a3bf00ccccaf6223a422d1117c00d44ca1b0c267a2","observation_id":"96918202-d1eb-4c71-8db5-fdef4e68f3a3","resolution":{"observed_at":"2026-08-07T13:21:13.437880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:11.382160Z","title":"Pseudo numerical methods for diffusion models on manifolds,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.382160Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:624a493b43ddc6a4789422e040638bb542fdeaf4cb95d7d7a60d4fb2967a6fcc","observation_id":"9bda180c-d77b-43b2-a26f-7612f08fa36a","resolution":{"observed_at":"2026-08-07T13:21:11.382160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:13.215906Z","title":"AudioCaps: Generat- ing captions for audios in the wild,","venue":null,"work_id":"4fe0d97c-3c2f-412b-8b53-a99ef142073b","year":2019},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.427230Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:053f67f73e23cb28781d1a06ffb84d4911a6db5b2909036ad6c8c92dc837615c","observation_id":"2a330639-1401-4678-853c-985e8a1b624b","resolution":{"observed_at":"2026-08-07T13:21:13.304432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:13.032053Z","title":"PANNs: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":"81b666dc-3d7f-426d-8efb-3e65366791bb","year":2020},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.509960Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:3c786d31db2d8b5138f972bf149ad8764ba6dce01fd51e599e8f3a1ca91373cd","observation_id":"a975a37b-535a-496c-97cb-93161ad656b1","resolution":{"observed_at":"2026-08-07T13:21:13.105140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:12.888312Z","title":"Diffusion models beat GANs on im- age synthesis,","venue":null,"work_id":"7ccd6a7f-2805-4e5d-b048-27dd76033865","year":2021},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.594091Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:bbc2286eb734ed2857301f71a39370075a4fb0e4898712756383cdac701e7620","observation_id":"6f32bb52-1ab9-450c-b936-ce9cdc111e65","resolution":{"observed_at":"2026-08-07T13:21:12.950137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:12.663769Z","title":"Universal sound separation with self-supervised audio masked autoencoder,","venue":null,"work_id":"37bd98e3-fefb-40f5-9ed9-bcf286391b42","year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.717342Z"},"links":{"citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:26af8c1d12b2c2808f51d92df686d71b1b6400cfc38af9461dba60b4ce43d0ee","observation_id":"95b6400c-3078-4e02-9dba-45955906ecd4","resolution":{"observed_at":"2026-08-07T13:21:12.731719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08425","last_updated":"2025-01-02T03:34:22Z","snapshot_observed_at":"2026-08-12T22:45:54.642687Z","submitted_at":"2024-09-12T23:12:25Z","title":"SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer","version":2},"cited_work":{"arxiv_id":"2409.08425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.08425","snapshot_observed_at":"2026-08-07T13:21:11.941728Z","title":"SoloAudio: Target Sound Extraction with Language-oriented Audio Diffusion Transformer","venue":"eess.AS","work_id":"55e11492-6d0c-4235-898a-ccb2dda72e86","year":2024},"citing_paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:11.797874Z"},"links":{"cited_paper":"/paper/2409.08425","citing_paper":"/paper/2505.22106"},"observation_digest":"sha256:971b6ea2dcfe5f1961ad0c08b414d45a5551ec32a079241ce4d7998f2c84917c","observation_id":"35bd27e7-b1db-4ae1-8f9d-d0c34ea7aa96","resolution":{"observed_at":"2026-08-07T13:21:12.016943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22106","last_updated":"2025-05-28T08:33:58Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T18:03:33.621560Z","submitted_at":"2025-05-28T08:33:58Z","title":"AudioTurbo: Fast Text-to-Audio Generation with Rectified Diffusion"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":2,"verified_fuzzy":25},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 3 inbound Pith citation observations for arXiv:2505.22106."}