{"as_of":"2026-08-24T01:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:64633429a368cf66a4286e006bff45c9d75752541a01279391ba1d6e2a255150","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:37:50.085103Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T01:43:48.555523Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T01:46:13.927285Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"cited_work":{"arxiv_id":"2504.20334","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.20334","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2504.20334 , year=","venue":null,"work_id":"5c9b16ee-1b12-4867-b3f8-db7659bd51c0","year":null},"citing_paper":{"arxiv_id":"2605.05611","last_updated":"2026-05-09T04:00:12Z","snapshot_observed_at":"2026-08-14T11:48:38.526912Z","submitted_at":"2026-05-07T02:57:53Z","title":"X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-08T04:35:58.032597Z"},"links":{"cited_paper":"/paper/2504.20334","citing_paper":"/paper/2605.05611"},"observation_digest":"sha256:ce2a2fa334b24b33bbc59cddd9970884690abc8a11d1cc4500ac4679129bbf21","observation_id":"b7dc7364-8203-41b1-95d8-21e77211b331","resolution":{"observed_at":"2026-05-11T21:41:16.078452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"cited_work":{"arxiv_id":"2504.20334","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.20334","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2504.20334 , year=","venue":null,"work_id":"5c9b16ee-1b12-4867-b3f8-db7659bd51c0","year":null},"citing_paper":{"arxiv_id":"2605.05611","last_updated":"2026-05-09T04:00:12Z","snapshot_observed_at":"2026-08-14T11:48:38.526912Z","submitted_at":"2026-05-07T02:57:53Z","title":"X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-12T01:43:48.555523Z"},"links":{"cited_paper":"/paper/2504.20334","citing_paper":"/paper/2605.05611"},"observation_digest":"sha256:447c50e261ab18bc005a361e7fc66c67c908462336be8ad76cd4c8d08c92e742","observation_id":"7963b79a-0732-4403-8abf-362e45720cc5","resolution":{"observed_at":"2026-05-12T01:46:13.929180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.20334/citation-record","integrity":"/paper/2504.20334/integrity","json":"/paper/2504.20334/citation-record.json","paper":"/paper/2504.20334"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-16T13:36:59.551255Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-16T05:37:49.929144Z","title":"Funaudiollm: V oice understanding and generation foundation models for natural interaction between humans and llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:49.929144Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:39a35fef1afe3bbdac16d8a27b82870e8a3ef87512385c06a1ee353a446c1ade","observation_id":"b5a93af7-4a77-4f06-acc9-21a5cbde97d0","resolution":{"observed_at":"2026-08-16T05:37:49.929144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-16T05:37:49.934584Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:49.934584Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:9b1a72e6d84b9fd30efb7058eae080275781978457fbad8cf782ed89a3864205","observation_id":"7e79d1bf-d1da-42a3-8634-00854d067bfa","resolution":{"observed_at":"2026-08-16T05:37:49.934584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-21T22:45:33.715924Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-16T05:37:49.939311Z","title":"Viola: Unified codec language models for speech recognition, synthesis, and translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:49.939311Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:e7a2db74de513f4112682d5f22e6f9f5091e1629ac6de14d8d0b2ef809f3ceb6","observation_id":"ab803573-9161-44e9-a68d-ec4f9f1e898f","resolution":{"observed_at":"2026-08-16T05:37:49.939311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-18T17:50:58.009731Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-16T05:37:49.943874Z","title":"Naturalspeech 3: Zero-shot speech syn- thesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:49.943874Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:1e5334da68ca071a28010feefd1abaac95f4ecde0829106d237438d1eff771ed","observation_id":"432bd714-4042-4d4c-8fbb-1fde08e92eb6","resolution":{"observed_at":"2026-08-16T05:37:49.943874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18009","last_updated":"2024-09-12T17:45:37Z","snapshot_observed_at":"2026-08-19T20:00:01.315853Z","submitted_at":"2024-06-26T01:38:37Z","title":"E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18009","snapshot_observed_at":"2026-08-16T05:37:49.949120Z","title":"E2 TTS: Embarrass- ingly easy fully non-autoregressive zero-shot TTS,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:49.949120Z"},"links":{"cited_paper":"/paper/2406.18009","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:f29e2404e9a270c30d2c2b6026a0686fd2efa8facde6e7c5732bccfb7935c74f","observation_id":"da9754b8-7a3f-49e2-ae31-f88bc3a5ac2e","resolution":{"observed_at":"2026-08-16T05:37:49.949120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-16T05:58:47.061997Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-16T05:37:49.953894Z","title":"F5-TTS: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:49.953894Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:97dc89d2e8cb91796720b3648186aa50548cef9071bb60576e9a314de40f6262","observation_id":"725c402b-4271-4d0a-9668-e5e7b11984ec","resolution":{"observed_at":"2026-08-16T05:37:49.953894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:37:50.749423Z","title":"Matcha- TTS: A fast TTS architecture with conditional flow matching,","venue":null,"work_id":"bd9d6c95-4a00-43c0-bc84-455f08ca6053","year":2024},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:49.959169Z"},"links":{"citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:90c4010376db1fed5f82ff705364d40251a210e8be4696af55d4e04c371d7054","observation_id":"eb2b5291-506a-4704-bab0-a95331474ca2","resolution":{"observed_at":"2026-08-16T05:37:50.754337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:37:49.963230Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:49.963230Z"},"links":{"citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:5c3e6be105b394c7c0bd5f137d9d2e5a18be8317e03d0db77ec29a2a25fd2c14","observation_id":"c3d6e5ad-4bf4-436b-94c9-88e7c7cf771f","resolution":{"observed_at":"2026-08-16T05:37:49.963230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:37:50.725873Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":"10b96df9-fa96-444f-8e9c-d6bfbfc298b6","year":2021},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:49.967590Z"},"links":{"citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:d01d69df58ed391d0430e3290961b7944757e6b7e88336bafb9c6ae75a2a373b","observation_id":"cf13ed11-3bdb-4ef9-850d-11b37b8169d7","resolution":{"observed_at":"2026-08-16T05:37:50.730584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:37:49.971670Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:49.971670Z"},"links":{"citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:68660e60842b57927f9015bf2d37a35b42ce510f084f23d4341b3195aa1c39a5","observation_id":"1faa44f5-9b63-44b2-bcb2-3f798b55384e","resolution":{"observed_at":"2026-08-16T05:37:49.971670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-16T05:37:49.975725Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:49.975725Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:5ac6e87cc24576bc7d8ebf9e383b266c0e9c1385b353d2eb03fb5ac7d2751835","observation_id":"6d879e7f-d793-4fdd-813f-f08d12e1e117","resolution":{"observed_at":"2026-08-16T05:37:49.975725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:37:50.700502Z","title":"Improved denoising diffusion probabilis- tic models,","venue":null,"work_id":"cedd5542-e447-45d1-9532-87d146258d14","year":2021},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:49.980137Z"},"links":{"citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:6685d3c4c4da59c7d6bb449faa551c90f7377b9ace1a5f81bc97ce62d4ed0792","observation_id":"7821f77c-b65a-4c72-a510-a34e4c2d208c","resolution":{"observed_at":"2026-08-16T05:37:50.705863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:37:50.685520Z","title":"Flow matching for generative modeling,","venue":null,"work_id":"501fda37-0e93-4472-8df8-430274ffe7d1","year":2023},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:49.984733Z"},"links":{"citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:11d8222923fbbc53e0a7c8559902406f4e1b9d8915932f206fd58cb5c1fdc709","observation_id":"36e995a2-b52f-488e-a9aa-289eb79580f9","resolution":{"observed_at":"2026-08-16T05:37:50.690144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.09934","last_updated":"2022-04-21T07:49:09Z","snapshot_observed_at":"2026-08-20T03:27:35.350267Z","submitted_at":"2022-04-21T07:49:09Z","title":"FastDiff: A Fast Conditional Diffusion Model for High-Quality Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.09934","snapshot_observed_at":"2026-08-16T05:37:49.988833Z","title":"FastDiff: A fast conditional diffusion model for high-quality speech synthesis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:49.988833Z"},"links":{"cited_paper":"/paper/2204.09934","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:41994d44366634075a74a415e0051e68b34b361d446b24696486ab24146446c1","observation_id":"88b36217-93b5-4688-8090-15f435e51147","resolution":{"observed_at":"2026-08-16T05:37:49.988833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:37:50.671177Z","title":"ProDiff: Progressive fast diffusion model for high-quality text-to-speech,","venue":null,"work_id":"b3afc7df-2fdb-4ff6-883a-ed5d6f686732","year":2022},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:49.993264Z"},"links":{"citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:4afc2af0bac8002d57f4a5841bfc3818eaf672d2ae2d41959651b137535acb81","observation_id":"0dfddaa3-b92d-4651-8ccf-11b176cf83b5","resolution":{"observed_at":"2026-08-16T05:37:50.675729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01409","last_updated":"2021-04-03T13:53:19Z","snapshot_observed_at":"2026-08-23T14:00:23.790748Z","submitted_at":"2021-04-03T13:53:19Z","title":"Diff-TTS: A Denoising Diffusion Model for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01409","snapshot_observed_at":"2026-08-16T05:37:49.997321Z","title":"Diff- TTS: A denoising diffusion model for text-to-speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:49.997321Z"},"links":{"cited_paper":"/paper/2104.01409","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:ed37cfbdd2e90017841c7e2a2e57a805b64eaca17088f7ce5996ae6d0576ae10","observation_id":"28eeff79-995a-4718-8680-a967211824a5","resolution":{"observed_at":"2026-08-16T05:37:49.997321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:37:50.656200Z","title":"CoMoSpeech: One-step speech and singing voice synthesis via consistency model,","venue":null,"work_id":"35779903-83ba-4a84-a091-f03fc0a76b9d","year":2023},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.001804Z"},"links":{"citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:aaddec493e7773dd04b4886f7b607c2e1d8c3e968c3ece78bf82429e7fbc3f02","observation_id":"8629ada8-baf1-4dc8-be8e-088778faba65","resolution":{"observed_at":"2026-08-16T05:37:50.660852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:37:50.641320Z","title":"Reflow- TTS: A rectified flow model for high-fidelity text-to-speech,","venue":null,"work_id":"93ffe343-5e59-47b4-a845-0cc97eed7d0d","year":2024},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.006202Z"},"links":{"citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:07d3190d2516eb45ae1fc3a0d1e9a337b29aae7b8c0c6b8ebc00c83723df4399","observation_id":"69059aa1-d9d0-43df-b600-84a239fe3092","resolution":{"observed_at":"2026-08-16T05:37:50.646000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:37:50.626730Z","title":"FlashSpeech: Efficient zero-shot speech synthesis,","venue":null,"work_id":"7dd37913-737f-4cbf-b6ff-42fbfa6fc464","year":2024},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.010407Z"},"links":{"citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:603be3ab6aa6d34706ebea6645696c98a9956935711641bc79b9049181f88f17","observation_id":"210e8011-bc56-4a6e-a271-563bb7fb207b","resolution":{"observed_at":"2026-08-16T05:37:50.631239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12154","last_updated":"2025-02-17T18:59:50Z","snapshot_observed_at":"2026-08-16T12:57:35.496151Z","submitted_at":"2025-02-17T18:59:50Z","title":"Diffusion Models without Classifier-free Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12154","snapshot_observed_at":"2026-08-16T05:37:50.014648Z","title":"Diffusion models without Classifier-Free Guidance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.014648Z"},"links":{"cited_paper":"/paper/2502.12154","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:a16938cb1f591a398d80e769cb54e8a854929cb9a2da77e7dfe4ec0eb9512454","observation_id":"c5b798eb-04c4-41e4-b6d2-c138d4416705","resolution":{"observed_at":"2026-08-16T05:37:50.014648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-16T05:37:50.019298Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.019298Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:48a27c5bfba6a0fb0b6efd1aa9fd6f769a4ce84bedb69e035c4821ca9de40248","observation_id":"00164ab1-6cdd-41d5-b386-2ba88884d514","resolution":{"observed_at":"2026-08-16T05:37:50.019298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:37:50.023560Z","title":"Score-based generative modeling through stochastic differ- ential equations,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.023560Z"},"links":{"citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:f0559d42613966878abf555784e1cdd587771b21c24688a29be7fdc757f5868a","observation_id":"a09220d1-a841-42d4-9a19-30e7d1bf5cec","resolution":{"observed_at":"2026-08-16T05:37:50.023560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00482","last_updated":"2024-03-11T14:27:48Z","snapshot_observed_at":"2026-08-17T02:46:52.486829Z","submitted_at":"2023-02-01T14:47:17Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00482","snapshot_observed_at":"2026-08-16T05:37:50.027965Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.027965Z"},"links":{"cited_paper":"/paper/2302.00482","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:ce61f4420a3c69b24603f79454fd57cad2fd3a935c7eefbbf23b4244f5839691","observation_id":"423d892d-2067-4160-ba2d-65fa3f11d895","resolution":{"observed_at":"2026-08-16T05:37:50.027965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:37:50.602717Z","title":"V oicebox: Text-guided mul- tilingual universal speech generation at scale,","venue":null,"work_id":"3b0dbeac-40a2-4ff1-b530-1eafd8da4640","year":2023},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.032549Z"},"links":{"citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:09256b376ce09b0842cda575ce5e9b904eec3098fe68f50ef9211100ab9213e0","observation_id":"784585eb-55bd-4336-9dec-dc1b837f796c","resolution":{"observed_at":"2026-08-16T05:37:50.607634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-16T05:37:50.036778Z","title":"Seed-TTS: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.036778Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:4831a7eacd65d253ecd7fd5e25dbf00b47a665acefb00ba3224c724bb1ffe24c","observation_id":"98ce7513-ac39-40de-80c6-0dd9c84df21b","resolution":{"observed_at":"2026-08-16T05:37:50.036778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-08-19T09:44:27.064800Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-16T05:37:50.041362Z","title":"FireredTTS: A foundation text-to-speech framework for industry-level generative speech applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.041362Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:08eb79daa95b33be50645704f36dbcb3bb6f1534c149a944756fd8b7196054cb","observation_id":"bdad7f93-a227-4a8c-b6d5-1943da6d15a4","resolution":{"observed_at":"2026-08-16T05:37:50.041362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-08-19T01:24:41.802615Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-08-16T05:37:50.045700Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.045700Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:58a7df0ea8d36be9723c0cc697013f26126edffd475494945b3d67973fcb382b","observation_id":"0cbb6ed1-5194-4700-92dc-7d086b5965a2","resolution":{"observed_at":"2026-08-16T05:37:50.045700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:37:50.050165Z","title":"DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.050165Z"},"links":{"citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:bb2c9dde7aeec4a128a627b0f4aedf2e36cbe8f428ebeb1616c6f4932c3a9cbc","observation_id":"852afc43-d050-4183-ae6c-628669d09cf7","resolution":{"observed_at":"2026-08-16T05:37:50.050165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:37:50.588283Z","title":"Frieren: Efficient video-to-audio generation network with rectified flow matching,","venue":null,"work_id":"a3870f39-d445-4c80-bfa0-77b1a7b4c336","year":2024},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.054483Z"},"links":{"citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:9dd94ef4645d6052e6e7be3576087034b9e93e52e713a134624fd48816189c44","observation_id":"a7b95ccc-1d80-48bc-addc-2b338ffdbc6a","resolution":{"observed_at":"2026-08-16T05:37:50.592850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:37:50.573953Z","title":"Null- text inversion for editing real images using guided diffusion models,","venue":null,"work_id":"19080a1a-e901-42e1-8060-84ad645d0cbf","year":2023},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.058847Z"},"links":{"citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:98a3df5123e8d8a842e38cbfb912cb60509db0ac1aaa8bd3801701b1c5264e51","observation_id":"1c8ae97d-9119-4354-a485-507f1924ccbd","resolution":{"observed_at":"2026-08-16T05:37:50.578587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08070","last_updated":"2024-09-12T04:39:16Z","snapshot_observed_at":"2026-08-16T13:43:49.389556Z","submitted_at":"2024-06-12T10:40:10Z","title":"CFG++: Manifold-constrained Classifier Free Guidance for Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08070","snapshot_observed_at":"2026-08-16T05:37:50.062992Z","title":"CFG++: Manifold- constrained classifier free guidance for diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.062992Z"},"links":{"cited_paper":"/paper/2406.08070","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:dcd5e8ce6289b120080689576620f4864383625496a98e673946c19f1180ff49","observation_id":"2299b1f6-a57e-4d82-b9fe-7a14181d294f","resolution":{"observed_at":"2026-08-16T05:37:50.062992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18886","last_updated":"2025-04-03T09:03:32Z","snapshot_observed_at":"2026-08-16T12:47:15.960378Z","submitted_at":"2025-03-24T16:59:57Z","title":"CFG-Zero*: Improved Classifier-Free Guidance for Flow Matching Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18886","snapshot_observed_at":"2026-08-16T05:37:50.067368Z","title":"CFG-Zero*: Improved classifier-free guidance for flow matching models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.067368Z"},"links":{"cited_paper":"/paper/2503.18886","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:9d68b8460515e36c3c1312a00059e7c277b162ae301be56066e14deaa37e1037","observation_id":"f979415a-bb07-4956-93d4-b4d7156e149c","resolution":{"observed_at":"2026-08-16T05:37:50.067368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09000","last_updated":"2024-08-23T17:21:35Z","snapshot_observed_at":"2026-08-20T20:01:39.152895Z","submitted_at":"2024-08-16T20:00:55Z","title":"Classifier-Free Guidance is a Predictor-Corrector","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09000","snapshot_observed_at":"2026-08-16T05:37:50.071822Z","title":"Classifier-Free Guidance is a predictor- corrector,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.071822Z"},"links":{"cited_paper":"/paper/2408.09000","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:1f901452ffc7925f86062907d27d95672a12ef246d64aa5b06c16b6cb4797db8","observation_id":"67e21c6f-1cfe-4778-91dc-685514139090","resolution":{"observed_at":"2026-08-16T05:37:50.071822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-15T16:44:02.859541Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-16T05:37:50.076289Z","title":"LibriTTS: A corpus derived from librispeech for text-to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.076289Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:e70b5f8728072adc9276044aad978e54a0c796642b95e7a76158fb73f3596ac6","observation_id":"796dea0a-6d1f-4805-9a0c-05c3ccfacecd","resolution":{"observed_at":"2026-08-16T05:37:50.076289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T05:37:50.557220Z","title":"Large-scale self-supervised speech representation learning for automatic speaker verification,","venue":null,"work_id":"81965533-2d24-4ab9-9660-707e54b91baa","year":2022},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.080650Z"},"links":{"citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:554f7a5ffa586ad5539e937e77e677689094ac93ead0f0c3f9bb40df63b9c30f","observation_id":"73812b68-fb1a-4a83-948a-59b4d20d498b","resolution":{"observed_at":"2026-08-16T05:37:50.563454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-08-18T17:44:33.818307Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-08-16T05:37:50.085103Z","title":"NISQA: A deep cnn- self-attention model for multidimensional speech quality prediction with crowdsourced datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T05:37:50.085103Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2504.20334"},"observation_digest":"sha256:48b0c254a4302bf2a1ebedada50e613a1dfeb5fed84c24a2a3310d1c26de6192","observation_id":"1926ba2a-b443-45ad-9567-ba7ca98d6dc9","resolution":{"observed_at":"2026-08-16T05:37:50.085103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.20334","last_updated":"2025-05-02T04:16:24Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-20T18:51:04.181230Z","submitted_at":"2025-04-29T00:54:15Z","title":"Towards Flow-Matching-based TTS without Classifier-Free Guidance"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 2 inbound Pith citation observations for arXiv:2504.20334."}