{"as_of":"2026-08-10T10:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a426441f67f3c81da384b3d9f860d98c11418bec0fc31cc2b3c1b4f28895ebba","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:15:55.714499Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:15:52.829136Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:15:55.827429Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"cited_work":{"arxiv_id":"2505.19595","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19595","snapshot_observed_at":"2026-08-07T14:15:55.827429Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","venue":"eess.AS","work_id":"4afa5ceb-c824-4a09-9233-7a8f25d84c41","year":2025},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:52.829136Z"},"links":{"cited_paper":"/paper/2505.19595","citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:5428965f92ce3f2b78a9dac1be6e2f9ae0007beb0cc2b5289a237fb7d2f941d1","observation_id":"7613c17a-498e-42a3-8d17-dd44120f1d7c","resolution":{"observed_at":"2026-08-07T14:15:55.878979Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19595/citation-record","integrity":"/paper/2505.19595/integrity","json":"/paper/2505.19595/citation-record.json","paper":"/paper/2505.19595"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:01.892155Z","title":null,"venue":null,"work_id":"04ec19bf-f2f2-422f-8645-885f21a08982","year":null},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:52.748091Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:04eb8537db6ef13564dca775e2604a28096323db89b34dfa88d5f1688e9e4922","observation_id":"bb7fc26a-ef85-4b17-9cd1-4f8198f10e5c","resolution":{"observed_at":"2026-08-07T14:16:01.965263Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"cited_work":{"arxiv_id":"2505.19595","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19595","snapshot_observed_at":"2026-08-07T14:15:55.827429Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","venue":"eess.AS","work_id":"4afa5ceb-c824-4a09-9233-7a8f25d84c41","year":2025},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:52.829136Z"},"links":{"cited_paper":"/paper/2505.19595","citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:5428965f92ce3f2b78a9dac1be6e2f9ae0007beb0cc2b5289a237fb7d2f941d1","observation_id":"7613c17a-498e-42a3-8d17-dd44120f1d7c","resolution":{"observed_at":"2026-08-07T14:15:55.878979Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:01.715815Z","title":"Dataset We train our model on the LibriTTS [31] dataset, a multi- speaker English corpus containing approximately 585 hours of read speech sampled at 24 kHz","venue":null,"work_id":"3a4e4979-b9c9-4d27-9621-963f3d085442","year":null},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:52.919656Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:c8967d90a1e364b34eddfaedac577e49e8e107c02b7e0ef0d68b39f77d6cc661","observation_id":"01dc9593-8e57-4e1e-a048-8da73aba0b7c","resolution":{"observed_at":"2026-08-07T14:16:01.813339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:01.547774Z","title":"speech align","venue":null,"work_id":"c13d0a4e-cf32-45f1-b85b-b5807509cfb2","year":null},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:53.049253Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:8643484d4018062e70d73063d8823d4824a34db322b29380a953704207ad6762","observation_id":"702f54ac-37a2-4adc-a8b5-3a746a42d4ac","resolution":{"observed_at":"2026-08-07T14:16:01.618499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:01.405443Z","title":"This ap- proach significantly accelerates model convergence while en- hancing the quality of generated speech","venue":null,"work_id":"fdc7ea48-4415-467c-9434-97da58c9d346","year":null},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:53.162304Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:691245bb3adcaad3a4a13622db89291205b516dd60f74f7f7b3a42b76eb54bf2","observation_id":"0faadb96-b8ce-493a-b09d-7274d9b0a12a","resolution":{"observed_at":"2026-08-07T14:16:01.472750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:01.231842Z","title":"In future work, we plan to further op- timize the framework by reducing model complexity and accel- erating inference","venue":null,"work_id":"a52d3aba-4d76-40f3-8c24-6643311deade","year":null},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:53.252705Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:b313b7a1d1ac63d4954f11b697c14feb62ccbf00898333b0e27621669ce677f4","observation_id":"98f04b34-3288-47ce-a147-dd04790540d3","resolution":{"observed_at":"2026-08-07T14:16:01.307516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:01.075430Z","title":"Choi, J.-H","venue":null,"work_id":"d0bfe3d8-7f41-4bd0-bcdf-3fb4dff0c7a5","year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:53.388149Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:81017e9bc05216e8c5a8d268341808542f0cec228596356dce65d5a94addcf45","observation_id":"258d8797-2481-4966-a231-dbe012515b96","resolution":{"observed_at":"2026-08-07T14:16:01.152594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T14:15:53.471613Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:53.471613Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:465fd8c8c502214b5d73431ce25406bbfed53bc3f06e86f08e1d6977e32191b7","observation_id":"6cc1c89c-7940-405c-8b17-9a854be9677f","resolution":{"observed_at":"2026-08-07T14:15:53.471613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T14:15:53.546922Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:53.546922Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:24270923d173580aa8325afe4731f974d12c8adf77c2b96053e863147cd15dc5","observation_id":"1d4d6018-6c07-457a-8bcd-920d8e4b9f3c","resolution":{"observed_at":"2026-08-07T14:15:53.546922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:00.852006Z","title":"V oicecraft: Zero-shot speech editing and text-to-speech in the wild,","venue":null,"work_id":"945cf5e8-78ea-47e5-9c41-14c2d50cb9fb","year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:53.654282Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:88deaa9bb3961c6e9607193e581446e10e1590b94f9f407e483f3170caa07c9d","observation_id":"d2e23561-cb4c-4429-b577-f92f37f4fae7","resolution":{"observed_at":"2026-08-07T14:16:00.980493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-08-07T14:15:53.775073Z","title":"Base tts: Lessons from building a billion-parameter text- to-speech model on 100k hours of data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:53.775073Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:a45be066720f44a1e5798ee93b33a5e980e7f7cf3626a69034b67fb866fc21a8","observation_id":"e6714b00-7472-44e4-8dd7-2f684454f6c5","resolution":{"observed_at":"2026-08-07T14:15:53.775073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08551","last_updated":"2025-05-27T05:07:56Z","snapshot_observed_at":"2026-08-05T05:08:56.833881Z","submitted_at":"2024-07-11T14:36:53Z","title":"Autoregressive Speech Synthesis without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08551","snapshot_observed_at":"2026-08-07T14:15:53.849366Z","title":"Autoregressive speech synthesis without vector quantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:53.849366Z"},"links":{"cited_paper":"/paper/2407.08551","citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:a973205a9677b978df6ae03f7df3431d9f2e288b7e53143f59231860e284bcc7","observation_id":"94639417-d75f-4193-b59b-dd326c03cc02","resolution":{"observed_at":"2026-08-07T14:15:53.849366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:00.697312Z","title":"V oice- box: Text-guided multilingual universal speech generation at scale,","venue":null,"work_id":"d8702128-1f94-497f-91ad-f386d22289f4","year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:53.908404Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:9e664433a71d84095b0f0bcf732583c785796343aca5f1cbbb451390a2431c08","observation_id":"e41f997a-0485-4e23-98ed-f51d6bd54884","resolution":{"observed_at":"2026-08-07T14:16:00.771048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:00.522803Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers,","venue":null,"work_id":"2f175a9c-557e-4ff9-9794-1256f0792b75","year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:53.958470Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:aaf0dcb2ab7b34556a5a3be1fa533ff313aad8a541de49163355a0e5c0e891a2","observation_id":"27bab5ff-4fe7-4713-8a79-6587a2a54bbc","resolution":{"observed_at":"2026-08-07T14:16:00.611342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:00.264427Z","title":"E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts,","venue":null,"work_id":"57102ada-00e5-4a74-9bcc-96174f56ba8a","year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:53.966196Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:dc2c94cd4382733391a0d4e29852ab07e1747ffe01e24142388ccb2ab4c75f27","observation_id":"5c1f7394-f16b-432a-8e9c-fe282429a3cf","resolution":{"observed_at":"2026-08-07T14:16:00.429665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-07T14:15:53.976201Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:53.976201Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:ab6b60861c10fd0b83c9b3deb402714ab6d696bf3f7eadda2182015b75c65dbe","observation_id":"9596f8ff-8a8d-4e9a-8684-6b308bf5e031","resolution":{"observed_at":"2026-08-07T14:15:53.976201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:16:00.039173Z","title":"Ditto-tts: Efficient and scalable zero-shot text-to-speech with diffusion transformer,","venue":null,"work_id":"6cd7894d-fea9-4909-98da-afe7b3fe4b8c","year":2025},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:53.988216Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:630ac805204389f9feebe5bb3e5ba50b32fd28f58618d2c80412b095981d40de","observation_id":"c507b2b2-efe6-46d7-8b42-232f6c1a8f0c","resolution":{"observed_at":"2026-08-07T14:16:00.150992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:59.741719Z","title":"Accelerating codec-based speech synthesis with multi- token prediction and speculative decoding,","venue":null,"work_id":"ae4172d9-80f0-4ad2-acd3-a6fa702fbbf2","year":2025},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.007318Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:05f2f3f85f5661c31a6125af902ba4e731fae6993e90a8a62d3fd319c8cbe5d9","observation_id":"5f3b1eba-920e-48f8-b4c0-9c14da64bfbe","resolution":{"observed_at":"2026-08-07T14:15:59.913822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07855","last_updated":"2024-06-12T04:09:44Z","snapshot_observed_at":"2026-08-05T04:07:33.037081Z","submitted_at":"2024-06-12T04:09:44Z","title":"VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07855","snapshot_observed_at":"2026-08-07T14:15:54.026219Z","title":"Vall-e r: Robust and efficient zero-shot text-to-speech synthesis via monotonic alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.026219Z"},"links":{"cited_paper":"/paper/2406.07855","citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:949f0b45b12226ffcc90056c3d9650b615c71f5f6d4fae6b1b8f8c774bef955e","observation_id":"578d911b-13af-4ec7-899d-516c8e495232","resolution":{"observed_at":"2026-08-07T14:15:54.026219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:59.465245Z","title":"Vall-t: Decoder-only generative transducer for robust and decoding-controllable text-to-speech,","venue":null,"work_id":"fc5dbf1d-69b3-4928-a883-5b6adf121c23","year":2025},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.054161Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:b9356c90514cd7aee648ced343151ce8ef6488e6b7cfae1ffba481fbe2d167a8","observation_id":"37e878e4-81ed-4917-b258-be620ad63813","resolution":{"observed_at":"2026-08-07T14:15:59.607420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:54.088901Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.088901Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:0103361e27cbe0cf18de15f3d1ce4d4973b3bef97da4f96d34cc93e117024888","observation_id":"e4889d69-d0b6-4e18-94b5-6db5a6357eba","resolution":{"observed_at":"2026-08-07T14:15:54.088901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:54.124824Z","title":"Scalable diffusion models with transform- ers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.124824Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:ee02c043f68cbecea50116296a1b5676ec6b7261d42de1066b633c4a5d71b8b3","observation_id":"8e022587-4e6e-4444-8ab2-63d0c33e41af","resolution":{"observed_at":"2026-08-07T14:15:54.124824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:59.242960Z","title":"Efficient diffusion training via min-snr weighting strat- egy,","venue":null,"work_id":"e6ec65a8-61fc-41a1-b117-8736d2d24cde","year":2023},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.161703Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:7c4c81525fe79b14cd619c9fdd0a63ebfc8b5a3ff621feed3930d52531c7b247","observation_id":"bf7e6c63-0eae-4340-ae2d-04e1ecd0ec97","resolution":{"observed_at":"2026-08-07T14:15:59.323953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:59.175310Z","title":"Fasterdit: Towards faster diffusion transformers training without architecture modification,","venue":null,"work_id":"342b3ce9-de07-4436-8102-248709df3071","year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.235356Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:5412d2c5c6932a67345ee97f25608d061c3c2e423dff7647a736912bdf635a99","observation_id":"7e709a39-c473-4410-b4e4-20bf79475049","resolution":{"observed_at":"2026-08-07T14:15:59.205251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:59.033071Z","title":"Representation alignment for generation: Training diffu- sion transformers is easier than you think,","venue":null,"work_id":"1b1d4d58-e51a-4d81-abcb-0e7be931bd0b","year":2025},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.329789Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:f23efb71bdb2024f3b8ba8b1703c48f65a3cb06bd5fae290fe048663fc7fae44","observation_id":"e9e50506-c6bb-495b-98d0-e26ff9e6bf4d","resolution":{"observed_at":"2026-08-07T14:15:59.124774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:58.777026Z","title":"U-net: Convolutional networks for biomedical image segmentation,","venue":null,"work_id":"934b6c37-cfe4-4cf7-a966-4e8ade0dba95","year":2015},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.427902Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:c9871ed54afa8de6518f0bee46ac06977363749222e901b8d2fdee5a83c8349f","observation_id":"c2174071-aecc-4622-8714-9a44830d98e4","resolution":{"observed_at":"2026-08-07T14:15:58.895075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:54.493555Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.493555Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:77b76df62fbaddf248e57f3b704fd7f72f378c0556dc328518f9e2dedca962b1","observation_id":"8d6618dd-846d-4943-9b46-f4f7c3b948a5","resolution":{"observed_at":"2026-08-07T14:15:54.493555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:58.483855Z","title":"Con- nectionist temporal classification: Labelling unsegmented se- quence data with recurrent neural networks,","venue":null,"work_id":"c2b072aa-21a0-488b-a764-d92db4e05068","year":2006},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.571933Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:e478dc9cb57886a8a8c0d62055f3ae3481e3243b90621ce3cf2061b89435bbd9","observation_id":"a3b9ff3e-2fcf-4bf6-b73e-6b2a7743199f","resolution":{"observed_at":"2026-08-07T14:15:58.617541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:58.153702Z","title":"Intermediate loss regularization for ctc- based speech recognition,","venue":null,"work_id":"c60a930a-5e1a-452c-a1ba-7f2d6117def4","year":2021},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.646730Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:adf5d70799e8fa15cd8a1916dd59751a5e2dde1cb6453174e24c28a9611e7571","observation_id":"9f3a332f-2942-4462-a4da-9d66d61fe7de","resolution":{"observed_at":"2026-08-07T14:15:58.310597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:57.972581Z","title":"Audio-visual efficient conformer for robust speech recognition,","venue":null,"work_id":"4e97e6c9-0d9f-438d-92ba-040b2de53393","year":2023},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.691350Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:e8ea1311f1775ae275553386901d2b4d3669bc3ad2b9583d1d6b4a25f6373c8d","observation_id":"64a576d3-3564-423d-a154-bf4847c85770","resolution":{"observed_at":"2026-08-07T14:15:58.067644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:57.739555Z","title":"Speechtok- enizer: Unified speech tokenizer for speech large language mod- els,","venue":null,"work_id":"15a67d30-fbc8-406e-a6b0-02edc026d465","year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.760242Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:5b76f9f434c94256533f2c5be32e21a6f17899c00654e4f6bb750db55d6d5950","observation_id":"12af8411-e6e6-4a18-afc5-e109460d64a5","resolution":{"observed_at":"2026-08-07T14:15:57.827126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:57.588103Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":"7747271a-d0bf-431d-9a3d-d9ce55491618","year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.810329Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:8c657f80716a334fc44ce2a7a2e69459f6492e34a4da3c23d701bb0e129403a3","observation_id":"dfce062a-4b05-4457-ad8e-f42ebb911f27","resolution":{"observed_at":"2026-08-07T14:15:57.646947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:57.389271Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":"e0263bc0-d2bc-47bf-957e-d20c08ba4d43","year":2021},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.866978Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:46c59d5aea074222d074df96df229d8569a02c3e8bfa0c9bfd05111e4a971f5a","observation_id":"afad2a94-9925-4ab6-bb5f-c3a1503d52ce","resolution":{"observed_at":"2026-08-07T14:15:57.497847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:57.193018Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":"eec2471d-9641-482e-8359-3e1e4fdf43e8","year":2022},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:54.956368Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:99c552413b6f133832e9f6523c3f09b3cc6a4dc4063979af3f0304321144aa8c","observation_id":"803692c3-015b-466b-8cbe-2b7465842a7f","resolution":{"observed_at":"2026-08-07T14:15:57.264673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:57.036761Z","title":"W2v-bert: Combining contrastive learning and masked language modeling for self-supervised speech pre-training,","venue":null,"work_id":"66ab74af-a959-49b6-a0e4-db4377d63e9f","year":2021},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.056539Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:cac412d505bc845798df0feb842927f27be3ebfc622beb50be3dbd22bfd724b3","observation_id":"9d8afcab-636c-4abe-8b1d-ef87767ad15e","resolution":{"observed_at":"2026-08-07T14:15:57.123506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T14:15:55.127465Z","title":"Cosyvoice: A scalable multi- lingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.127465Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:0f42a71cb193b874083fb736d5640756dd1d65657df1ea06b941540234e4ba42","observation_id":"e3641322-96fe-4ba8-8d41-73fac6cef310","resolution":{"observed_at":"2026-08-07T14:15:55.127465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-07T14:15:55.201763Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.201763Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:655c616f5eeda352e40d235d52a3f72850283c0ebb09e9962847e912b893ffa7","observation_id":"594d5d61-61ff-4221-becd-05815f436794","resolution":{"observed_at":"2026-08-07T14:15:55.201763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:56.850649Z","title":"Libritts: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":"8d246d49-2f3c-439e-ab46-8181b5e2e220","year":2019},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.262774Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:b9f30cff13087ba8b06be4a039113cadf12ba3a1aa76c493977047079a5c5323","observation_id":"35f5bfe1-7bfc-40ea-98c9-3231adacf766","resolution":{"observed_at":"2026-08-07T14:15:56.922439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:56.754598Z","title":"Lib- rispeech: An asr corpus based on public domain audio books,","venue":null,"work_id":"d2c6728c-ade2-4640-ba8b-28975db1f676","year":2015},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.319566Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:0f75448a6fc2d897c01ce40d6cbadf139721dc91c890ced612a24a74aacd80a6","observation_id":"80e28793-afc4-4762-8796-e84d592efcdd","resolution":{"observed_at":"2026-08-07T14:15:56.795579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:56.607793Z","title":"Convnext v2: Co-designing and scaling convnets with masked autoencoders,","venue":null,"work_id":"d98c808e-d3f5-4e93-a45b-d39aa7925fb4","year":2023},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.396629Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:99d1f57561f61fed748679da73ae9558c72ee9a1b283a59b46a5165e8a31cad3","observation_id":"697a294c-cd83-46f6-bcda-2ebe01d793fb","resolution":{"observed_at":"2026-08-07T14:15:56.689787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:55.469364Z","title":"Decoupled weight decay regulariza- tion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.469364Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:86a1a51da186b945e2b2f3ef104e794c0b78462eedbb9a3db08c4629b3c82aba","observation_id":"53c028ee-ac48-4ef9-be5f-9f625d05ba04","resolution":{"observed_at":"2026-08-07T14:15:55.469364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:56.438698Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":"dd01f39f-7456-452e-bcd2-8f75cf5b8fdf","year":2024},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.566232Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:f1c146d8f68f07210e34109bf5e72be7e0e711259de18a814784b9498a332db8","observation_id":"f1a62001-924d-4777-95bb-7a89c40b6917","resolution":{"observed_at":"2026-08-07T14:15:56.516535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:56.308136Z","title":"Librispeech-pc: Benchmark for evaluation of punctuation and capitalization capabilities of end-to-end asr mod- els,","venue":null,"work_id":"ec4164d6-65b4-454f-94a4-f0cf949fa13d","year":2023},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.604506Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:fe00a5095ac17f27617db83aa93368f1d40057f0603230f5a509c3eedc0e65e3","observation_id":"03fb12a6-8584-435b-a51b-19c107223dbd","resolution":{"observed_at":"2026-08-07T14:15:56.364968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:56.166925Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":"1f5a3b79-d7f5-40d9-b9cd-a3c648102de4","year":2023},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.657348Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:5626a00c98ea939d8f09875e0738e8f83583ca47895e87109115be4766ddc540","observation_id":"f1d8e692-c73e-4f5f-b7e5-6a6bb1df7fa6","resolution":{"observed_at":"2026-08-07T14:15:56.244826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:55.955837Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":"2cbe2e0a-fad4-44d8-a588-3de54e4f27c1","year":2022},"citing_paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.714499Z"},"links":{"citing_paper":"/paper/2505.19595"},"observation_digest":"sha256:32dbceef4891345d7dab262828b74fdd4e8d673c96f57cda8d60d6fe2f2b0cdb","observation_id":"9292437f-a354-4340-a186-9c6b2b4d6cf5","resolution":{"observed_at":"2026-08-07T14:15:56.033418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19595","last_updated":"2025-05-30T16:52:09Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T14:09:00.316829Z","submitted_at":"2025-05-26T07:07:16Z","title":"Accelerating Diffusion-based Text-to-Speech Model Training with Dual Modality Alignment"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2505.19595."}