{"as_of":"2026-08-10T12:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e790ee7e87e72a4b0bc42047c08b343bdbce8bddc3c0e516d3cfac9a98405ced","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:09:21.978557Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:09:17.790140Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:09:22.202944Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"cited_work":{"arxiv_id":"2505.19931","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19931","snapshot_observed_at":"2026-08-07T14:09:22.202944Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","venue":"eess.AS","work_id":"91ca44c9-b2dc-4eeb-9fc3-080bd143ea2b","year":2025},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:17.790140Z"},"links":{"cited_paper":"/paper/2505.19931","citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:f9bde7f87f1d122c53b40c27d9d3bfd4bbed6fb6305ecb51182c3cf4a4c2cbda","observation_id":"b2d45a79-0e24-4778-83be-8dfdd4d75c84","resolution":{"observed_at":"2026-08-07T14:09:22.304038Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19931/citation-record","integrity":"/paper/2505.19931/integrity","json":"/paper/2505.19931/citation-record.json","paper":"/paper/2505.19931"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:26.997908Z","title":null,"venue":null,"work_id":"47fc28be-e7e8-4648-9700-c83eaba6ba06","year":null},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:17.710909Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:256a154792473783d3da5ee90507e3cd1f9b4a9aeacb18fafdb903fe4531e8f6","observation_id":"833af4bd-6ec8-4fc9-9f43-057dfcafb1ab","resolution":{"observed_at":"2026-08-07T14:09:27.136051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"cited_work":{"arxiv_id":"2505.19931","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19931","snapshot_observed_at":"2026-08-07T14:09:22.202944Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","venue":"eess.AS","work_id":"91ca44c9-b2dc-4eeb-9fc3-080bd143ea2b","year":2025},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:17.790140Z"},"links":{"cited_paper":"/paper/2505.19931","citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:f9bde7f87f1d122c53b40c27d9d3bfd4bbed6fb6305ecb51182c3cf4a4c2cbda","observation_id":"b2d45a79-0e24-4778-83be-8dfdd4d75c84","resolution":{"observed_at":"2026-08-07T14:09:22.304038Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:26.794936Z","title":null,"venue":null,"work_id":"361c248a-31de-4a30-8893-d3806e31c165","year":null},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:17.913467Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:16b2e8fdd466bedf827cf1b3806ab9afec6d724d0a55a4acdcb703d3981b60fa","observation_id":"d908993a-a4d3-4a7b-aa87-c7b505f39f2d","resolution":{"observed_at":"2026-08-07T14:09:26.894993Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:26.453471Z","title":"Setup Baselines","venue":null,"work_id":"5002c16b-1a3f-4d6c-b3aa-5e953d106928","year":null},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:18.032752Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:30e214595926913d031a3cb1f547afeb974237a6bc4e1aa0a039d4a947c2206a","observation_id":"b29dd7fc-698b-458b-a56e-ed63be51e2c8","resolution":{"observed_at":"2026-08-07T14:09:26.630572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:25.829338Z","title":null,"venue":null,"work_id":"05cf1df8-6e22-454a-83b8-54fae7fadce2","year":null},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:18.329225Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:370d11272732e15ab829ef9dd045ce339e2ee9f962a502f9bf3d2d2ebb26cc09","observation_id":"74270a73-3427-4686-ba11-8dfc8b9aa3e5","resolution":{"observed_at":"2026-08-07T14:09:25.994265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:25.622261Z","title":"U23B2018 and No","venue":null,"work_id":"01da3405-c1be-4be6-8396-86f49810af95","year":null},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:18.466105Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:021b0015be72f74b12d4731d120ee452d7641455aec2389d7db21c80d54951bb","observation_id":"bdc7e683-b8b1-422e-bfda-b94050802db0","resolution":{"observed_at":"2026-08-07T14:09:25.752212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:19.240224Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:19.240224Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:21c052ca862a3eeec9ced1dac199625c8e067f5a717f7ee2b2b1207a91753f52","observation_id":"251ef0cc-0a20-44a7-bc65-7bb6071fe80c","resolution":{"observed_at":"2026-08-07T14:09:19.240224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:25.365520Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":"0c409415-305f-4118-b933-9b35f8fe3b69","year":2023},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:18.543512Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:406f440725ece7ee6aa1abfab03d3456497e481eda5ac872dad1a1eeb12eb247","observation_id":"41a2e567-a3f5-478a-b645-78cf8f326abf","resolution":{"observed_at":"2026-08-07T14:09:25.505324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-08-07T14:09:18.662267Z","title":"BASE TTS: Lessons from building a billion-parameter text-to-speech model on 100k hours of data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:18.662267Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:c9fd3debe6258b24c5e9cd11d0e27dd1c8dad0ba2a25d540f7900ac3992360f1","observation_id":"d5fbba8c-c4de-4e24-80ce-2f7dffc1e352","resolution":{"observed_at":"2026-08-07T14:09:18.662267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:25.095113Z","title":"V oiceCraft: Zero-shot speech editing and text-to-speech in the wild,","venue":null,"work_id":"965c844b-47cb-46e2-843e-34d6239ee249","year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:18.760763Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:90b3f3b5e8295817a26e308002147aa251b26ee55280580966fd4dd6c10020da","observation_id":"2b4b6fda-367a-4857-a8dd-6ea3b5814775","resolution":{"observed_at":"2026-08-07T14:09:25.198101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T14:09:18.881600Z","title":"Seed-TTS: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:18.881600Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:07eaa48ca05f7a89e05514e9f45302f7bf3fe619c12dff846775072b15179802","observation_id":"8d788c02-3a57-4d3a-9989-b5a4490215d9","resolution":{"observed_at":"2026-08-07T14:09:18.881600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08551","last_updated":"2025-05-27T05:07:56Z","snapshot_observed_at":"2026-08-05T05:08:56.833881Z","submitted_at":"2024-07-11T14:36:53Z","title":"Autoregressive Speech Synthesis without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08551","snapshot_observed_at":"2026-08-07T14:09:18.989987Z","title":"Autoregressive speech synthesis without vector quantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:18.989987Z"},"links":{"cited_paper":"/paper/2407.08551","citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:59aca9123f5fd957bd507b6c53a5813248ac50e13f9acd20ea9000372fe4f7db","observation_id":"684f42d8-25fd-44d4-bc51-97933e6dced9","resolution":{"observed_at":"2026-08-07T14:09:18.989987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-07T14:09:19.122272Z","title":"CosyVoice 2: Scalable stream- ing speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:19.122272Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:620e0f307218531f8a03b12bec44bf2173a5a9f97419327f4f8d69d358935735","observation_id":"6984a866-e405-425e-a30e-c7a29aa8b3a2","resolution":{"observed_at":"2026-08-07T14:09:19.122272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.852914Z","title":"Flashspeech: Efficient zero-shot speech synthesis,","venue":null,"work_id":"20a15841-8e80-4236-a167-21b02ac77ad6","year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:20.115305Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:19ecb57b6745db97cab81f2eddfdbc7c35cf8833ef1d5252563591bf3c2e3c42","observation_id":"f88baa60-07be-4a96-93d4-d4fd0ccd9cdc","resolution":{"observed_at":"2026-08-07T14:09:23.992868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:24.854256Z","title":"NaturalSpeech 3: Zero-shot speech syn- thesis with factorized codec and diffusion models,","venue":null,"work_id":"6ca45d2c-d400-42ee-98c6-b6da38b91e77","year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:19.356258Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:223c223ef2e64acc2c0b3357ba74e8b7a7aca2c91b1303ddf9744c381bbbb150","observation_id":"371d11e3-772b-43c2-90e5-66f7d3129b07","resolution":{"observed_at":"2026-08-07T14:09:24.965302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:24.620376Z","title":"E2 TTS: Embarrassingly easy fully non-autoregressive zero-shot tts,","venue":null,"work_id":"b134fb85-28a1-4e3a-814d-3d2eb6f9ce3a","year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:19.465221Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:632504df3c4fe0bf237f01d76f1c3b4c3f352a74f7a968f016c9a83a313a4599","observation_id":"9305a402-9ae2-4fbf-9798-81d8a363a45f","resolution":{"observed_at":"2026-08-07T14:09:24.727077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-07T14:09:19.616970Z","title":"MaskGCT: Zero-shot text-to- speech with masked generative codec transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:19.616970Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:ea5649df7f1c4b648d03883dbea8a3a5104bbec5d41fca1ab0eb01fb70d3d730","observation_id":"9ba44ab7-e2ce-4b97-b982-f296b1bfdde9","resolution":{"observed_at":"2026-08-07T14:09:19.616970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-07T14:09:19.712665Z","title":"F5-TTS: A fairytaler that fakes fluent and faith- ful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:19.712665Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:0eafa36329bef633f6eaa6c782c21266fa25e7ade7baeec4e1618e133569f244","observation_id":"41799ee3-71cf-4f7b-946d-f5e93b852970","resolution":{"observed_at":"2026-08-07T14:09:19.712665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:24.369856Z","title":"Naturalspeech 2: Latent diffusion models are natu- ral and zero-shot speech and singing synthesizers,","venue":null,"work_id":"17fda78b-a64f-401a-ae70-53479d88e2ab","year":2023},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:19.865268Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:79d45b08ce3539d7e32a0ba4c1d2fe67efed7b28f921fb7b64d9ba695f9d6ff4","observation_id":"08b4c5b3-1170-45c1-a765-7c3edd8bbc23","resolution":{"observed_at":"2026-08-07T14:09:24.491965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:24.146600Z","title":"Flow matching for generative modeling,","venue":null,"work_id":"928f054f-4da9-4a77-8376-5576bc775597","year":2022},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:20.019809Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:57a1bd27ca8c8b6cea436ea8d5519d8dbad0ad8b10edb2c1cb4c755d35c3488b","observation_id":"17c5c258-3e93-4b08-94f2-f983a1c4fd47","resolution":{"observed_at":"2026-08-07T14:09:24.256787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11097","last_updated":"2025-02-20T02:07:55Z","snapshot_observed_at":"2026-07-06T19:33:30.263638Z","submitted_at":"2024-10-14T21:17:58Z","title":"DMOSpeech: Direct Metric Optimization via Distilled Diffusion Model in Zero-Shot Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11097","snapshot_observed_at":"2026-08-07T14:09:20.827232Z","title":"Dmdspeech: Distilled diffu- sion model surpassing the teacher in zero-shot speech synthesis via direct metric optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:20.827232Z"},"links":{"cited_paper":"/paper/2410.11097","citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:7c08194658341460365007a31b281a52c3c3d33ac429d49e2f59621628700cb1","observation_id":"a8aae7e9-da11-4c45-a8ee-211bf39df1fe","resolution":{"observed_at":"2026-08-07T14:09:20.827232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-08-07T14:09:20.217151Z","title":"Latent consistency models: Synthesizing high-resolution images with few-step infer- ence,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:20.217151Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:1670f3abd7b6710ede16e2fed31e12fa40ca1dfd4be438d4c41774f4c9ca2af5","observation_id":"a5bad944-e113-4a06-8a24-54f311e028d1","resolution":{"observed_at":"2026-08-07T14:09:20.217151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.638349Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow,","venue":null,"work_id":"13548476-ff7c-4fe8-857c-bc9d80752906","year":2023},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:20.300038Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:b82d8e7d2dfc1548fa8295e94b59617ffa01a7d6984c0a2b206dd82e07c86cae","observation_id":"ab173b98-c8d8-45a0-b397-53ad21a74863","resolution":{"observed_at":"2026-08-07T14:09:23.784637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.478382Z","title":"One-step diffusion with distribution matching distillation,","venue":null,"work_id":"25d4c858-a1f8-47f1-b472-e4f1430b0340","year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:20.370668Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:0be7790810c5ecf0a8cc8300d1da0ed825feecedc7cbbc962905367efdbe3dd4","observation_id":"e124aefa-74cf-4d60-82b1-0205d922c0a5","resolution":{"observed_at":"2026-08-07T14:09:23.532183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.282470Z","title":"Improved distribution matching distillation for fast image synthesis,","venue":null,"work_id":"f75ca67a-90c6-4ef0-8972-e8a2020e0aa5","year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:20.489667Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:c8cce1d23dee2ae4277326429976458e2ff8bdb77d543c4b37b450ffd88fc9c9","observation_id":"99ebb059-0973-4a04-ba54-396442ffb6dc","resolution":{"observed_at":"2026-08-07T14:09:23.388656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:23.108844Z","title":"V oiceflow: Efficient text-to-speech with rectified flow matching,","venue":null,"work_id":"6e0fe269-05a1-4346-a4d1-4ab764b6331f","year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:20.624976Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:68fa0496a1a9fe20994d6b3e07f028fbff35b25011274fd5ed65f5265abcdb23","observation_id":"92312d31-4257-4686-8e20-50ce1b56e034","resolution":{"observed_at":"2026-08-07T14:09:23.206030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:26.152445Z","title":"All measurements are performed on single NVIDIA RTX 3090 GPU to ensure consistent hardware conditions","venue":null,"work_id":"120d6f56-1e01-4278-b595-813aa7dfd4d1","year":null},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:18.171011Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:bce27a8197757c4459b83733cb645b81e3c8d1a7bbe49deb46f4c435d4e92a66","observation_id":"c2d5babc-5448-4bc1-812b-4f790f6bf6e7","resolution":{"observed_at":"2026-08-07T14:09:26.291774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-08-07T14:09:20.716820Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:20.716820Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:630a98773f2c5735106f5df93e5faa66d548d87f7755486350ea3073b2b8af63","observation_id":"409fb9d5-cb23-48db-a668-1044ea7a94e1","resolution":{"observed_at":"2026-08-07T14:09:20.716820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T14:09:20.957067Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:20.957067Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:d7a4a5e8febe21dbba2b5afa5c2890b85348aca238d99e960d67d94e4463e54c","observation_id":"1c17b967-96a2-4dab-ae22-72df9037102a","resolution":{"observed_at":"2026-08-07T14:09:20.957067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.096404Z","title":"Scalable diffusion models with transform- ers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:21.096404Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:97f010a0974e2650d02236fa0fed7c09b8845610c892952f9995f4ad49f459ad","observation_id":"b74a2ead-2055-4bb1-b258-19768e64983b","resolution":{"observed_at":"2026-08-07T14:09:21.096404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:22.849257Z","title":"Convnext v2: Co-designing and scaling convnets with masked autoencoders,","venue":null,"work_id":"7eeba7d0-b50d-42ec-a1a6-18073fb2e469","year":2023},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:21.256740Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:77e0322bb146946c22c34e1af8d040c46cbcadd2e6b5b9971ba6129a12d4ca63","observation_id":"22b49046-9fab-4464-93d6-aa4854da86f7","resolution":{"observed_at":"2026-08-07T14:09:22.953147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.343004Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:21.343004Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:68e8333f15a8363859a18cc2f788939030148d8814ad04139ebff4a74208b48d","observation_id":"63cf9ddb-25b8-49e3-bf24-99942b41f735","resolution":{"observed_at":"2026-08-07T14:09:21.343004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:22.646240Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":"5cd36b76-7197-456c-a3fa-113d0668566a","year":2023},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:21.420951Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:8a51964c90519aba932ea5a3017c51c938ef2f443afe9bc3551b197db133d9f9","observation_id":"88557af0-f388-4c21-bd07-5ba4fa4ec765","resolution":{"observed_at":"2026-08-07T14:09:22.738335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:22.447653Z","title":"LibriSpeech-PC: Benchmark for evaluation of punctuation and capitalization capabilities of end-to-end asr mod- els,","venue":null,"work_id":"c99a3e9b-4338-4605-b7e7-7d24184d783d","year":2023},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:21.513116Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:c66cd6c0e101bb0ed835ad5414d21b59cb3777c6fa9a4d6a6d5034d53b5fd069","observation_id":"b3bb9008-d1c6-4c8b-a2d7-d47575f68110","resolution":{"observed_at":"2026-08-07T14:09:22.525712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.635133Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:21.635133Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:abbb398832c3bc9ea11303a28f0f09d3e05eebdcda6ea6e236b447987ebf793a","observation_id":"34134a67-4d3d-4f83-8ef2-fd2e7af92e61","resolution":{"observed_at":"2026-08-07T14:09:21.635133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-01T16:05:21.888603Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T14:09:21.735893Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to- end speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:21.735893Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:e296f5514addaa70f1bccea4da474db46d217b72c1332da3ec61fc645c866e8f","observation_id":"90899022-b9f2-4eb0-b263-3c169974ec9f","resolution":{"observed_at":"2026-08-07T14:09:21.735893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.844478Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:21.844478Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:0e657d0374e0282967f0311d32b7e3f9aa97b9550674b5a69467b2cf1c4f1c06","observation_id":"0a384c2e-ad52-43f6-a61c-cf2f639d9683","resolution":{"observed_at":"2026-08-07T14:09:21.844478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:09:21.978557Z","title":"UTMOS: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:21.978557Z"},"links":{"citing_paper":"/paper/2505.19931"},"observation_digest":"sha256:c2749c6a4ab3b581e6f4564dda012be2e3b3ff3a7351d256abff9d715ba7e27d","observation_id":"298d4cb5-81ce-4c41-a23d-7a84b1156450","resolution":{"observed_at":"2026-08-07T14:09:21.978557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19931","last_updated":"2025-06-04T11:58:27Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T14:01:21.072790Z","submitted_at":"2025-05-26T12:58:27Z","title":"Accelerating Flow-Matching-Based Text-to-Speech via Empirically Pruned Step Sampling"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2505.19931."}