{"as_of":"2026-08-09T22:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ae72dad5123c00bbc807b83d402ac1ea1d89d1e80b1808fb58b5a1dd9e73e923","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:23:17.839718Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:23:15.143902Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T03:07:35.840013Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15380","snapshot_observed_at":"2026-08-07T15:23:15.143902Z","title":"The text encoder tokenizes input text into fine-grained sequences, and in some cases, further transforms them into high-dimensional se- mantic representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.143902Z"},"links":{"cited_paper":"/paper/2505.15380","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:d9bdb3fa3f40b33700e3026649ec79e06a4b8b108e4d4b71cd335b3748e14da6","observation_id":"24a1e843-44d3-47ad-8717-7485443a8ae8","resolution":{"observed_at":"2026-08-07T15:23:15.143902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"cited_work":{"arxiv_id":"2505.15380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15380","snapshot_observed_at":"2026-07-03T03:07:35.840013Z","title":"Aiwei Liu, Minghua He, Shaoxun Zeng, Sijun Zhang, Linhao Zhang, Chuhan Wu, Wei Jia, Yuan Liu, Xiao Zhou, and Jie Zhou","venue":null,"work_id":"7807d459-f543-40c3-90d2-b2810050f636","year":2025},"citing_paper":{"arxiv_id":"2603.04592","last_updated":"2026-04-19T16:23:58Z","snapshot_observed_at":"2026-08-03T02:05:46.790260Z","submitted_at":"2026-03-04T20:37:30Z","title":"From Static Inference to Dynamic Interaction: A Survey of Streaming Large Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T16:16:15.819622Z"},"links":{"cited_paper":"/paper/2505.15380","citing_paper":"/paper/2603.04592"},"observation_digest":"sha256:78ae770ebb9dca895f29e16b1be68b2c3f1b010cd9993a6388dfb5e129bf8d55","observation_id":"604113b4-449c-4a4e-96fe-878d568fd995","resolution":{"observed_at":"2026-05-15T16:20:09.985065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"cited_work":{"arxiv_id":"2505.15380","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15380","snapshot_observed_at":"2026-07-03T03:07:35.840013Z","title":"Aiwei Liu, Minghua He, Shaoxun Zeng, Sijun Zhang, Linhao Zhang, Chuhan Wu, Wei Jia, Yuan Liu, Xiao Zhou, and Jie Zhou","venue":null,"work_id":"7807d459-f543-40c3-90d2-b2810050f636","year":2025},"citing_paper":{"arxiv_id":"2606.09019","last_updated":"2026-06-08T04:32:08Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T04:32:08Z","title":"TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T15:27:01.142747Z"},"links":{"cited_paper":"/paper/2505.15380","citing_paper":"/paper/2606.09019"},"observation_digest":"sha256:7cede2d235f1e6c929f6f1dc481ce6eb45c2b9eedb4a5143f61afe9759da6065","observation_id":"21d9457d-92a3-4e8f-b128-efbb9d054d0e","resolution":{"observed_at":"2026-07-03T03:07:35.841608Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15380/citation-record","integrity":"/paper/2505.15380/integrity","json":"/paper/2505.15380/citation-record.json","paper":"/paper/2505.15380"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15380","snapshot_observed_at":"2026-08-07T15:23:15.143902Z","title":"The text encoder tokenizes input text into fine-grained sequences, and in some cases, further transforms them into high-dimensional se- mantic representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.143902Z"},"links":{"cited_paper":"/paper/2505.15380","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:d9bdb3fa3f40b33700e3026649ec79e06a4b8b108e4d4b71cd335b3748e14da6","observation_id":"24a1e843-44d3-47ad-8717-7485443a8ae8","resolution":{"observed_at":"2026-08-07T15:23:15.143902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:20.282022Z","title":null,"venue":null,"work_id":"fcc687fd-4775-4ff5-8f88-f351ff2a3717","year":null},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.251633Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:712e92d46820ec52f91e32a3e63f6e1c291c953596ac2591e1e0a8a6db2ac914","observation_id":"872514fb-4d98-49e1-b55c-dc839c255d33","resolution":{"observed_at":"2026-08-07T15:23:20.322728Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:20.162898Z","title":"Implementation Details We use CosyV oice 2 [5] as the target model, which is a highly efficient TTS model consisting of 24 layers of Transformer adapted from Qwen2.5 (0.5B) [28]","venue":null,"work_id":"966b5ee3-2ca7-4aad-b858-24b0d593512a","year":null},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.340413Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:8131f3977a6b896c0ae3b5d331274f97e871dc8426ae188d4244946612de0508","observation_id":"c9abe58f-1ca2-4bb9-9030-9ceffc84b2af","resolution":{"observed_at":"2026-08-07T15:23:20.207630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:20.032368Z","title":"train-clean-100","venue":null,"work_id":"83cf15cf-8e52-4c77-93cc-3a1ea6f27c01","year":null},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.389309Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:d7f4628b66271f1812a49d211059793cbb567ca396f0454de9dff364205b653e","observation_id":"10d1f27b-e487-43a9-a148-445c0eb55121","resolution":{"observed_at":"2026-08-07T15:23:20.077043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:19.912042Z","title":null,"venue":null,"work_id":"c2158339-67ec-4049-b5ba-0230b93c4a7c","year":null},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.452371Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:09ca98b37db6a205c9644c9f54494bcd3ce6bd143fbf3845bdff691d75d9d90c","observation_id":"db1db276-7d3c-46cd-a6a8-faf31224f583","resolution":{"observed_at":"2026-08-07T15:23:19.959504Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:19.785052Z","title":"We propose a lightweight draft model constructed by fine- tuning a few parameters from the target model","venue":null,"work_id":"4347de05-a42c-45e0-a42a-1ecd666da6a6","year":null},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.507290Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:c6bbc34f8f4c0aa073644c3557a1fcec205497873b34c4eedc0c75f9aabdc870","observation_id":"33f18f76-31ce-491f-83c9-11ec38c10b5a","resolution":{"observed_at":"2026-08-07T15:23:19.855401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:15.551203Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.551203Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:40795ea3e36605145d63a09f35eaf1dd0ae69ccd0482958ae9d4e3dcce8b015e","observation_id":"3c42f3aa-6462-4a62-bcbd-6ad8ddce9fe4","resolution":{"observed_at":"2026-08-07T15:23:15.551203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T15:23:15.575777Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.575777Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:160f5f06c783990b6f1e58c865b00a688c79569b251d72a8a594ab6d2591c706","observation_id":"9b69b132-0295-4655-a468-effbb30fa8e2","resolution":{"observed_at":"2026-08-07T15:23:15.575777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-07T15:23:15.604779Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.604779Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:1ac02c026981a0da387d1099b0730c06370fb32d9152118803b90ed3497229e2","observation_id":"64fe4a74-6347-4730-9265-6015099d6104","resolution":{"observed_at":"2026-08-07T15:23:15.604779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T15:23:15.641196Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.641196Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:e9255c98b9aa2f0d67ea865d8802079d2ea27e3fccc3125db7d7fb6ab32ecf0a","observation_id":"ca8bfa3e-ec9a-44ad-b667-1584f0572553","resolution":{"observed_at":"2026-08-07T15:23:15.641196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T15:23:15.731823Z","title":"Cosyvoice: A scalable multi- lingual zero-shot text-to-speech synthesizer based on supervised semantic tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.731823Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:46fe0fb59f165b5e9808dec3b4b334567da4d703db6118677ae4cb9665d8e9b7","observation_id":"b4e28ec6-9b36-419d-98bc-e27196d76e11","resolution":{"observed_at":"2026-08-07T15:23:15.731823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-07T15:23:15.777675Z","title":"Cosyvoice 2: Scalable stream- ing speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.777675Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:6594a3e01cf7c88faf1bd38254999cf5b898aee2e1531e0cef4b3a765c91669a","observation_id":"5cb08c7b-a74c-4ae4-a7ba-6089eeb595af","resolution":{"observed_at":"2026-08-07T15:23:15.777675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01156","last_updated":"2024-11-09T05:58:10Z","snapshot_observed_at":"2026-07-06T19:43:59.326124Z","submitted_at":"2024-11-02T07:04:02Z","title":"Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01156","snapshot_observed_at":"2026-08-07T15:23:15.813372Z","title":"Fish-speech: Leveraging large language models for advanced multilingual text-to-speech synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.813372Z"},"links":{"cited_paper":"/paper/2411.01156","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:12e9a07b608acf499a8855e1df0ee6c94715b65ac3400998be6c27a8c3fc95df","observation_id":"d8383ff8-ddd2-4fd7-8b0c-546f08809e16","resolution":{"observed_at":"2026-08-07T15:23:15.813372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-07T15:23:15.859744Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.859744Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:dc836aa493366b035824060a6cae59411d5354eda16b3c9832f05dab79c178b2","observation_id":"6ba236b4-77cf-483f-80a7-d4709efe4c0d","resolution":{"observed_at":"2026-08-07T15:23:15.859744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:19.656455Z","title":"Speak, read and prompt: High-fidelity text-to-speech with min- imal supervision,","venue":null,"work_id":"fe9a12a9-f917-4c23-8e42-eb6a201d3acf","year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:15.956802Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:ff0dc81b5bb37259230f676a0b0a9e66b0a55cc2777ba5e26d8fea9caca66bd3","observation_id":"0f465032-5e78-48ef-a896-195465f89196","resolution":{"observed_at":"2026-08-07T15:23:19.709640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-08-07T15:23:16.017706Z","title":"Base tts: Lessons from building a billion-parameter text-to-speech model on 100k hours of data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.017706Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:0f6735ed39072350b2f392515f5d6f314cf80d9cc42fe4f7d87c69e4e1e06617","observation_id":"3cff66e8-7686-4e37-902f-7bfdff761efa","resolution":{"observed_at":"2026-08-07T15:23:16.017706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:19.444877Z","title":"VoiceCraft: Zero-shot speech editing and text-to-speech in the wild,","venue":null,"work_id":"f1cf76b7-f8ce-4151-80ca-11e5bae9f377","year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.073254Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:e3ec5ebb7c0b23c94f52cc34aa8daecb25b1859e8d3bf51dc4ed02385e065f54","observation_id":"3468eeba-dae0-47ae-b1a0-87c518360087","resolution":{"observed_at":"2026-08-07T15:23:19.586294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-08T23:01:50.650593Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-07T15:23:16.151902Z","title":"Uniaudio: An audio founda- tion model toward universal audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.151902Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:219912eee8c7c80470fadc44a9632ce10cd79481be8a93777443112b449a1268","observation_id":"6c5afbac-e9d2-4862-8f5f-cab96a22e33d","resolution":{"observed_at":"2026-08-07T15:23:16.151902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:16.203599Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.203599Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:4f1181dd36f1e4346983692a93e3bc270de90401f2c1f7a345d92b7d4be8815a","observation_id":"a96e4fd3-69c0-4ab7-a063-bf77ecc4dab8","resolution":{"observed_at":"2026-08-07T15:23:16.203599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:16.281099Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.281099Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:54d9c68d0d4f1ffecfa6b0cbde24390c00fa5e223390c1dd7a1d739c5814bf0c","observation_id":"c9f75ea3-9fc1-4e6a-8739-017b35a216f1","resolution":{"observed_at":"2026-08-07T15:23:16.281099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:16.349834Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.349834Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:fdfaf7e76ec8ab73a141df546578e422afa9d7e14a37b911217a6aa3ee405e52","observation_id":"89ddf565-d73b-4efd-97b4-1068b845d91e","resolution":{"observed_at":"2026-08-07T15:23:16.349834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:16.414472Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.414472Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:ea7600b00aa2b8bc56d36761279aa34f04189cd6104aa93ffd81b6615f46ced0","observation_id":"d701b6bc-99c1-4a21-a74d-12fe62439679","resolution":{"observed_at":"2026-08-07T15:23:16.414472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:16.481026Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.481026Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:21ab9218b30499aaa1817d7b05f04fd6e0e0976e4cdb6a8e7c581c9139a442fc","observation_id":"487eff77-b90a-407b-9ddb-4ad995b087d2","resolution":{"observed_at":"2026-08-07T15:23:16.481026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:16.568587Z","title":"Vits2: Improving quality and efficiency of single-stage text-to-speech with adversarial learning and architecture design,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.568587Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:bba3d2afb20c3f54ba1379db23015eb08f6a39bcf21361e0aecf1be69d56aff6","observation_id":"470d2aea-2acf-4d9f-8e6e-a118df1b37ba","resolution":{"observed_at":"2026-08-07T15:23:16.568587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-07T15:23:16.617519Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.617519Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:3166d4edb8083b170d8bf263906fc7e3a16a2add2a39dd61b57c3c12e4726a8f","observation_id":"7e9d3fe9-a6cf-4a45-9a8f-3ca81cfaf868","resolution":{"observed_at":"2026-08-07T15:23:16.617519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-07T15:23:16.693219Z","title":"Naturalspeech 3: Zero-shot speech syn- thesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.693219Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:2bd9fe3d6aabf61ffba974717714e6d36afc20960853d9bfb90a2b5f491e84b4","observation_id":"3d0cc4b9-8fbd-42a0-85b2-d587cbc04dad","resolution":{"observed_at":"2026-08-07T15:23:16.693219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:16.781575Z","title":"E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.781575Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:e5bc880e16e55aeadc72e041041bd1553916133a6cf80d9f5a8d36bdf289419f","observation_id":"197fe7f3-9c56-4e98-896f-ecffdbbe174e","resolution":{"observed_at":"2026-08-07T15:23:16.781575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:16.886672Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:16.886672Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:1682631d339b15d2bd258e1bd7f90abde99a3b3fd0d831e6400cc9ad2df92fbe","observation_id":"d5181814-bea1-419c-a700-9e0471be7a48","resolution":{"observed_at":"2026-08-07T15:23:16.886672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-07T15:23:17.015468Z","title":"Accelerating large language model decoding with speculative sampling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.015468Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:74cf1fe418dc82ceb1ff20975ec2d80c60f8dbb6b21f1efe67c7024968bf9c8b","observation_id":"e62cdb9c-53a5-4ab2-a29a-da9d01cecb95","resolution":{"observed_at":"2026-08-07T15:23:17.015468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:17.116127Z","title":"Fast inference from transformers via speculative decoding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.116127Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:15534591b93e289be5d743f6577115021afa4627295e20dd3c9a9a70aaf60fad","observation_id":"3f8448db-da43-45bd-8af1-f70057db5367","resolution":{"observed_at":"2026-08-07T15:23:17.116127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:19.107192Z","title":"Accelerating codec-based speech synthesis with multi- token prediction and speculative decoding,","venue":null,"work_id":"65742b51-9434-4332-8966-29bb3c021a77","year":2025},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.237630Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:f1b572d8099351367037500f4d20fdcd3eff75d5663b741454996e210f434f44","observation_id":"6d462931-f02b-46b1-8917-3aa7eab461fd","resolution":{"observed_at":"2026-08-07T15:23:19.182314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:18.848731Z","title":"Fast and high- quality auto-regressive speech synthesis via speculative decod- ing,","venue":null,"work_id":"060e9f99-3f50-438d-a9d6-c861bf4d05ee","year":2025},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.345738Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:c3c1cf37d2fe8dcbcbc3eb1251cde119ff3ff105494564b0c1398448a22d109a","observation_id":"5d031e44-2e1a-4046-9a31-3445e80e2638","resolution":{"observed_at":"2026-08-07T15:23:18.969777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:17.482133Z","title":"Parameter-efficient transfer learning for nlp,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.482133Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:2cc5d9c4574902502cd72d62c3c82515e63dacbc0d3cc098c89ba262cebbae65","observation_id":"d0629482-ebf6-4d76-95d3-6b775180c0b9","resolution":{"observed_at":"2026-08-07T15:23:17.482133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:18.506296Z","title":"Efficient adapter transfer of self-supervised speech models for automatic speech recogni- tion,","venue":null,"work_id":"7f72ee7e-5d59-4d4f-9e6c-dd6e25f1a2a5","year":2022},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.592839Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:41de33307dbaa89a74b00a7c1587d2f23f8aff947c2952b4bd7481fc482f6061","observation_id":"99a912a4-5304-4ad4-999c-7f8e935d24d8","resolution":{"observed_at":"2026-08-07T15:23:18.640010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:23:17.675437Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.675437Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:06129bfd9ac5555a096bbf825e0cee22c72c465f97b9a00d18b21c0653f03a47","observation_id":"a8cae2a1-88b7-4f1b-b646-e638af413132","resolution":{"observed_at":"2026-08-07T15:23:17.675437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-07T15:23:17.733722Z","title":"Libritts: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.733722Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:833354009c468c9c282f29fcc37fcedb40dd7f0c3abc1429c6cec038c644306d","observation_id":"9406f94a-5627-4515-a080-dbe4ed64e775","resolution":{"observed_at":"2026-08-07T15:23:17.733722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:23:18.277519Z","title":"Unicats: A unified context-aware text- to-speech framework with contextual vq-diffusion and vocoding,","venue":null,"work_id":"540602a5-8ccc-4c48-80d8-9a16a0be0f46","year":2024},"citing_paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:17.839718Z"},"links":{"citing_paper":"/paper/2505.15380"},"observation_digest":"sha256:0156a5f9b311fde9ff8aa42fb68f8098c629442ca702e2989a974f6004061b85","observation_id":"341f9f31-33d0-4522-9639-33909a0b7b13","resolution":{"observed_at":"2026-08-07T15:23:18.378283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15380","last_updated":"2025-06-03T03:01:24Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T23:24:21.256440Z","submitted_at":"2025-05-21T11:17:04Z","title":"Accelerating Autoregressive Speech Synthesis Inference With Speech Speculative Decoding"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 3 inbound Pith citation observations for arXiv:2505.15380."}