{"as_of":"2026-08-17T06:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cdfe5550bcd5b1ee38a3aeaaad13e4fd90f72cf51334a07ee09d1515bb644e50","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:52:04.191022Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12570/citation-record","integrity":"/paper/2506.12570/integrity","json":"/paper/2506.12570/citation-record.json","paper":"/paper/2506.12570"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T03:30:12.735656Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:52:01.571286Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:01.571286Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:23d130228d7ecb956b9eaf690a2b160537b498fd7f80546876438a9f9cd77645","observation_id":"bf49560b-b22b-4a55-bc8b-a52da9d87aef","resolution":{"observed_at":"2026-08-07T00:52:01.571286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:07.766966Z","title":"Audiolm: A language modeling approach to audio generation,","venue":null,"work_id":"250e8766-7ae0-4c25-b2a5-81b2f54f7213","year":2023},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:01.613360Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:c0d04b31c863e3f3c33c46d04a7264feac8edb7c214934df4f903493ff8cd947","observation_id":"bca8a2f3-7387-45e2-9b6f-e2b86e6e457e","resolution":{"observed_at":"2026-08-07T00:52:07.859576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:01.712370Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:01.712370Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:44e0c7074f802b290a690e8edaca8e3e0e0b1c5d332012434a639effbe7b7d30","observation_id":"f2786bbc-8f4c-4d59-89ae-3d62f6eb06f4","resolution":{"observed_at":"2026-08-07T00:52:01.712370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:01.782086Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:01.782086Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:dbf2f8185e97b82eef321df75cc682c73ac939f3ed1b741ed5fbc4faba39a60a","observation_id":"09327ca5-7b3b-4ede-a6c2-08250ab64b36","resolution":{"observed_at":"2026-08-07T00:52:01.782086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:01.901321Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:01.901321Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:a1a043d38468dabb72491c657fe2faa91c94644b09ffb4338cfc9e5646d818dd","observation_id":"b570ac72-c91a-4522-928a-e9ceca604e5f","resolution":{"observed_at":"2026-08-07T00:52:01.901321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:07.511032Z","title":"V ALL-E 2: Neural codec language models are human parity zero-shot text to speech synthesizers,","venue":null,"work_id":"e0b146f2-5df0-49ee-b10e-24d1169fa349","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:01.985281Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:92986c568e3041a0b0417178af1e8af78494df52a912d060e203accd78576408","observation_id":"18b91231-a431-4427-b361-ebbc14d04113","resolution":{"observed_at":"2026-08-07T00:52:07.616899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:07.323714Z","title":"CosyV oice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic to- kens,","venue":null,"work_id":"80d6d74f-a3dc-43e2-93d7-ecb386fa9b3f","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.050554Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:2461df84b574b72efee5c0486bbe5de7e6c6fd6cac7cd2d99855ab04dc60fb8d","observation_id":"15a4defa-8156-4b3a-902d-49cd85587af8","resolution":{"observed_at":"2026-08-07T00:52:07.417375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:07.215354Z","title":"Seed-TTS: A family of high- quality versatile speech generation models,","venue":null,"work_id":"fb1a75e8-ed25-41a4-95d0-1c27a94d738b","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.180105Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:80f7bd66541bacf525cba8eb9e5118d9ea4b0c1fed9e36eb4bd39286abac2b13","observation_id":"b9089ddd-2bd8-46f9-94c8-a6a0b10a4ec5","resolution":{"observed_at":"2026-08-07T00:52:07.317431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-07T00:52:02.203070Z","title":"Cosyvoice 3: Towards in-the-wild speech genera- tion via scaling-up and post-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.203070Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:bd7f740d069976ad9c1ddc12da7d7db5cc07b939056ddd5a08b562a595d630b7","observation_id":"8bfc3e62-250f-40b5-b08d-a9fb8af1b6eb","resolution":{"observed_at":"2026-08-07T00:52:02.203070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:07.065881Z","title":"Pseudo-autoregressive neural codec language models for efficient zero-shot text-to-speech synthesis,","venue":null,"work_id":"b3ba3d5d-f7f5-41f8-9d3d-f4805f1202ea","year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.264484Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:34aa937ace3bc15d5bdbd564c5125233a0cce8e5186c90fbe4bea17cc0b4519f","observation_id":"7a4cf7c7-35da-4e8f-be7a-fe8607cfd06e","resolution":{"observed_at":"2026-08-07T00:52:07.129504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:06.928088Z","title":"Autoregressive speech synthesis without vector quantization,","venue":null,"work_id":"6cd32467-247e-4f75-935f-e85d6897363e","year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.305103Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:5bba537176d465322ad3d19289a23567261c448080b2226907828558f84242ea","observation_id":"604d4ff9-0d40-492c-a316-7f8b8ab3404e","resolution":{"observed_at":"2026-08-07T00:52:06.990494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:06.828461Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models,","venue":null,"work_id":"0b9b43af-ca82-4c05-9ff4-ede7fb0fb883","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.351297Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:f6b709385296900649bfbcf4b002006f9ba3615e80cc7082bc452f7982a16704","observation_id":"d6f696a4-cffe-4f11-ae11-587f4073529b","resolution":{"observed_at":"2026-08-07T00:52:06.879628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:06.683302Z","title":"Interleaved speech-text language models are simple streaming text to speech synthesizers,","venue":null,"work_id":"7fb93247-4563-41ec-9f01-570c02fc0c91","year":null},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.392778Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:5b83e27a6018b2f54255f18b68418f9d44d0a0220a043aeb71b61740f8879641","observation_id":"412ef6ee-0c2f-4a1f-b7b2-7d5c4a68b520","resolution":{"observed_at":"2026-08-07T00:52:06.747229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19669","snapshot_observed_at":"2026-08-07T00:52:02.492729Z","title":"Zero-shot streaming text to speech synthesis with transducer and auto-regressive modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.492729Z"},"links":{"cited_paper":"/paper/2505.19669","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:7ea50103244c364f3922ecadd5968332b766e154b049c4afd683df69c7d16f9e","observation_id":"ad5cbb77-9e8e-4f73-ad1a-344020d4bdf4","resolution":{"observed_at":"2026-08-07T00:52:02.492729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:06.578309Z","title":"Syncspeech: Low-latency and efficient dual-stream text-to-speech based on temporal masked transformer,","venue":null,"work_id":"374b7a53-7ec6-4ef2-86f5-e71d31c35f85","year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.548264Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:5e697a0a55a30ef32a7cf4172f5772b297beb0794404750b750d68dfcbe0b27a","observation_id":"254d6ae7-804d-420e-bdcc-a5b0db8c718d","resolution":{"observed_at":"2026-08-07T00:52:06.604284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:06.437226Z","title":"Discrete audio representation as an alternative to mel-spectrograms for speaker and speech recognition,","venue":null,"work_id":"6480919d-89e8-463d-9cfb-065f0336066b","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.596251Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:f644ca934f3e6aedb5bf40fa61fa12dad8413a0e3669eea8139a1400c7084c6a","observation_id":"8d3e0bf1-4ff6-4c04-8ce3-36988ce854e1","resolution":{"observed_at":"2026-08-07T00:52:06.522611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:06.286913Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis,","venue":null,"work_id":"9936ce7f-0469-4493-897b-e820c67176da","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.665547Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:91e345cf14e1e249fdddc043d6d80cde7a919d38693b572b4ac1a3a1a1f1e105","observation_id":"72d6443a-abea-45aa-87b7-dbf0dd6e7ea1","resolution":{"observed_at":"2026-08-07T00:52:06.344259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-08-16T13:42:07.461220Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-07T00:52:02.719163Z","title":"Autoregressive image gen- eration without vector quantization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.719163Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:ef7fefe30031aedb421ef2f1cf847c643527af664867a232c0e6049dd8b8b635","observation_id":"7b78f69d-f61f-4bc9-87f5-6da2c7246e5b","resolution":{"observed_at":"2026-08-07T00:52:02.719163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:06.158331Z","title":"FELLE: autoregressive speech synthesis with token-wise coarse-to-fine flow matching,","venue":null,"work_id":"490becb4-6239-481c-ba36-0827b7a4f402","year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.782039Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:87afad5ba648ce0efd16b4619523625e434857f14d36f9746c721e93c79df450","observation_id":"67d72c9a-6b5f-4763-8b44-4b5490c36bdc","resolution":{"observed_at":"2026-08-07T00:52:06.224882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:02.873718Z","title":"Ditar: Diffusion transformer autoregressive modeling for speech generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.873718Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:6df0320460c9eaa47487990abfb51890672b2b8df7b4337e9491fe39c62ad0fb","observation_id":"4c47da4f-c6a1-4481-95c1-2ef253ecaca8","resolution":{"observed_at":"2026-08-07T00:52:02.873718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:02.939608Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.939608Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:7815bf468db55a45ae25289f15f26ffb92ca506928b36d73447f1ea554fdd7a1","observation_id":"36ccc01f-48dc-49d0-91d7-a45a98b8938b","resolution":{"observed_at":"2026-08-07T00:52:02.939608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:05.981557Z","title":"Tacotron: Towards end- to-end speech synthesis,","venue":null,"work_id":"de473cd9-5766-42dc-a1d1-04e5ef7f20f4","year":2017},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.055590Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:3f8b2e9278799b4b661084c7db23f7a534b28854c1321c7b8dd8288feaf4e710","observation_id":"7082f2ce-2d21-48db-abde-1422f8f5d842","resolution":{"observed_at":"2026-08-07T00:52:06.061420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:05.856597Z","title":"Librispeech: an ASR corpus based on public domain audio books,","venue":null,"work_id":"444ff17a-3e77-4779-a6d3-93d06c238733","year":2015},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.132846Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:dcbecbb50d65fbd44261c8f4287d7fa2a904f87c8a9275aed631a3afc4f6c286","observation_id":"99733192-e98e-40c2-9b61-e859f987b52d","resolution":{"observed_at":"2026-08-07T00:52:05.895076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:05.711010Z","title":"V ALL-E R: robust and efficient zero-shot text-to-speech synthesis via monotonic alignment,","venue":null,"work_id":"9bc1afae-c9ae-4b1c-b3b0-ee8b1d0ce3fc","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.223595Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:d48088174f647651d46dbbbd7a866cfbd6891ffab44517fb4f959c3b93b8a6b7","observation_id":"1e041d1c-da61-40fa-b08a-35a0d788755a","resolution":{"observed_at":"2026-08-07T00:52:05.762832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:05.531311Z","title":"F5-TTS: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":"479f4975-1af3-4502-9cbe-4ae351c782da","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.285128Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:0d1712a287e3a6d89ae7c475dc8efaca4904521e1a07da995ad004a286139d2d","observation_id":"6d419976-a6ed-4cf3-9dd7-97606372ab49","resolution":{"observed_at":"2026-08-07T00:52:05.621674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:05.409127Z","title":"MaskGCT: Zero-shot text-to-speech with masked generative codec transformer,","venue":null,"work_id":"8c94949c-b7f8-44e8-bff9-41123e17c8d6","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.385295Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:9f55449a0767b46c943e0f356eb8c34c099cfb27cfb2a000fa0ec94a185fcc1c","observation_id":"f6a18580-b41c-42af-b442-e71d1614e80c","resolution":{"observed_at":"2026-08-07T00:52:05.442194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:05.271108Z","title":"Ramp: Retrieval-augmented mos prediction via confidence-based dynamic weighting,","venue":null,"work_id":"0cc24038-1dd3-4a04-9a19-81abb75d8ab9","year":2023},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.475605Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:b1651f3e6779418a93adf142368851a7a420c11b90cc94180d29538d7b5f1b18","observation_id":"7afb6a5c-1d16-46c5-9b28-d3f2c1bd98c9","resolution":{"observed_at":"2026-08-07T00:52:05.327200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:05.173694Z","title":"Ramp+: Retrieval-augmented mos prediction with prior knowledge integration,","venue":null,"work_id":"2e295dc3-84e2-4c15-a78a-41fa019c7bf7","year":2025},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.590269Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:286a9eb008df592426131b74794c4d40ba021da475d362d53be50c98bf9096c9","observation_id":"462c7a9a-7137-421b-829c-2e2aaa8cb3ec","resolution":{"observed_at":"2026-08-07T00:52:05.232775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-15T19:06:16.181826Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-07T00:52:03.732161Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.732161Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:486f38acf1d8e1a808b0f52a8bba78754db61998356b1b1eb7ba079715b326db","observation_id":"7d1701fd-bfef-49fa-abcc-e7495a5d0181","resolution":{"observed_at":"2026-08-07T00:52:03.732161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:05.075500Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"a4f0d1ba-c05a-4acd-85fb-7ec6b56d1b15","year":2021},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.807837Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:82fff1e899518137d6a14fd74e88be8785c7ca029829ac7473c16d277c4921d2","observation_id":"204c52a3-173f-43c0-a320-2e4a4bc4181b","resolution":{"observed_at":"2026-08-07T00:52:05.107680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-08-16T23:32:22.645653Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T00:52:03.933734Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:03.933734Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:0715f09842ce2e93df489a515511459b4adfb12cc759824681fca08409c12766","observation_id":"ef7dbf33-7411-4e07-87b9-bc4450a22762","resolution":{"observed_at":"2026-08-07T00:52:03.933734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:04.943293Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"7464c67e-794e-45d8-b1f5-c0ad2c4938c8","year":2022},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:04.039029Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:4d2a88126369b853a1ee61b69c0a066add38130e7957acdf6490f05a4600ea83","observation_id":"50132868-6da2-4174-9ba8-8a8d3b9a67df","resolution":{"observed_at":"2026-08-07T00:52:05.018828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:04.753589Z","title":"Libriheavy: a 50,000 hours ASR corpus with punctuation casing and context,","venue":null,"work_id":"f3da2e52-ae8d-48d3-89db-0a61a211da49","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:04.109157Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:45dc7949c82caf1aa868a3766723ecd8e2f106b3249a726f34c7f5fd31ad4031","observation_id":"63c65484-ae4f-4ce4-80a1-aa28b396b6c3","resolution":{"observed_at":"2026-08-07T00:52:04.863237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:52:04.599966Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":"24073f45-52c4-40a2-87f8-67b2bf62dd0a","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:04.191022Z"},"links":{"citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:a24287d79a185b48869cb3d2b32b3275617d8565253d2778dd91c350161aec08","observation_id":"68ed7cca-35c7-4bf2-bf63-e61243bf22fc","resolution":{"observed_at":"2026-08-07T00:52:04.682115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16102","last_updated":"2025-08-09T10:01:51Z","snapshot_observed_at":"2026-08-17T04:17:21.239733Z","submitted_at":"2024-12-20T17:43:50Z","title":"Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":"2412.16102","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16102","snapshot_observed_at":"2026-08-07T00:52:04.433992Z","title":"Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis","venue":"eess.AS","work_id":"ebc6ca5e-7b48-4dcf-9ddd-d8573306b39d","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.441261Z"},"links":{"cited_paper":"/paper/2412.16102","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:8251629c6e6cfc3dff43710580ec21133f32352f64f69e8c53db40b704d4b672","observation_id":"2f204fc6-c3d9-4824-bc3b-a67581bde4cc","resolution":{"observed_at":"2026-08-07T00:52:04.503082Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T18:08:07.584912Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2506.12570."}