{"as_of":"2026-08-15T18:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a9042b8ef3369aa9fbec44ef03f99d5660d2bf9e6fec0cc59592181f707faf20","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:46:23.404901Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:46:23.292385Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T04:46:23.543943Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"cited_work":{"arxiv_id":"2412.01100","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.01100","snapshot_observed_at":"2026-08-12T04:46:23.543943Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","venue":"cs.SD","work_id":"52e7c76c-40ba-4d27-a406-8bf685044422","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.292385Z"},"links":{"cited_paper":"/paper/2412.01100","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:6b031ddb3f25805284a01e20f898def7591b8fec56406a7c0a0b650188e14785","observation_id":"a5953255-227d-4271-9788-83a2cc98c164","resolution":{"observed_at":"2026-08-12T04:46:23.547969Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01100/citation-record","integrity":"/paper/2412.01100/integrity","json":"/paper/2412.01100/citation-record.json","paper":"/paper/2412.01100"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.783291Z","title":"On the one hand, TTS systems need to accurately replicate the target speakers’ voice, including their timbre, pitch, and prosody, using voice cloning techniques","venue":null,"work_id":"8d79036b-3f5b-47dd-ad25-79abdfcf3425","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.285394Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:2a33b1c1ec1e0ed09552f255a4a535618350a88b559ed4a3ad05c35da171720e","observation_id":"1190a25e-e7b2-4c45-889b-8d3fc6a7410d","resolution":{"observed_at":"2026-08-12T04:46:23.787300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"cited_work":{"arxiv_id":"2412.01100","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.01100","snapshot_observed_at":"2026-08-12T04:46:23.543943Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","venue":"cs.SD","work_id":"52e7c76c-40ba-4d27-a406-8bf685044422","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.292385Z"},"links":{"cited_paper":"/paper/2412.01100","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:6b031ddb3f25805284a01e20f898def7591b8fec56406a7c0a0b650188e14785","observation_id":"a5953255-227d-4271-9788-83a2cc98c164","resolution":{"observed_at":"2026-08-12T04:46:23.547969Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.772018Z","title":"Firstly, we will overview the text represen- tations and the discrete speech tokens, and then introduce the LLaMA-based codec language model with a delay pattern","venue":null,"work_id":"bcc0ea27-9107-4598-a52a-11af538386fb","year":null},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.296336Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:7bc73c3495afc8c02eb5ec147929e926c34d39af617108f86c29b8888045ee6c","observation_id":"592e28c6-cd5f-4b2a-98ac-9cdff6417d90","resolution":{"observed_at":"2026-08-12T04:46:23.775974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.760171Z","title":"Model Configurations We use the open-source models and parameters of MT5-base, DAC and HuBERT, with both DAC and HuBERT configured for a sampling rate of 16 kHz","venue":null,"work_id":"54cb8fa1-1278-48e2-af31-e68c51a586ec","year":null},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.300465Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:0b810ed241c92ce851a1d6e565e7833ed919b11e3a21e2c29f8bcd4c23f74c7e","observation_id":"6f26b3b5-fbf7-41de-9a15-3bd8a680e28b","resolution":{"observed_at":"2026-08-12T04:46:23.764622Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.748803Z","title":"嗯” (En- glish translation: “um","venue":null,"work_id":"77fdf4cb-18a0-4512-a7a4-fcd4180fc6df","year":null},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.304430Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:ce80825a55361ff170cecb671a305c903f4c2e125189857dc4412c2acc528d08","observation_id":"01c61244-b2b2-41d0-90ba-e3291cb72429","resolution":{"observed_at":"2026-08-12T04:46:23.752707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.736697Z","title":"We propose a LLaMA-based codec language model with a delay pattern for spontaneous style voice cloning","venue":null,"work_id":"e0f5ad37-7196-405a-ad8a-bb31e9a2350d","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.308086Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:f43eef1088af1e3d17e7b6d4170a6b88b34dd091f62c2f6bc3890afd348a7cad","observation_id":"b7fa6797-065c-45fa-8d5d-8d8bf1dff17b","resolution":{"observed_at":"2026-08-12T04:46:23.740832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.724110Z","title":null,"venue":null,"work_id":"4f34d28d-bc35-4093-971f-cc1a34a74a17","year":null},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.311926Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:09762209b685a4a44861e9fa333a52d9b75554141d9eb5d3f566f17a78f62353","observation_id":"542d5b6a-0118-423b-9794-2f06bfeb2511","resolution":{"observed_at":"2026-08-12T04:46:23.727825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.712111Z","title":"Deep voice 3: Scaling text- to-speech with convolutional sequence learning,","venue":null,"work_id":"6cd43568-225a-4143-9abc-b3c8357bf161","year":2018},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.315475Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:232a81e096a9e519025eda188499fb2de8d42318355d893fca7504ff29f1378c","observation_id":"139d5379-45c2-4cf5-bd1c-874b58db1a35","resolution":{"observed_at":"2026-08-12T04:46:23.716321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.701175Z","title":"Neural voice cloning with a few samples,","venue":null,"work_id":"807116e5-0158-4920-9e4e-54b942fbb9be","year":2018},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.319118Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:3c9aeaee0b821d2420d89805ccf559f9bf5a32a1c42db95c74293770703832b7","observation_id":"b710d84c-195f-4657-98c3-a383d04cd232","resolution":{"observed_at":"2026-08-12T04:46:23.705048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.689450Z","title":"Adaspeech: Adaptive text to speech for custom voice,","venue":null,"work_id":"0a83ed00-2273-4632-8727-c8a0a99ba76c","year":null},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.322596Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:98b407f77e19dadc964134b23c70a438e21833ed0a97e34e615aaec9762a1488","observation_id":"ea60877d-f449-4e08-bac4-d82e9ed42ed0","resolution":{"observed_at":"2026-08-12T04:46:23.693828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-12T04:46:23.326163Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.326163Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:0deafe7d4f2fdfa63dcbcba2e27ff90fe4559320c0e72079aa745ce710c907d4","observation_id":"2be492a3-b375-428d-9fd9-c5743916fb77","resolution":{"observed_at":"2026-08-12T04:46:23.326163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-13T12:29:52.281350Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-12T04:46:23.330505Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.330505Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:618822ca2178e8bb591c30f66c37ef64aaf32546ce06646fb34b0900f197426d","observation_id":"d446060d-6a77-46c0-81dd-6940d5873c3c","resolution":{"observed_at":"2026-08-12T04:46:23.330505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.678425Z","title":"Speechx: Neural codec language model as a versatile speech transformer,","venue":null,"work_id":"384751dd-3324-4a5f-9766-e964ce4b2d78","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.334229Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:7ba739e4e32c4325245a16958ae8fcf54bc3a07808de852916a92a042f13dd79","observation_id":"d293bd2d-c7d7-4380-9a81-fddc37b9b8b6","resolution":{"observed_at":"2026-08-12T04:46:23.682223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07333","last_updated":"2024-01-14T17:43:55Z","snapshot_observed_at":"2026-08-13T04:43:10.925367Z","submitted_at":"2024-01-14T17:43:55Z","title":"ELLA-V: Stable Neural Codec Language Modeling with Alignment-guided Sequence Reordering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07333","snapshot_observed_at":"2026-08-12T04:46:23.337892Z","title":"Ella-v: Stable neural codec language modeling with alignment-guided sequence reordering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.337892Z"},"links":{"cited_paper":"/paper/2401.07333","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:25aea1665597ff65154ee8e74c210a89b76365c08973dadc9134f875732850c0","observation_id":"52a4f702-c67b-4136-bb99-3b2fed255e00","resolution":{"observed_at":"2026-08-12T04:46:23.337892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-12T04:46:23.341898Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.341898Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:0eb6469bebee121e5b4999d19d9b8ce2eead0d9b25efd032b720d9d0692210ed","observation_id":"9536cd50-92d2-420f-b1a8-48d92887b299","resolution":{"observed_at":"2026-08-12T04:46:23.341898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.345998Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.345998Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:d8e506b71371c69a4a6a891221d84609a888e710b3e9a9c48018d1e739f03224","observation_id":"56d4e3c2-ab15-4282-8e69-e1e06b5951f9","resolution":{"observed_at":"2026-08-12T04:46:23.345998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.658532Z","title":"Conversational end-to-end tts for voice agents,","venue":null,"work_id":"feba0a30-e00f-4089-898a-9a8526149b33","year":2021},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.349799Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:fe42837acd5ccae109505e3af49f7d6e32cc751c0d17fac3d8503043eb9d7798","observation_id":"2336ffaf-b83f-4884-8c33-73fefbbd7960","resolution":{"observed_at":"2026-08-12T04:46:23.662670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.647553Z","title":"End-to-end text-to-speech based on latent representa- tion of speaking styles using spontaneous dialogue,","venue":null,"work_id":"b410ca49-346d-4940-9365-cd8cb50a5e6f","year":2022},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.353254Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:8e0088394ca3bcdc756977b53d4f9ddcb62a78c376eddba0ede26a75c8820afc","observation_id":"9ace13ad-7a94-4da0-b69b-b61de73813ed","resolution":{"observed_at":"2026-08-12T04:46:23.651480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.636451Z","title":"Spontts: modeling and transferring spontaneous style for tts,","venue":null,"work_id":"d2d2189a-6ac6-44ec-80b5-719abebddfda","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.356699Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:7f63d4405de466ed97611db1f20d46a55068f51147b988deb35d0893855554c5","observation_id":"e941ab01-b81a-4b56-82c3-6611513a1fc5","resolution":{"observed_at":"2026-08-12T04:46:23.640293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.10828","last_updated":"2021-06-21T03:36:14Z","snapshot_observed_at":"2026-08-07T19:39:50.501914Z","submitted_at":"2021-06-21T03:36:14Z","title":"Controllable Context-aware Conversational Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2106.10828","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.10828","snapshot_observed_at":"2026-08-12T04:46:23.486002Z","title":"Controllable Context-aware Conversational Speech Synthesis","venue":"eess.AS","work_id":"14f78864-601a-49ff-b88d-718b7c5db310","year":2021},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.360982Z"},"links":{"cited_paper":"/paper/2106.10828","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:3d8e50939a9e56dc02fb2f106f79b76c2d3ca141edc78b401ea6cfe43e5a0e53","observation_id":"ab184b98-a3ca-4c99-96f8-ebee51f4f082","resolution":{"observed_at":"2026-08-12T04:46:23.491867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13509","last_updated":"2024-07-18T13:42:38Z","snapshot_observed_at":"2026-08-15T17:15:03.243545Z","submitted_at":"2024-07-18T13:42:38Z","title":"Spontaneous Style Text-to-Speech Synthesis with Controllable Spontaneous Behaviors Based on Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13509","snapshot_observed_at":"2026-08-12T04:46:23.364935Z","title":"Spontaneous style text-to-speech synthesis with con- trollable spontaneous behaviors based on language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.364935Z"},"links":{"cited_paper":"/paper/2407.13509","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:c4378c0db480efd05b1b229a59bd2b4265461ca44e9a93f3618b2f8e0d81b499","observation_id":"eef021a3-549c-473f-8d2f-0f8ff685f326","resolution":{"observed_at":"2026-08-12T04:46:23.364935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05763","last_updated":"2024-06-19T04:52:56Z","snapshot_observed_at":"2026-08-12T23:47:01.101483Z","submitted_at":"2024-06-09T12:32:42Z","title":"WenetSpeech4TTS: A 12,800-hour Mandarin TTS Corpus for Large Speech Generation Model Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05763","snapshot_observed_at":"2026-08-12T04:46:23.368773Z","title":"Wenetspeech4tts: A 12,800-hour mandarin tts corpus for large speech generation model bench- mark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.368773Z"},"links":{"cited_paper":"/paper/2406.05763","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:e33375213f41d3962acb2a840404e1eff50b340958d52a689207fd43fa4f38b2","observation_id":"8198aee0-864b-4a99-aae9-39ad1aece243","resolution":{"observed_at":"2026-08-12T04:46:23.368773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.624991Z","title":"Wenetspeech: A 10000+ hours multi- domain mandarin corpus for speech recognition,","venue":null,"work_id":"52e900dc-cd92-428a-8c26-d4b7abe1e061","year":2022},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.371902Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:f37cf6d8d26cf36533f8f3c8d7a191b13e1c11aa4fa4aea3d3d0aec4f4c1fc89","observation_id":"713e2b56-1c94-4773-bb5a-85dd25ea7cc5","resolution":{"observed_at":"2026-08-12T04:46:23.629094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.613505Z","title":"mt5: A massively multilingual pre-trained text-to-text transformer,","venue":null,"work_id":"b8347ff5-cab0-405a-adbd-f9cb6efdbc8e","year":2021},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.374799Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:7be777d6aa75a640644e77785395b988a06f7096eb0377f6146c7f4e5814f7c5","observation_id":"d7bf9a78-9f93-4ed1-baf8-69e0a9c4cdcc","resolution":{"observed_at":"2026-08-12T04:46:23.617503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.377892Z","title":"HuBERT: Self-Supervised Speech Rep- resentation Learning by Masked Prediction of Hidden Units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.377892Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:a4240cec51c1f2e7854ed6766a2bb276763abdf240e1e99fb5fb4b345cae2084","observation_id":"a8c3f4cf-12b0-42e2-b03f-74b31a86af06","resolution":{"observed_at":"2026-08-12T04:46:23.377892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.596254Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":"9d66b5d4-a8d3-4bce-8c3e-5eee7c39c953","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.381246Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:0e4119ff1f257cb1abc48211090bd55f0a9045d57a5ad2e3f4035a979c26a871","observation_id":"f66521be-d789-4b3c-8d13-68af8feaa5a6","resolution":{"observed_at":"2026-08-12T04:46:23.599558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T04:46:23.384154Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.384154Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:cefb3e2b5ca38c52873a1c129d76ba1b47c81f4c47ce707b4581c245319a9649","observation_id":"0f5ec975-e862-44f8-8c43-08b91f42b660","resolution":{"observed_at":"2026-08-12T04:46:23.384154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.585567Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":"74df0e64-d1c9-4220-8880-e902824f3ab9","year":2022},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.387495Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:b192b39b5206ab5e82385ddf73ce912c7e20b6e4b33ad208336deeafea4e9b38","observation_id":"d9cbc3d8-0b36-4985-b679-2ddd1768a059","resolution":{"observed_at":"2026-08-12T04:46:23.589572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.390561Z","title":"Speak, read and prompt: High-fidelity text-to-speech with min- imal supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.390561Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:ec1b469638f277e93f1c80c12f95da4dda33e9b25c88f70d7d14c5b642cd0686","observation_id":"30144310-756d-41df-ba16-52faf1b7a0e8","resolution":{"observed_at":"2026-08-12T04:46:23.390561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.566618Z","title":"Simple and controllable music gen- eration,","venue":null,"work_id":"8ca21293-bc4f-4792-b415-ca245a1cea5c","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.394037Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:f334e8d62c318c9abb592a8ca20dbdbd77b89ffb771e98d347f5befc65b9ae6c","observation_id":"b902a4c1-e7f8-48ac-8890-11e9b59feea2","resolution":{"observed_at":"2026-08-12T04:46:23.570739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-13T04:28:02.323611Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-12T04:46:23.397620Z","title":"Natural language guidance of high- fidelity text-to-speech with synthetic annotations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.397620Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:4c87f36886dafdc368ddf5eda24eb64d30021f0fe10e4955e7432bdf8b576e44","observation_id":"d6439b49-a38e-4d9c-82ea-8e7aacd6f301","resolution":{"observed_at":"2026-08-12T04:46:23.397620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17806","last_updated":"2023-06-30T17:07:02Z","snapshot_observed_at":"2026-08-13T11:05:10.061658Z","submitted_at":"2023-06-30T17:07:02Z","title":"Stay on topic with Classifier-Free Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17806","snapshot_observed_at":"2026-08-12T04:46:23.401316Z","title":"Stay on topic with classifier-free guidance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.401316Z"},"links":{"cited_paper":"/paper/2306.17806","citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:07917fc9ed34157a4422dde69cb3828fe550ab19bdafe200235f3f6a769a482c","observation_id":"39d733d5-23be-4d16-a63b-ccb8ab33b86a","resolution":{"observed_at":"2026-08-12T04:46:23.401316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:46:23.555233Z","title":"V oxinstruct: Expressive human instruction-to-speech generation with unified multilingual codec language modelling,","venue":null,"work_id":"d8e7ed05-f59c-465d-bfaf-5b633daf0d87","year":2024},"citing_paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:46:23.404901Z"},"links":{"citing_paper":"/paper/2412.01100"},"observation_digest":"sha256:ab2ff13026108cc2c880462154c7d94015e524deb31d7fe53b90f90442ae574b","observation_id":"724b1e42-e0be-4518-9a48-49440cf836ad","resolution":{"observed_at":"2026-08-12T04:46:23.559034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.01100","last_updated":"2025-02-04T09:14:24Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-15T03:13:27.801616Z","submitted_at":"2024-12-02T04:17:42Z","title":"The Codec Language Model-based Zero-Shot Spontaneous Style TTS System for CoVoC Challenge 2024"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":13,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2412.01100."}