{"as_of":"2026-08-09T12:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4689a504980c0580bb4def765b2490453fa301f5741a6e39646e08fd438826b5","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":29,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T05:54:18.413462Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:10:07.252358Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":"2305.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-07-04T20:10:07.252358Z","title":"Better speech synthesis through scaling","venue":null,"work_id":"a8efef68-fbc1-4c78-88e5-a8d8ad2945a4","year":2023},"citing_paper":{"arxiv_id":"2401.09512","last_updated":"2026-05-18T13:28:38Z","snapshot_observed_at":"2026-07-06T17:17:03.447619Z","submitted_at":"2024-01-17T15:09:02Z","title":"MLAAD: The Multi-Language Audio Anti-Spoofing Dataset","version":10},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-24T04:34:59.205522Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2401.09512"},"observation_digest":"sha256:1c7fff61230be22e741234560b900e4053d07345eab5d0a8e3afced5c1f12fe0","observation_id":"fbece7d4-c200-461f-a8ae-be65655fed70","resolution":{"observed_at":"2026-05-24T04:36:00.894144Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":"2305.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-07-04T20:10:07.252358Z","title":"Better speech synthesis through scaling","venue":null,"work_id":"a8efef68-fbc1-4c78-88e5-a8d8ad2945a4","year":2023},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:986dba6e8dd06de75ad78fe5c8bc268ac496b82f95143d2f4d904e38928f7bf2","observation_id":"36c79e26-f01d-4b1e-954a-a6c8070fc732","resolution":{"observed_at":"2026-05-15T12:26:37.369560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-09T05:54:18.413462Z","title":"Better speech synthesis through scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-09T08:33:22.897642Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T05:54:18.413462Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2502.03128"},"observation_digest":"sha256:5e2465f105d46e388573ee3c6ad7caddc651bcb5c9e6dadf4bc7093ebfffa7cd","observation_id":"7e187116-59ac-4d0d-acb4-a1785930ef6c","resolution":{"observed_at":"2026-08-09T05:54:18.413462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-08T22:30:26.989835Z","title":"Better Speech Synthesis through Scaling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04519","last_updated":"2025-08-20T17:34:21Z","snapshot_observed_at":"2026-08-08T22:23:13.323023Z","submitted_at":"2025-02-06T21:40:09Z","title":"GenVC: Self-Supervised Zero-Shot Voice Conversion","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T22:30:26.989835Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2502.04519"},"observation_digest":"sha256:0b17f799ce17599c3ee0d02ec776bc74b2c0b457685b656fe2dc282d4e2919f3","observation_id":"4e19c775-5283-49ee-b401-6287a4341f94","resolution":{"observed_at":"2026-08-08T22:30:26.989835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-08T19:07:00.542381Z","title":"Better speech synthesis through scaling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.542381Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:d38ebb6be2214164eafa8e79778591a203d99e8abdd1c99b0fea901585c85a61","observation_id":"ecf8f860-9809-4c0e-8dfd-c0805f94c1a2","resolution":{"observed_at":"2026-08-08T19:07:00.542381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-08T13:26:19.165401Z","title":"Better speech synthesis through scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-09T00:10:38.730062Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T13:26:19.165401Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2502.07243"},"observation_digest":"sha256:1423561de31df12e1209750d0a200e7bb98ddcd46d9b4940d3bf9ee0850a1437","observation_id":"54dc202b-f995-44b5-9425-fc2300fe4d46","resolution":{"observed_at":"2026-08-08T13:26:19.165401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":"2305.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-07-04T20:10:07.252358Z","title":"Better speech synthesis through scaling","venue":null,"work_id":"a8efef68-fbc1-4c78-88e5-a8d8ad2945a4","year":2023},"citing_paper":{"arxiv_id":"2502.20427","last_updated":"2026-05-13T15:54:56Z","snapshot_observed_at":"2026-07-06T20:43:59.574176Z","submitted_at":"2025-02-27T12:26:25Z","title":"DeePen: Penetration Testing for Audio Deepfake Detection","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-23T02:43:04.745094Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2502.20427"},"observation_digest":"sha256:b75584a615605c6bec822183c152a0bd39f71acf52a69b542aaf0d8debb8e54a","observation_id":"6c64258b-9b03-4a75-b2c2-c5ce3c09c76a","resolution":{"observed_at":"2026-05-23T02:45:19.482982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-07T14:33:39.764367Z","title":"Better speech synthesis through scaling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18453","last_updated":"2025-05-24T01:26:02Z","snapshot_observed_at":"2026-08-07T15:24:07.535545Z","submitted_at":"2025-05-24T01:26:02Z","title":"MPE-TTS: Customized Emotion Zero-Shot Text-To-Speech Using Multi-Modal Prompt","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:39.764367Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2505.18453"},"observation_digest":"sha256:50daf81182c4ec3b21cfb7ed319a65a44d12ac800033c6e39e7ee26c01a5a162","observation_id":"4e51cc1d-d6a3-47a1-9995-9a7b2bd0e0f2","resolution":{"observed_at":"2026-08-07T14:33:39.764367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-07T12:48:33.068807Z","title":"Betker, Better speech synthesis through scaling, arXiv preprint arXiv:2305.07243 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23465","last_updated":"2025-05-29T14:16:27Z","snapshot_observed_at":"2026-08-09T09:33:37.541831Z","submitted_at":"2025-05-29T14:16:27Z","title":"Semantics-Aware Human Motion Generation from Audio Instructions","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:33.068807Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2505.23465"},"observation_digest":"sha256:546a119001d696344bfd169eec414873c09278e0c408655a2fdd0dc575a95f1b","observation_id":"9951754c-b7b0-4e2a-9983-da0f89676296","resolution":{"observed_at":"2026-08-07T12:48:33.068807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T21:33:09.226193Z","title":"Better speech synthesis through scaling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23986","last_updated":"2025-07-01T16:23:28Z","snapshot_observed_at":"2026-08-07T19:47:51.420051Z","submitted_at":"2025-06-30T15:50:08Z","title":"StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:09.226193Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2506.23986"},"observation_digest":"sha256:0841aaeff9b225782aca2a3362bfd466b1fc754355583229d4bef039bd9a081a","observation_id":"40e12eec-8569-4de8-89b0-2d584479c018","resolution":{"observed_at":"2026-08-06T21:33:09.226193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T21:25:26.849481Z","title":"Better speech synthesis through scaling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00227","last_updated":"2025-06-30T19:52:32Z","snapshot_observed_at":"2026-08-08T22:36:28.237803Z","submitted_at":"2025-06-30T19:52:32Z","title":"Investigating Stochastic Methods for Prosody Modeling in Speech Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:25:26.849481Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.00227"},"observation_digest":"sha256:3dcfa9d3e7b4392fee39f78baa6e58fd8a296b8f5d66948bbc0bba1bcbf3eb92","observation_id":"efa6ef73-0ed5-4a80-8573-fa8b4f8c2b25","resolution":{"observed_at":"2026-08-06T21:25:26.849481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T20:29:19.238058Z","title":"Better speech synthesis through scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02606","last_updated":"2025-07-03T13:30:58Z","snapshot_observed_at":"2026-08-06T20:22:38.029149Z","submitted_at":"2025-07-03T13:30:58Z","title":"De-AntiFake: Rethinking the Protective Perturbations Against Voice Cloning Attacks","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:29:19.238058Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.02606"},"observation_digest":"sha256:63706146727fa75136f34ff8bd8d41ef57173f2b661cf87196ccf4af63bb9098","observation_id":"b03c3b1c-9fbf-4f63-b925-c5162c052d5f","resolution":{"observed_at":"2026-08-06T20:29:19.238058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T16:55:49.512702Z","title":"Better speech synthesis through scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12197","last_updated":"2025-07-16T12:47:09Z","snapshot_observed_at":"2026-08-07T14:59:35.759272Z","submitted_at":"2025-07-16T12:47:09Z","title":"Quantize More, Lose Less: Autoregressive Generation from Residually Quantized Speech Representations","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T16:55:49.512702Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.12197"},"observation_digest":"sha256:210bb5e3431b037a111293a632a2eca066a40ee805353056ef3610362079e336","observation_id":"edcddf70-53f9-47ca-b41a-b5fb3e02e6dd","resolution":{"observed_at":"2026-08-06T16:55:49.512702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":"2305.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-07-04T20:10:07.252358Z","title":"Better speech synthesis through scaling","venue":null,"work_id":"a8efef68-fbc1-4c78-88e5-a8d8ad2945a4","year":2023},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:3ef00ca880b47d24c89abf9a8a133ac559da0dcff76454c25e998c145636a3b1","observation_id":"b830277d-a5b9-48e4-8861-901a9974e525","resolution":{"observed_at":"2026-05-16T05:59:50.966924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T13:07:28.255179Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-08T08:14:38.727576Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.255179Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:b7b4f7579dfed079ce38b15ae0e38e908933fc765cd94f60aaea50b185cb80c0","observation_id":"9f8eb8eb-c408-4fb3-bb91-927714cba40b","resolution":{"observed_at":"2026-08-06T13:07:28.255179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T15:02:02.858858Z","title":"Better speech synthesis through scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:02:02.858858Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.21138"},"observation_digest":"sha256:7daca12625f686bcd636876831ad39473a8216e3b0767bcf33f4fe61700a8828","observation_id":"448ecfc7-dea8-42b5-b8e6-c5ee136542be","resolution":{"observed_at":"2026-08-06T15:02:02.858858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T12:49:16.507053Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21463","last_updated":"2025-07-29T03:06:31Z","snapshot_observed_at":"2026-08-07T23:23:35.413701Z","submitted_at":"2025-07-29T03:06:31Z","title":"SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T12:49:16.507053Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.21463"},"observation_digest":"sha256:76e6d0d696e90f7f40372bc2d651462b7b1d13c3b101b896b38867145197f8af","observation_id":"42bed4f2-64cc-40a0-803e-8e9e71bf4a9b","resolution":{"observed_at":"2026-08-06T12:49:16.507053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T11:22:25.341706Z","title":"Better speech synthesis through scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22746","last_updated":"2025-08-01T03:37:42Z","snapshot_observed_at":"2026-08-06T13:36:59.117683Z","submitted_at":"2025-07-30T15:03:36Z","title":"Next Tokens Denoising for Speech Synthesis","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:25.341706Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.22746"},"observation_digest":"sha256:d2d08c2f0d2e9c4651a79d3422515729c88fd523cbe136a44963792802642fe5","observation_id":"6229081c-1426-49c8-90a8-da36704ba759","resolution":{"observed_at":"2026-08-06T11:22:25.341706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-06T11:07:20.044506Z","title":"Better speech synthesis through scaling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23188","last_updated":"2025-07-31T01:59:38Z","snapshot_observed_at":"2026-08-06T11:07:18.369191Z","submitted_at":"2025-07-31T01:59:38Z","title":"Multi-Modal Motion Retrieval by Learning a Fine-Grained Joint Embedding Space","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:07:20.044506Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2507.23188"},"observation_digest":"sha256:1de2c8a11bf00299d2f63603bc46a4f0344b390f82ed815832fea768dcee9b66","observation_id":"980f1468-0f6e-48d7-bd95-59f812a4ea20","resolution":{"observed_at":"2026-08-06T11:07:20.044506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-05T22:52:07.682737Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06277","last_updated":"2025-08-08T12:54:09Z","snapshot_observed_at":"2026-08-08T00:40:59.550254Z","submitted_at":"2025-08-08T12:54:09Z","title":"Large Language Model Data Generation for Enhanced Intent Recognition in German Speech","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T22:52:07.682737Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2508.06277"},"observation_digest":"sha256:d2a28abfe6fc2bd9b8fd6dbd6d4761f7c595771ccd73d83f88f088c09bbbf431","observation_id":"f5bf894b-6301-462a-a9bb-ff8ace21d634","resolution":{"observed_at":"2026-08-05T22:52:07.682737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-02T18:03:40.305722Z","title":"Better speech synthesis through scaling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:40.305722Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:b9ee087d48847bbc35087c042347ea1211ed7b368ad99196998377d2aec552ac","observation_id":"314b1853-2332-4c49-a51b-96a09c774be3","resolution":{"observed_at":"2026-08-02T18:03:40.305722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":"2305.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-07-04T20:10:07.252358Z","title":"Better speech synthesis through scaling","venue":null,"work_id":"a8efef68-fbc1-4c78-88e5-a8d8ad2945a4","year":2023},"citing_paper":{"arxiv_id":"2604.08184","last_updated":"2026-04-09T12:38:19Z","snapshot_observed_at":"2026-08-02T08:09:42.022596Z","submitted_at":"2026-04-09T12:38:19Z","title":"AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T17:40:10.657590Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2604.08184"},"observation_digest":"sha256:f8de947b6b2fa71969b4b829ffcfeaa7b1b01c2f5a1d29c38e3e68b3e9cb548f","observation_id":"d1011716-3d8a-44e4-a33f-e9b35a272e03","resolution":{"observed_at":"2026-05-11T06:21:00.750276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":"2305.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-07-04T20:10:07.252358Z","title":"Better speech synthesis through scaling","venue":null,"work_id":"a8efef68-fbc1-4c78-88e5-a8d8ad2945a4","year":2023},"citing_paper":{"arxiv_id":"2604.08709","last_updated":"2026-04-09T19:02:32Z","snapshot_observed_at":"2026-08-05T06:03:41.144377Z","submitted_at":"2026-04-09T19:02:32Z","title":"Enhancing Conversational TTS with Cascaded Prompting and ICL-Based Online Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T16:50:59.950646Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2604.08709"},"observation_digest":"sha256:5e6b2916e995d28eb263e33868e53a115b33e8500f194ddf34a83e8e53d80f67","observation_id":"a759e3db-93c3-416b-b1be-c4cac265d7d1","resolution":{"observed_at":"2026-05-11T08:01:01.896689Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":"2305.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-07-04T20:10:07.252358Z","title":"Better speech synthesis through scaling","venue":null,"work_id":"a8efef68-fbc1-4c78-88e5-a8d8ad2945a4","year":2023},"citing_paper":{"arxiv_id":"2605.05611","last_updated":"2026-05-09T04:00:12Z","snapshot_observed_at":"2026-08-07T04:24:17.978376Z","submitted_at":"2026-05-07T02:57:53Z","title":"X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-08T04:35:58.032597Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2605.05611"},"observation_digest":"sha256:4ca60ec5920d6c2ef02d7d6fb58b37d5411d73b2c8fd7cf2ca8eac48ed752d99","observation_id":"d5d29c86-d4cd-4850-963e-10ca7a84a21b","resolution":{"observed_at":"2026-05-11T21:41:15.990038Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":"2305.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-07-04T20:10:07.252358Z","title":"Better speech synthesis through scaling","venue":null,"work_id":"a8efef68-fbc1-4c78-88e5-a8d8ad2945a4","year":2023},"citing_paper":{"arxiv_id":"2605.05611","last_updated":"2026-05-09T04:00:12Z","snapshot_observed_at":"2026-08-07T04:24:17.978376Z","submitted_at":"2026-05-07T02:57:53Z","title":"X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-12T01:43:48.555523Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2605.05611"},"observation_digest":"sha256:adafd4ce9661a826d96c53db0be39f11b25ccd04d9ad591e331efd06cfcb7dd7","observation_id":"ecca9889-85c2-48b9-b1e4-0094a650bd7a","resolution":{"observed_at":"2026-05-12T01:46:13.918576Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":"2305.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-07-04T20:10:07.252358Z","title":"Better speech synthesis through scaling","venue":null,"work_id":"a8efef68-fbc1-4c78-88e5-a8d8ad2945a4","year":2023},"citing_paper":{"arxiv_id":"2606.09141","last_updated":"2026-06-09T03:52:24Z","snapshot_observed_at":"2026-08-03T07:58:02.783857Z","submitted_at":"2026-06-08T07:39:26Z","title":"FlashTTS: Fast Streaming TTS with MTP Acceleration and X-pred Mean Flow Distillation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T15:15:10.060770Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2606.09141"},"observation_digest":"sha256:eb4355885290509ba9236fe61e2f8414db383121d3313b172d6b501f7ccd7ea7","observation_id":"994559ed-963d-4afc-a376-75312646c751","resolution":{"observed_at":"2026-07-03T03:37:35.150832Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":"2305.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-07-04T20:10:07.252358Z","title":"Better speech synthesis through scaling","venue":null,"work_id":"a8efef68-fbc1-4c78-88e5-a8d8ad2945a4","year":2023},"citing_paper":{"arxiv_id":"2606.21343","last_updated":"2026-06-19T11:41:30Z","snapshot_observed_at":"2026-07-30T09:03:07.020192Z","submitted_at":"2026-06-19T11:41:30Z","title":"An Evaluation Framework for Text-to-Speech Voice Reconstruction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-26T13:16:05.358573Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2606.21343"},"observation_digest":"sha256:dcf143241f40183afb3ddee466c11097f0615c86bf6ee358038c4166c422b6bc","observation_id":"39f7ca8a-ae34-4a16-aefd-8bbc381cc9bd","resolution":{"observed_at":"2026-07-04T07:39:38.696570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":"2305.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-07-04T20:10:07.252358Z","title":"Better speech synthesis through scaling","venue":null,"work_id":"a8efef68-fbc1-4c78-88e5-a8d8ad2945a4","year":2023},"citing_paper":{"arxiv_id":"2606.25369","last_updated":"2026-06-24T03:57:21Z","snapshot_observed_at":"2026-08-05T15:29:17.177693Z","submitted_at":"2026-06-24T03:57:21Z","title":"Sarashina2.2-TTS: Tackling Kanji Polyphony in Japanese Speech Generation via Data Scaling and Targeted Data Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-25T20:43:29.118351Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2606.25369"},"observation_digest":"sha256:e761482dfa4b5474ad6215f4e02c0f4b779aa34286dca003df7e5bba36c9fb13","observation_id":"dfa2c6d2-65a8-4f9f-90d2-750168104c71","resolution":{"observed_at":"2026-07-04T20:10:07.254111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":"2305.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-07-04T20:10:07.252358Z","title":"Better speech synthesis through scaling","venue":null,"work_id":"a8efef68-fbc1-4c78-88e5-a8d8ad2945a4","year":2023},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:58b9f139564ab080a1df59f02a047be87e022d248f5b6c550c8226213ecb32e7","observation_id":"d9687248-44c7-475a-9473-379c1881c1da","resolution":{"observed_at":"2026-07-01T11:55:42.196372Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2305.07243/citation-record","integrity":"/paper/2305.07243/integrity","json":"/paper/2305.07243/citation-record.json","paper":"/paper/2305.07243"},"outbound":[],"paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 29 inbound Pith citation observations for arXiv:2305.07243."}