{"as_of":"2026-08-13T19:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:08a68e214460f98a9dfe6402125c58f007c9144fa08aa9fa9f6a099f04c51d25","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:22:00.140173Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":42,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:20:41.988791Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T12:19:49.633371Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2601.03170","last_updated":"2026-05-17T15:46:48Z","snapshot_observed_at":"2026-08-11T17:04:02.421567Z","submitted_at":"2026-01-06T16:51:04Z","title":"TED-TTS: Training-Free Intra-Utterance Emotion and Duration Control for Text-to-Speech Synthesis","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T15:33:08.885667Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2601.03170"},"observation_digest":"sha256:fdf8c14c5e427e2be844f2dacc6a7db983a07067e820ae0aa1b32d57e1379680","observation_id":"cf142752-2af7-45bc-9cb5-7725da8b0756","resolution":{"observed_at":"2026-05-21T15:34:15.080474Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2601.22143","last_updated":"2026-05-11T12:30:46Z","snapshot_observed_at":"2026-08-11T10:16:09.917783Z","submitted_at":"2026-01-29T18:57:13Z","title":"JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T09:55:32.044506Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2601.22143"},"observation_digest":"sha256:2ea49aeb6f5b69a87cb246195ee5cccfefc759b11db6ff98f8e8e8cf55cc3293","observation_id":"e574c656-9807-4a67-97f2-0ac729782f23","resolution":{"observed_at":"2026-05-16T09:57:42.883160Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-02T22:51:21.928324Z","title":"IndexTTS2: A Break- through in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15519","last_updated":"2026-06-08T11:40:00Z","snapshot_observed_at":"2026-08-09T04:37:03.295131Z","submitted_at":"2026-02-17T11:47:56Z","title":"Enroll-on-Wakeup: A First Comparative Study of Target Speech Extraction for Seamless Interaction in Real Noisy Human-Machine Dialogue Scenarios","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:21.928324Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2602.15519"},"observation_digest":"sha256:3ed3b38150d2ce3219b16cc3d3af33133751e7509206063bd977c28b9f4c7230","observation_id":"3bf6e419-1013-4bed-8f91-02ff709e7272","resolution":{"observed_at":"2026-08-02T22:51:21.928324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2604.00688","last_updated":"2026-04-21T12:14:57Z","snapshot_observed_at":"2026-07-06T22:51:26.754746Z","submitted_at":"2026-04-01T09:45:51Z","title":"OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T23:00:18.720371Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.00688"},"observation_digest":"sha256:9e159199538f6ddc8bf885d1df9e91d0fce4829e89a02f9343c945439f0e484c","observation_id":"878d1998-5126-475c-b0c5-ebb94ffe3517","resolution":{"observed_at":"2026-05-13T23:03:24.931802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-14T19:56:33.793167Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01895","last_updated":"2026-04-02T10:59:55Z","snapshot_observed_at":"2026-08-06T15:48:40.631159Z","submitted_at":"2026-04-02T10:59:55Z","title":"Sharp spectral estimates for free boundary problems arising in plasma physics","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T19:56:33.793167Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.01895"},"observation_digest":"sha256:565b8355d6b2b8e3f72e56d5c23cd978bfdd399ac182ec13101018b5b9831a3d","observation_id":"5d1be585-afb8-4162-8a6d-24ba3001dc1f","resolution":{"observed_at":"2026-07-14T19:56:33.793167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2604.01897","last_updated":"2026-07-13T11:03:37Z","snapshot_observed_at":"2026-08-02T18:54:29.968214Z","submitted_at":"2026-04-02T11:00:37Z","title":"FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T20:55:09.141906Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.01897"},"observation_digest":"sha256:31200f8e3b592406e962e2639b56588540e44ea34a5839b6a4f548abbff97171","observation_id":"3b01ef42-a07b-480a-a239-4229b954d18f","resolution":{"observed_at":"2026-05-13T20:58:15.994347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2604.08363","last_updated":"2026-04-09T15:27:22Z","snapshot_observed_at":"2026-08-13T09:39:50.855408Z","submitted_at":"2026-04-09T15:27:22Z","title":"CapTalk: Unified Voice Design for Single-Utterance and Dialogue Speech Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T17:15:28.918204Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.08363"},"observation_digest":"sha256:3a41043b7438e6a4b1f248f8e4a7d512abb073fed6f9dc128e2524aa9c2332f2","observation_id":"0ef942c6-ff61-45d8-b44d-fa72ec1c2ae4","resolution":{"observed_at":"2026-05-11T07:16:00.305794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2604.12292","last_updated":"2026-04-14T05:03:57Z","snapshot_observed_at":"2026-08-11T04:52:17.786679Z","submitted_at":"2026-04-14T05:03:57Z","title":"CoSyncDiT: Cognitive Synchronous Diffusion Transformer for Movie Dubbing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T15:46:58.010112Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.12292"},"observation_digest":"sha256:c0f247b4993dc1d0886f07e2f79dcdc600eeb0563abab143870de58a19424140","observation_id":"713eefad-13f9-4a93-b473-955a704b9278","resolution":{"observed_at":"2026-05-11T09:51:00.754781Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2604.17435","last_updated":"2026-04-19T13:34:52Z","snapshot_observed_at":"2026-08-13T07:41:22.005610Z","submitted_at":"2026-04-19T13:34:52Z","title":"MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T05:36:07.090627Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.17435"},"observation_digest":"sha256:4f6ac5cc60bfd86b9bae884bfa2bd384b922b8fd85385a6e570b108746b36bf0","observation_id":"03223873-a2f7-4fdd-b941-df791230ca24","resolution":{"observed_at":"2026-05-10T05:41:02.500305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2604.22225","last_updated":"2026-04-24T05:01:55Z","snapshot_observed_at":"2026-07-06T23:08:42.301487Z","submitted_at":"2026-04-24T05:01:55Z","title":"TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T12:03:11.243693Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.22225"},"observation_digest":"sha256:94661bcdc9809b9308d02976664f23c588d67b981a4eaa14dd7a2b9ba7207ae0","observation_id":"8a395226-b98f-488a-bfcc-795612a049bd","resolution":{"observed_at":"2026-05-11T19:21:10.007737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2604.23742","last_updated":"2026-04-26T14:42:50Z","snapshot_observed_at":"2026-08-11T08:18:04.066021Z","submitted_at":"2026-04-26T14:42:50Z","title":"RTCFake: Speech Deepfake Detection in Real-Time Communication","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-08T05:29:45.895667Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.23742"},"observation_digest":"sha256:2829b1a0da4c87a49d44be24068df8873386ee4372bf25f7e17f1856deef989e","observation_id":"ec3507fd-42e6-4b9f-af66-555e92b2e64e","resolution":{"observed_at":"2026-05-11T21:26:17.854987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2604.26347","last_updated":"2026-07-22T04:43:04Z","snapshot_observed_at":"2026-08-11T14:30:40.389564Z","submitted_at":"2026-04-29T06:59:48Z","title":"The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T12:34:40.888089Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.26347"},"observation_digest":"sha256:785d029afee5db4bab608359091fe001f48d583d41b8c27b3d96c7305a99cdc9","observation_id":"598b00b6-b804-4a36-8a51-1ca6d28b3aee","resolution":{"observed_at":"2026-05-12T09:11:27.102735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-02T15:21:28.806423Z","title":"Indextts2: A breakthrough in emotionally expressive and duration- controlled auto-regressive zero-shot text-to-speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26347","last_updated":"2026-07-22T04:43:04Z","snapshot_observed_at":"2026-08-11T14:30:40.389564Z","submitted_at":"2026-04-29T06:59:48Z","title":"The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T15:21:28.806423Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2604.26347"},"observation_digest":"sha256:43ffeb26ed3569c8a16e01a1c38a384765a1f490c3309c68ca61af6fbe183ad3","observation_id":"3ba17a93-84ad-456e-98e6-97359ecd5833","resolution":{"observed_at":"2026-08-02T15:21:28.806423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-11T13:23:12.680939Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:8ae3866e234fdc8111edd2a6e0d3274810aaf0d692635001f611430d63a65c77","observation_id":"235e690a-a3f6-4cf0-b49c-a4865a81eac1","resolution":{"observed_at":"2026-05-11T04:50:56.070996Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2605.11866","last_updated":"2026-05-20T03:22:45Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:46:36Z","title":"AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T05:06:54.972846Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.11866"},"observation_digest":"sha256:c931e4829e150fdfc156243fdc5d8091acaf3b24a653bf94c6755607a8d377e2","observation_id":"fe258340-112e-4730-990b-7bc43fc0e81f","resolution":{"observed_at":"2026-05-13T05:07:17.280453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2605.11866","last_updated":"2026-05-20T03:22:45Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:46:36Z","title":"AuDirector: A Self-Reflective Closed-Loop Framework for Immersive Audio Storytelling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T08:28:21.790110Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.11866"},"observation_digest":"sha256:6acf4d27cf14483e3186ce4c956e240d8081dd9e394a2604ae6f69c3c34323db","observation_id":"c7b3091e-e029-4632-9041-6273c134b334","resolution":{"observed_at":"2026-05-21T08:29:52.767862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2605.15202","last_updated":"2026-04-01T13:38:36Z","snapshot_observed_at":"2026-07-06T23:26:32.979566Z","submitted_at":"2026-04-01T13:38:36Z","title":"DeepSlide: From Artifacts to Presentation Delivery","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-19T18:03:02.253422Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.15202"},"observation_digest":"sha256:c5afebd92c65e52931ed02d50442c26ce3bbab5c79040056fd3e9d7a6a10e288","observation_id":"c36b7f05-03d9-4e50-a73a-d1e5dccec9b1","resolution":{"observed_at":"2026-05-19T18:03:10.135599Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2605.16026","last_updated":"2026-05-15T15:01:45Z","snapshot_observed_at":"2026-07-06T23:27:15.745896Z","submitted_at":"2026-05-15T15:01:45Z","title":"From Flat Language Labels to Typological Priors: Structured Language Conditioning for Multilingual Speech-to-Speech Translation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T19:25:18.488377Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.16026"},"observation_digest":"sha256:d052ae7bd7655ac31595a8f6ca4ce0f7b8067c75074de1d757ad321e3b6787f0","observation_id":"cdc9418e-d138-41ec-8f3e-14063841f124","resolution":{"observed_at":"2026-05-20T19:28:55.031428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2605.17583","last_updated":"2026-05-14T13:31:23Z","snapshot_observed_at":"2026-08-13T16:12:06.998441Z","submitted_at":"2026-05-14T13:31:23Z","title":"AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-20T21:14:58.814362Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.17583"},"observation_digest":"sha256:f368e0d82d7979ac39be5d66cbcf2fec5752a1c95fe4778b9098827fb12342ab","observation_id":"a5dc0fd2-ca5e-4249-aa34-398776f16c9a","resolution":{"observed_at":"2026-05-20T21:19:03.232955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2605.22083","last_updated":"2026-07-17T07:00:02Z","snapshot_observed_at":"2026-08-13T01:09:54.891659Z","submitted_at":"2026-05-21T07:22:28Z","title":"RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-22T02:56:06.910758Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.22083"},"observation_digest":"sha256:e4ee6d8b8951551eb5166c290ee6151e558627d97555bf1df46bce2ca2aaf826","observation_id":"579f3555-339b-4a1c-9417-fdf45cda185a","resolution":{"observed_at":"2026-05-22T03:00:59.040259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-02T13:29:53.802184Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.22083","last_updated":"2026-07-17T07:00:02Z","snapshot_observed_at":"2026-08-13T01:09:54.891659Z","submitted_at":"2026-05-21T07:22:28Z","title":"RobustSpeechFlow: Learning Robust Text-to-Speech Trajectories via Augmentation-based Contrastive Flow Matching","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T13:29:53.802184Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.22083"},"observation_digest":"sha256:d8eb043506332b1eda68034776473826896828abb368ba2a9bc5755621d929eb","observation_id":"8144dd9c-78d0-4466-b216-679c9b414ff1","resolution":{"observed_at":"2026-08-02T13:29:53.802184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2605.30993","last_updated":"2026-05-29T08:27:57Z","snapshot_observed_at":"2026-08-02T00:55:15.607531Z","submitted_at":"2026-05-29T08:27:57Z","title":"SwanVoice: Expressive Long-Form Zero-Shot Speech Synthesis for Both Monologue and Dialogue","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T21:05:54.061395Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2605.30993"},"observation_digest":"sha256:181f5715fb8b0f6048f8cca18bd06f6aec815f2f85377adc63a788cb66e96c83","observation_id":"2830a0fb-9f2d-4eea-aede-ebac1bee36ff","resolution":{"observed_at":"2026-07-01T20:26:13.082455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.00066","last_updated":"2026-05-20T07:46:16Z","snapshot_observed_at":"2026-08-13T01:33:55.152516Z","submitted_at":"2026-05-20T07:46:16Z","title":"DUET: Unified Dual-Space Emotion Control for Diffusion and Flow-Matching Driven Text-to-Speech","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T17:35:06.352720Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.00066"},"observation_digest":"sha256:921b250cc18548128899dcda83d25e34c309a8053bb1f0bd28b6e88fee8ffff8","observation_id":"22e6c8c1-4c35-4e15-8038-3119b51f83a9","resolution":{"observed_at":"2026-07-01T15:05:48.523055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.01016","last_updated":"2026-05-31T05:13:32Z","snapshot_observed_at":"2026-08-13T15:48:57.500872Z","submitted_at":"2026-05-31T05:13:32Z","title":"PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-06-28T17:44:07.669223Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.01016"},"observation_digest":"sha256:89d845b6d14d12f1e55283bbf0603a222be4fbd48edb208ad697e1562c00adf9","observation_id":"6815c925-6871-483f-bd92-24d4edcbc89c","resolution":{"observed_at":"2026-07-01T20:46:13.835687Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.01677","last_updated":"2026-06-01T04:35:28Z","snapshot_observed_at":"2026-08-01T15:52:02.822088Z","submitted_at":"2026-06-01T04:35:28Z","title":"UniVocal: Unified Speech-Singing Code-Switching Synthesis","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T13:17:13.510587Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.01677"},"observation_digest":"sha256:46a50491d55a57543fc3b5474c03327f77078fe3a7f7f493b2e63a6b7bce2547","observation_id":"16f5240f-3f96-4f1c-bfe6-8bd5849f9f77","resolution":{"observed_at":"2026-07-02T00:46:24.634388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.05896","last_updated":"2026-06-22T18:29:42Z","snapshot_observed_at":"2026-08-13T00:11:00.337903Z","submitted_at":"2026-06-04T09:03:43Z","title":"Resonant Minds: Closed-Loop Social Avatars with Theory of Mind","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T02:04:39.753443Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.05896"},"observation_digest":"sha256:e8d9118f53b466a9ab40e9f93e1c82f2f5ebf8fddf2019c1d854594db82ae1ad","observation_id":"61fcceb1-562f-404d-837d-ba92ee5d31c3","resolution":{"observed_at":"2026-07-02T12:36:56.224385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.06940","last_updated":"2026-06-10T06:55:49Z","snapshot_observed_at":"2026-08-07T14:40:32.300615Z","submitted_at":"2026-06-05T06:11:38Z","title":"Beyond Semantic Dominance: Cognitive Affective Reasoning and Empathetic Response Alignment in Audio Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T21:16:07.007759Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.06940"},"observation_digest":"sha256:f1f68bb4712c22219af36eac46a9d7472b9b4682639474906f745044bd19e9dc","observation_id":"0be20842-bbf1-47f6-9ecb-4f2e9eb7446c","resolution":{"observed_at":"2026-07-02T19:47:20.002939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.09019","last_updated":"2026-06-08T04:32:08Z","snapshot_observed_at":"2026-07-06T23:48:26.076260Z","submitted_at":"2026-06-08T04:32:08Z","title":"TLDR: Compressing Audio Tokens for Efficient Autoregressive Text-to-Speech","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T15:27:01.142747Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.09019"},"observation_digest":"sha256:323f2ab9f3e1b15928e6572250574986fd407e8bd4b0c073d8b56a82f7bafe6c","observation_id":"cc9f9742-5fa6-4233-a3fb-1f7dd5b91dd0","resolution":{"observed_at":"2026-07-03T03:07:35.857767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.11611","last_updated":"2026-06-10T03:23:21Z","snapshot_observed_at":"2026-08-02T19:31:55.030656Z","submitted_at":"2026-06-10T03:23:21Z","title":"SARA: A Dual-Stream VAE for High-Fidelity Speech Generation via Integrating Semantic and Acoustic Representations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T08:38:51.371500Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.11611"},"observation_digest":"sha256:20fd4ad26196c545c97e390ae9cbf1bac5bb0786b06c60110baa05bebb985887","observation_id":"8581762d-eee4-4332-9ce6-51353a517a4c","resolution":{"observed_at":"2026-07-03T12:58:08.371843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.16417","last_updated":"2026-06-24T08:38:50Z","snapshot_observed_at":"2026-08-08T11:17:58.033470Z","submitted_at":"2026-06-15T08:55:28Z","title":"Joycent: Diffusion-based Accent TTS without Accented Phone Prediction","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T03:15:41.454335Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.16417"},"observation_digest":"sha256:a7a423159ccc579c3ef748605ff5b87a35ad2c1d0017d88f86db136cbcaf2617","observation_id":"c83c0c63-cb90-42d8-827d-dff5dd9adeb3","resolution":{"observed_at":"2026-07-03T18:08:46.958514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.20650","last_updated":"2026-06-08T06:54:55Z","snapshot_observed_at":"2026-08-02T23:08:38.292740Z","submitted_at":"2026-06-08T06:54:55Z","title":"EmoInstruct-TTS: Dual-Path Instruction-Guided Emotional Speech Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T17:01:13.972071Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.20650"},"observation_digest":"sha256:a233f6cb9b3096ab8a21f1062d8129ed687048e2ef441d74596300e9141473a2","observation_id":"7a8912fd-aeef-48a7-b060-41486a59264a","resolution":{"observed_at":"2026-07-03T00:47:30.572183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.21343","last_updated":"2026-06-19T11:41:30Z","snapshot_observed_at":"2026-08-13T01:33:39.410657Z","submitted_at":"2026-06-19T11:41:30Z","title":"An Evaluation Framework for Text-to-Speech Voice Reconstruction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-26T13:16:05.358573Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.21343"},"observation_digest":"sha256:20eaaf69e25a8de715ee2eafa7e542b3c2465a0444cc2891b1ac3382867a7074","observation_id":"3fcbdf0b-04d4-4188-a95c-e24b4faa8ff1","resolution":{"observed_at":"2026-07-04T07:39:38.701979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.23190","last_updated":"2026-07-08T11:35:21Z","snapshot_observed_at":"2026-08-12T18:07:30.628246Z","submitted_at":"2026-06-22T11:37:45Z","title":"FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T07:02:36.499424Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.23190"},"observation_digest":"sha256:5fe5e36dbeae56a58bc86e49f330f9911762251fa15652389a63d2db6eecc489","observation_id":"8dde18c9-d7bb-4c47-b60f-d6c59ab96167","resolution":{"observed_at":"2026-07-04T12:19:49.634822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-12T12:44:20.831164Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.23190","last_updated":"2026-07-08T11:35:21Z","snapshot_observed_at":"2026-08-12T18:07:30.628246Z","submitted_at":"2026-06-22T11:37:45Z","title":"FlowTTS-GRPO: Online Reinforcement Learning with Multi-Objective Reward Optimization for Flow-Matching Based Text-to-Speech","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T12:44:20.831164Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.23190"},"observation_digest":"sha256:916cc218ae35612414a20758c100c876d9ef7da3e114dd709158fdd91d8215e4","observation_id":"04d45292-d23e-45b6-b3ed-a2e00b37f448","resolution":{"observed_at":"2026-07-12T12:44:20.831164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.29031","last_updated":"2026-07-09T12:32:31Z","snapshot_observed_at":"2026-07-12T23:17:36.426925Z","submitted_at":"2026-06-27T17:57:27Z","title":"How to Leverage Synthetic Speech for LLM-Based ASR Systems?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T09:35:03.660671Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.29031"},"observation_digest":"sha256:3f8e19968a38df93eda12763ba91c4989e4a94af0f26e4af484f572cf07f4a9d","observation_id":"997da372-83b8-4418-a395-df4cb3399f5d","resolution":{"observed_at":"2026-06-30T12:54:40.709861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-12T11:11:08.878850Z","title":"Indextts2: A breakthrough in emotionally expressive and duration- controlled auto-regressive zero-shot text-to-speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29031","last_updated":"2026-07-09T12:32:31Z","snapshot_observed_at":"2026-07-12T23:17:36.426925Z","submitted_at":"2026-06-27T17:57:27Z","title":"How to Leverage Synthetic Speech for LLM-Based ASR Systems?","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T11:11:08.878850Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.29031"},"observation_digest":"sha256:081f40607ae438d615ed8798ab2d74e74c5363d746c905b7941444773cd21c64","observation_id":"5b46fa76-577d-4a5a-aaf2-9b813acae9fd","resolution":{"observed_at":"2026-07-12T11:11:08.878850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2506.21619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-07-04T12:19:49.633371Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech","venue":null,"work_id":"6c807549-002c-465d-b470-fd5590885fc8","year":2025},"citing_paper":{"arxiv_id":"2606.31128","last_updated":"2026-06-30T04:46:45Z","snapshot_observed_at":"2026-08-13T02:06:13.862338Z","submitted_at":"2026-06-30T04:46:45Z","title":"UniSAE: Unified Speech Attribute Editing on Speaker, Emotion and Low-Level Content via Discrete Phonetic Posteriorgram Modelling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-01T04:05:27.343684Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2606.31128"},"observation_digest":"sha256:8301136e4dd7eec01c9bc0b08837dc4d905104307531008e7cb8d0e720361fa1","observation_id":"cf0a7c94-810c-486b-80c0-50d42fcc5bd4","resolution":{"observed_at":"2026-07-01T11:45:46.182730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-04T02:47:37.726590Z","title":"IndexTTS2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00011","last_updated":"2026-06-19T17:35:42Z","snapshot_observed_at":"2026-08-07T13:04:54.841823Z","submitted_at":"2026-06-19T17:35:42Z","title":"DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T02:47:37.726590Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2608.00011"},"observation_digest":"sha256:2290af97a8ad3ebe1e2fd024210204647fb6966fab7e22d52bfc96aa910a4bdd","observation_id":"28686fc6-7cc7-4693-887f-911c13a40eba","resolution":{"observed_at":"2026-08-04T02:47:37.726590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-04T16:29:31.531580Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech.arXiv preprint arXiv:2506.21619, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-12T20:32:11.393687Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:31.531580Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:3e395041def11afefa9132a7d7e9ddc699aa872a96664e5a623e2cc280638f61","observation_id":"8a132f17-e405-42be-b8b7-27ec31c2d703","resolution":{"observed_at":"2026-08-04T16:29:31.531580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-07T00:14:50.544402Z","title":"Indextts2: A breakthrough in emotionally expressive and duration-controlled auto-regressive zero-shot text-to-speech.arXiv preprint arXiv:2506.21619, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-12T20:32:11.393687Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:50.544402Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:3e0753d43d2da590a6593721b99a7ad20c95d76344ca363c96a6caa09cb9b026","observation_id":"a0cdb54b-a9a6-4ab2-9ced-30c4f7c6082c","resolution":{"observed_at":"2026-08-07T00:14:50.544402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-06T04:46:39.932052Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05126","last_updated":"2026-08-05T17:50:31Z","snapshot_observed_at":"2026-08-10T11:23:41.553679Z","submitted_at":"2026-08-05T17:50:31Z","title":"Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T04:46:39.932052Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2608.05126"},"observation_digest":"sha256:0674f07b4bf3a381f8c61159bbac6e7402d25b987f010d516b745a56bdc78284","observation_id":"f2a5988c-5344-4936-b561-59216c21ed4d","resolution":{"observed_at":"2026-08-06T04:46:39.932052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21619","snapshot_observed_at":"2026-08-10T04:20:41.988791Z","title":"arXiv preprint arXiv:2506.21619 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07462","last_updated":"2026-08-07T17:57:45Z","snapshot_observed_at":"2026-08-13T17:58:58.743137Z","submitted_at":"2026-08-07T17:57:45Z","title":"SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-10T04:20:41.988791Z"},"links":{"cited_paper":"/paper/2506.21619","citing_paper":"/paper/2608.07462"},"observation_digest":"sha256:296a31c634a35a317b7e47bdc52bab42bd9a7cafd6edf7d6b868be420bef6b8a","observation_id":"becd0aca-8ccf-49e1-a195-9a55ee45444e","resolution":{"observed_at":"2026-08-10T04:20:41.988791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21619/citation-record","integrity":"/paper/2506.21619/integrity","json":"/paper/2506.21619/citation-record.json","paper":"/paper/2506.21619"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T23:21:51.474748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:51.474748Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:839bf66b7df43a722e64eaadf309464e06841aeb4555988d5a4363071e99dc7e","observation_id":"ba6482a5-3d62-479f-b595-93150211c630","resolution":{"observed_at":"2026-08-06T23:21:51.474748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:09.442048Z","title":"C.; Vidler, J.; and Roedig, U","venue":null,"work_id":"118cb3f9-d6eb-4a41-8fc3-b73aa44518b6","year":2016},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:51.714747Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:78d90893a50f865b47cde961c12e00f771c35a9616fb221a1b4e34d31f2c64ce","observation_id":"1fbb62bb-fe07-419b-8184-9c3d8349b7d2","resolution":{"observed_at":"2026-08-06T23:22:09.568747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:09.236940Z","title":null,"venue":null,"work_id":"89a61f67-fc08-4c2f-85e6-f2861b3ca4c5","year":2017},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:51.891560Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:62c33df6e2c043dd3527211aaa13e1726a35bc89f0a3c0ea7cfcff30b0aefd8a","observation_id":"857060fd-8691-4b3e-a815-b652d61d99d7","resolution":{"observed_at":"2026-08-06T23:22:09.343035Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:09.034468Z","title":"o lge, E.; G \\","venue":null,"work_id":"8fa8d246-b0d1-4c30-b88e-1cfad71b787e","year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:51.984742Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:139155b815eb1f9df53a3465165b343c6156343fcad74a027c166d896dc6e702","observation_id":"55ae0086-9ecf-43fc-b66e-0443261bdd61","resolution":{"observed_at":"2026-08-06T23:22:09.141449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:08.782744Z","title":"T.; Rubanova, Y.; Bettencourt, J.; and Duvenaud, D","venue":null,"work_id":"6d324970-3118-4af6-9c42-1dd8c31caf51","year":2018},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:52.090822Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:c65a75534c3bd7046271fff6898b35c12318d902c897857d05014baf213f5d23","observation_id":"ed11d40d-2d66-4e37-8525-c8ea8db6105e","resolution":{"observed_at":"2026-08-06T23:22:08.907713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12139","last_updated":"2024-09-24T02:00:54Z","snapshot_observed_at":"2026-08-12T22:42:18.520167Z","submitted_at":"2024-09-18T17:03:12Z","title":"Takin: A Cohort of Superior Quality Zero-shot Speech Generation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12139","snapshot_observed_at":"2026-08-06T23:21:52.191734Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:52.191734Z"},"links":{"cited_paper":"/paper/2409.12139","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:33cd3a71f831f72662b1ba9a4d1d0b2d52dfe28e6ed4d0a3ed1ebc086d13bada","observation_id":"7c44ba08-afc8-4dbf-94ea-b407c5446dd0","resolution":{"observed_at":"2026-08-06T23:21:52.191734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:08.571051Z","title":null,"venue":null,"work_id":"be8241c3-60bd-4a19-b683-ea5179f97abe","year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:52.374989Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:4854e365f8c06bfc5e8207d808099a721f8b456bdd8f3f256c03be86c3f3c1a7","observation_id":"1e47c365-9195-4e19-8118-c14e329e8df8","resolution":{"observed_at":"2026-08-06T23:22:08.664334Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-06T23:21:52.491309Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:52.491309Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:13c33d836984a58676794b8b84d5d4d9749024feb9364144dcd70cfeb6a8e7b9","observation_id":"c7f49650-edd8-42f0-9b75-ed6c67c51a73","resolution":{"observed_at":"2026-08-06T23:21:52.491309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:08.360063Z","title":null,"venue":null,"work_id":"3271598d-805a-4551-80ad-81a28cd80dca","year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:52.584839Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:8a462a014f96438e6f54c0cc55c75e384ff5d8ca9b7a679a117bab8c1bb0169e","observation_id":"3389ed9b-60d1-4229-a949-802ace936876","resolution":{"observed_at":"2026-08-06T23:22:08.443414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:08.073273Z","title":null,"venue":null,"work_id":"516019fc-c7e3-4fc7-80e7-c35ed9068944","year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:52.694748Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:dca67d10d342890a3c3bcde3489ec4262fa119feeb79b329d640e9978916fe05","observation_id":"ed3fd843-b8d4-447d-8fe2-389ea4370182","resolution":{"observed_at":"2026-08-06T23:22:08.224525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-09T19:41:17.737989Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05512","snapshot_observed_at":"2026-08-06T23:21:52.901086Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:52.901086Z"},"links":{"cited_paper":"/paper/2502.05512","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:caec5bd070f827bb85ef9b34ef469660a214928728623d6ea177ea4d623fa6b3","observation_id":"743b8f20-f8f9-484d-9729-16dcc0f97530","resolution":{"observed_at":"2026-08-06T23:21:52.901086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:07.837067Z","title":null,"venue":null,"work_id":"f99ed51f-9f05-45d2-9ecf-b4d072de23b4","year":2018},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:53.044748Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:fc17277a79cf70886d0556e1856686d2ec54538d0f8ea4615bb0647fe2d2150b","observation_id":"2e9b7afa-6e45-4de3-965f-74d7e921dc57","resolution":{"observed_at":"2026-08-06T23:22:07.977427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-06T23:21:53.174876Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:53.174876Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:f71ddd6aad14ddc0aa143b1e5245c663d142ae70e4305fc9f4de70b623e6ef3a","observation_id":"eef22172-612c-406c-8739-4ca04512428d","resolution":{"observed_at":"2026-08-06T23:21:53.174876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-06T23:21:53.286323Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:53.286323Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:a265b22e3b137c5e5211023b1336d22d202a39c0715d16ad829e0347d8cae655","observation_id":"109b26b9-bb32-4ca1-a88b-3a458c154038","resolution":{"observed_at":"2026-08-06T23:21:53.286323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:07.528674Z","title":"A.; and Wang, H","venue":null,"work_id":"fda58668-b7a2-45de-a2a8-ae6f48c3dee7","year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:53.404945Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:56c4d2a4e6fde3ba93a95265482792db364714a8e43abeea30e34384676b390d","observation_id":"248496b5-51e7-4c45-834d-fdca8bf8d666","resolution":{"observed_at":"2026-08-06T23:22:07.662270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:07.235039Z","title":"E.; Wang, X.; Thakker, M.; Li, C.; Tsai, C.; Xiao, Z.; Yang, H.; Zhu, Z.; Tang, M.; Tan, X.; Liu, Y.; Zhao, S.; and Kanda, N","venue":null,"work_id":"c342525b-41b9-4b4d-bd3c-d17126d41c6e","year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:53.514918Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:e2d6a2e16e74b15ddafc6e3913cdc4d09551dbb6b35da2c30aed06f114bf44df","observation_id":"68dc8c7f-92f3-436d-8588-5b356d0e5ff6","resolution":{"observed_at":"2026-08-06T23:22:07.397033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:06.954753Z","title":null,"venue":null,"work_id":"aec97304-cc5c-4e94-9363-613c67bd28ec","year":2016},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:53.654824Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:880f1190eef92383222acad5a14511365c4d7639cbaea54c7f7c3c27dc8858c9","observation_id":"ff85a550-8a16-46de-9218-987d9ba51989","resolution":{"observed_at":"2026-08-06T23:22:07.073937Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:06.581929Z","title":null,"venue":null,"work_id":"f12d88bd-382b-4f0c-8053-c1d1b4099ab8","year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:53.794860Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:497554e543ea46add5939a1c6a7129bddc39e1f98ae3e84be8400f3548ef74a7","observation_id":"3ecb148e-6917-4155-b0bc-9b5bbfe8e867","resolution":{"observed_at":"2026-08-06T23:22:06.782697Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:21:53.970330Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:53.970330Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:0ceed5f0bfcf258595af22e6c861742eba5c90f4ec4dbaaae93f0bc2e712a7df","observation_id":"1112caf4-2c01-4233-bab7-13bf90d6c3d1","resolution":{"observed_at":"2026-08-06T23:21:53.970330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-08-12T22:50:59.196550Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-06T23:21:54.069634Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:54.069634Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:a7849293f7e416443f8bce5c0a45ae5ff46a43e77340f1684b5559ab2e1ea586","observation_id":"f04ef65d-a581-47f3-8108-7d8574e282b2","resolution":{"observed_at":"2026-08-06T23:21:54.069634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:06.312922Z","title":null,"venue":null,"work_id":"908f647f-95d5-4cbb-b5a3-a2db403942ce","year":2021},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:54.324773Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:b93308d74f097129be6c740e02a3160635792d50885a42ea642fab6f6bb78fd3","observation_id":"c8b94280-cdb3-4f31-a909-433f45771f95","resolution":{"observed_at":"2026-08-06T23:22:06.449439Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:54.509932Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:54.509932Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:c635629f0d0f4c9c764ade8eb4b892d04931c59b58de7fe89995b01effdbb4af","observation_id":"e314fc3a-0310-4ba0-888d-305ab9815519","resolution":{"observed_at":"2026-08-06T23:21:54.509932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01205","last_updated":"2025-06-04T06:07:17Z","snapshot_observed_at":"2026-08-12T23:51:42.281664Z","submitted_at":"2024-06-03T11:15:16Z","title":"ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control","version":3},"cited_work":{"arxiv_id":"2406.01205","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.01205","snapshot_observed_at":"2026-08-06T23:22:01.499143Z","title":"ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control","venue":"eess.AS","work_id":"d32d8940-77e0-4bbf-bd4b-b8544c177023","year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:54.594770Z"},"links":{"cited_paper":"/paper/2406.01205","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:20736d0fc4d204867a858f3a35b0fa9f73b02a62b69108100a722870e96735fd","observation_id":"15ff03d1-ba1d-4f90-b261-66173c4e3946","resolution":{"observed_at":"2026-08-06T23:22:01.640762Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-13T04:02:54.961180Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-06T23:21:55.093152Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:55.093152Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:5e5d9a02b43c8195ad782d0c8400a15dcac88a6d21956e3e46b2a7c1dececbd4","observation_id":"a83a6da2-1f0f-4950-84ee-9026ec8c28eb","resolution":{"observed_at":"2026-08-06T23:21:55.093152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10550","last_updated":"2023-07-20T03:28:06Z","snapshot_observed_at":"2026-08-13T10:52:11.579798Z","submitted_at":"2023-07-20T03:28:06Z","title":"SC VALL-E: Style-Controllable Zero-Shot Text to Speech Synthesizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10550","snapshot_observed_at":"2026-08-06T23:21:55.224747Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:55.224747Z"},"links":{"cited_paper":"/paper/2307.10550","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:d584d88295bf2675aff4bb149ca05bec2e7a3d02edc8f72d946914d5fedcdad2","observation_id":"a2e58924-eafc-479b-b71f-e7919cd052b9","resolution":{"observed_at":"2026-08-06T23:21:55.224747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:05.995094Z","title":null,"venue":null,"work_id":"dbfd4822-fd2e-4496-9845-f40ffb640135","year":2020},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:55.490696Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:bd4234fc8409150a67d3514d2b76306ca007856f7b37566ece57d5886dc55406","observation_id":"50297084-4b08-47df-8773-dffb35428c2b","resolution":{"observed_at":"2026-08-06T23:22:06.135488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:05.934703Z","title":null,"venue":null,"work_id":"11e37d02-fd48-4369-8641-64d7c7b9548a","year":1978},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:55.624763Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:87646d0765348229585d9b2e2653335b4a6e5fa8cbf7f6290d48b455d98e070a","observation_id":"eb32930b-3b78-44ad-baa0-fadb9101c5b4","resolution":{"observed_at":"2026-08-06T23:22:05.968350Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:55.719910Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:55.719910Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:ce00ae5b82f2877b805ca2f3ae05d237d3d329186894520af002e224d70d8d59","observation_id":"0fe15248-fe58-4e00-8cc3-3c21292f24be","resolution":{"observed_at":"2026-08-06T23:21:55.719910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11427","last_updated":"2025-02-17T17:34:45Z","snapshot_observed_at":"2026-08-13T12:13:09.440375Z","submitted_at":"2024-06-17T11:25:57Z","title":"DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11427","snapshot_observed_at":"2026-08-06T23:21:55.843335Z","title":"W.; Kim, J.; and Cho, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:55.843335Z"},"links":{"cited_paper":"/paper/2406.11427","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:5b746fdbc20935fb7a48a069df3526a96744adca9925ee25c30ad6953c4f07a8","observation_id":"76fed29e-242d-4dfa-b6fc-41b2f8fc9140","resolution":{"observed_at":"2026-08-06T23:21:55.843335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:05.667419Z","title":null,"venue":null,"work_id":"252f56ea-7439-4a86-a1b6-1bd31a6282ff","year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:55.959394Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:fad4de460c8da8949fdb5d0317b69956d8ee80d24ca21064bddc61efe9c3efa2","observation_id":"55540a81-a7ae-44cd-91a1-fd5e4d506dc2","resolution":{"observed_at":"2026-08-06T23:22:05.796837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04644","last_updated":"2025-04-30T09:30:49Z","snapshot_observed_at":"2026-08-11T13:25:45.866917Z","submitted_at":"2025-01-08T17:52:35Z","title":"FleSpeech: Flexibly Controllable Speech Generation with Various Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04644","snapshot_observed_at":"2026-08-06T23:21:56.065145Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:56.065145Z"},"links":{"cited_paper":"/paper/2501.04644","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:5a499cf4e66160b468593b20eb13f4a7a9f32e404ebb340a58fe94a16c7cb9f1","observation_id":"ec264d95-654f-440a-9c15-2b2f25920f8a","resolution":{"observed_at":"2026-08-06T23:21:56.065145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:05.447617Z","title":"A.; Han, C.; Raghavan, V.; Mischler, G.; and Mesgarani, N","venue":null,"work_id":"92b7f9d3-5fad-4b1b-a755-642714de4d8e","year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:56.158020Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:cdd4825598d42d1e3ad1d8947c95f9a47ba99339e85d9c028880bca2591ba10f","observation_id":"2b651a00-37be-422f-bbfc-7bbf58c16c60","resolution":{"observed_at":"2026-08-06T23:22:05.560496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:05.033028Z","title":null,"venue":null,"work_id":"f3839c0d-20d5-4dd0-92ed-799e3672db90","year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:56.230762Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:c97a6ab5a22cb7522232b83ae6da28aae223e9fcafebe82d0ef4e3f8523dbc69","observation_id":"2bdd39a2-b877-43b9-ba76-26e40715669f","resolution":{"observed_at":"2026-08-06T23:22:05.244739Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09943","last_updated":"2024-11-15T04:43:44Z","snapshot_observed_at":"2026-08-13T06:34:37.505459Z","submitted_at":"2024-11-15T04:43:44Z","title":"Zero-shot Voice Conversion with Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09943","snapshot_observed_at":"2026-08-06T23:21:56.314992Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:56.314992Z"},"links":{"cited_paper":"/paper/2411.09943","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:e1831fb958eadddda9f431d994da2e82f7566c95dbe9d32d74688c7bd7dee947","observation_id":"d4926be1-b5a6-4c69-9098-2f81b5e375b4","resolution":{"observed_at":"2026-08-06T23:21:56.314992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:04.669406Z","title":null,"venue":null,"work_id":"2f34c6e1-9235-49bc-85ce-457512b1beea","year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:56.474829Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:b21eac0509ae948ad26ad6059c7a1e4682b41e48711f0fa40ad5e3e826779d9a","observation_id":"db8cd0e8-bcf4-4dc7-9249-62ea0776d5a3","resolution":{"observed_at":"2026-08-06T23:22:04.820065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-06T23:21:56.557191Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:56.557191Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:fd5893c1529d6d91d9e8766f135ce5725b657c8ec541535a9a8fa6b7c84cfee1","observation_id":"d7051c0b-f641-4363-940d-13858c01e34d","resolution":{"observed_at":"2026-08-06T23:21:56.557191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:56.630048Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:56.630048Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:48bf2b9ab882d2d853ba0bdb5adeaceaf86fec65f2452edcf33fdf3b78a859ad","observation_id":"25004936-e1d2-498e-a7ea-46875215afb1","resolution":{"observed_at":"2026-08-06T23:21:56.630048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:56.720288Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:56.720288Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:51797b65af864f9bd4c7e55cb7b81f391328ed90858f3543b48ac9e02728d207","observation_id":"42046312-291d-4ca5-8cb5-79b7fa1cdd94","resolution":{"observed_at":"2026-08-06T23:21:56.720288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:04.461305Z","title":null,"venue":null,"work_id":"2ed67779-7b56-4a6e-a6b4-4750f4493702","year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:57.085294Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:7144abb90c9ef38a9e94913be15f389f3ce9bd267222d288e3997d2fc622c76e","observation_id":"ca11a80b-9add-4a97-88fa-d01d3087f14f","resolution":{"observed_at":"2026-08-06T23:22:04.538604Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:04.303290Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; Krueger, G.; and Sutskever, I","venue":null,"work_id":"43c0a0a1-6c2f-45fb-a115-abff33628c97","year":2021},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:57.212866Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:14b42b51fece369d48468ec5919e4619166a5b5dde991affac73c2644c6b7e0a","observation_id":"51dd94e3-a1a6-48c6-9188-206b659b9008","resolution":{"observed_at":"2026-08-06T23:22:04.386285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:57.367656Z","title":"W.; Xu, T.; Brockman, G.; McLeavey, C.; and Sutskever, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:57.367656Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:f8bb21f4696cd517c7907ed889687d83f70688e3e4bd73221ca915bf79d0bc7a","observation_id":"9ecc25f5-0aeb-4093-ba3e-7273c48a84ff","resolution":{"observed_at":"2026-08-06T23:21:57.367656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:04.107449Z","title":null,"venue":null,"work_id":"52c5bf7c-011d-4f54-9deb-a17f448f8bf1","year":2022},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:57.484383Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:45246a0a04a4bdf73011d549386194dbb6c9f1a3b74fb5de72161325f09c0705","observation_id":"4753148e-6bf7-473f-8d88-4f3c673be2e8","resolution":{"observed_at":"2026-08-06T23:22:04.191326Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:03.961161Z","title":"A.; Gonzalez, J.; and Escalera, S","venue":null,"work_id":"3c8642c4-9302-4830-a9b0-2c80eb40e15e","year":2018},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:57.624749Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:d77449a343ea88a77c28e1a78c3ac1230eaee116bd616a2ac5275876dcd16fe6","observation_id":"b6bf2331-1b89-4039-938e-dc3b51fde4bb","resolution":{"observed_at":"2026-08-06T23:22:04.028061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:57.740164Z","title":null,"venue":null,"work_id":null,"year":1958},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:57.740164Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:95e5088cdc86978a681d678ef4fe215e12b5ef9cb0ebee5d90ac1bd8c39556b9","observation_id":"f6c00cfd-550f-4e87-9953-321632221f2c","resolution":{"observed_at":"2026-08-06T23:21:57.740164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:03.737813Z","title":"E.; Hinton, G","venue":null,"work_id":"32d83e08-dd49-4d85-8c52-57b533f92fc8","year":1986},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:57.864744Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:31e934a2a826a99ec5abe3c21029a54ca318584a8b9abe07a97ea313ca69d38a","observation_id":"d58f3e58-36fc-4fd0-8dcd-579b40551c1b","resolution":{"observed_at":"2026-08-06T23:22:03.851801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08802","last_updated":"2024-06-13T04:36:34Z","snapshot_observed_at":"2026-08-13T01:16:40.148433Z","submitted_at":"2024-06-13T04:36:34Z","title":"DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing","version":1},"cited_work":{"arxiv_id":"2406.08802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08802","snapshot_observed_at":"2026-08-06T23:22:00.975372Z","title":"DubWise: Video-Guided Speech Duration Control in Multimodal LLM-based Text-to-Speech for Dubbing","venue":"eess.AS","work_id":"cce99a29-b159-41e1-a7f3-bf9d9c75dac4","year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:58.044747Z"},"links":{"cited_paper":"/paper/2406.08802","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:4b475633f61be1033581cc81aede8701894686ebb82ab6b4c142880edc60cf90","observation_id":"214db0ad-301f-4718-9fc1-d18dda973ad7","resolution":{"observed_at":"2026-08-06T23:22:01.078010Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:03.528349Z","title":null,"venue":null,"work_id":"6ca8a441-2a09-4457-91d1-50458d4befde","year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:58.179341Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:9b238875f5776031ee8e0469a0ccbd9a6cba7634d1f843abcf03909f1d123b89","observation_id":"e3098054-309b-4bc4-bf24-f287f3b7d03d","resolution":{"observed_at":"2026-08-06T23:22:03.634747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:03.227493Z","title":null,"venue":null,"work_id":"a8fedddf-b5bd-4242-ae63-db254f4e92c8","year":2019},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:58.359642Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:efe91808a275272b98bd7962e51dd176d3cfebe28c1b41fa37cab6e3f461be3d","observation_id":"a39cf59c-84a4-4e32-b488-bc1979a61e5b","resolution":{"observed_at":"2026-08-06T23:22:03.332892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T23:21:58.542592Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:58.542592Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:ad2e73ae13a8cbf300b083d58ce5609a9ea3963336336b6674be08200f2263b7","observation_id":"6357baba-1f9d-446b-aecb-937f7b65bf4e","resolution":{"observed_at":"2026-08-06T23:21:58.542592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:02.972020Z","title":null,"venue":null,"work_id":"cd822f9b-7d07-4c14-be29-8ddf21f8a913","year":2017},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:58.696284Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:0008b740f6b79362d3dddee7a3f881a0e205044d6be91e0649ac1f8a9afaf028","observation_id":"c60b0e3d-ffb6-432d-806c-cc2f525b1e2e","resolution":{"observed_at":"2026-08-06T23:22:03.046429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:02.767450Z","title":"N.; Kaiser, L.; and Polosukhin, I","venue":null,"work_id":"bdd681f7-b936-4985-a9f7-bc0354c65235","year":2017},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:58.874889Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:e65a5df0f97e6ea4d10a4f7bc66c271e2180745ffac08bcd9d746f0770f3318f","observation_id":"b861883c-b8da-4abf-abeb-f1d59ec23138","resolution":{"observed_at":"2026-08-06T23:22:02.851166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-08-13T16:11:28.134657Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-06T23:21:59.042807Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.042807Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:d717a57c7e1e4d86eff4f5eb7c5ce9d0d6fb62c0cce01a3001b4cd73f99e13ea","observation_id":"7cf52851-2267-4464-ac50-5ebe5ba8e95d","resolution":{"observed_at":"2026-08-06T23:21:59.042807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-12T22:53:35.238599Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-06T23:21:59.231724Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.231724Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:87607be7674e8e8e2b38846c8dd0afbf3a64b25d9685d6729ccecee3fe3f4785","observation_id":"04e4ef9c-3e63-4826-b1d8-4ba7a760e217","resolution":{"observed_at":"2026-08-06T23:21:59.231724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T23:21:59.316444Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.316444Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:9dabf7a4ae4d60152ebd8cecb88c69254791a17386d8b0198c8bd72cd8341de4","observation_id":"87488ee5-d784-4d51-ba47-6cc934239f83","resolution":{"observed_at":"2026-08-06T23:21:59.316444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-08-12T23:50:29.503225Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-08-06T23:21:59.444748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.444748Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:b6b0ce8bc6165149f26b54ab3ae63f6cf60568900c61409873c35833ea1d7b82","observation_id":"3532d1ea-3948-4fe4-a0b4-111f73970903","resolution":{"observed_at":"2026-08-06T23:21:59.444748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-12T12:30:42.029400Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07243","snapshot_observed_at":"2026-08-06T23:21:59.575812Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.575812Z"},"links":{"cited_paper":"/paper/2502.07243","citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:b2251891908858af2de9cbc4b2d15e89b2df12a22ff4e7f03e4002294619ae58","observation_id":"abde2652-5844-45b5-bc1b-6b14c8aafb41","resolution":{"observed_at":"2026-08-06T23:21:59.575812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:02.593896Z","title":null,"venue":null,"work_id":"bdee25cc-3341-45dc-b007-4a039f7afada","year":2021},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.683308Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:5039ccebbcb70b1ea2c06a10e95fdc9112bf79cd49d4236b86b5d0ebc80f539a","observation_id":"4b14c852-8f34-4761-bb46-b3461b79d073","resolution":{"observed_at":"2026-08-06T23:22:02.663861Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:02.271056Z","title":"W.; and Li, H","venue":null,"work_id":"bb952b43-6e73-43bf-8a6e-12d3c090900f","year":2023},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.768998Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:f673c001298be4a0e9761cc6843a94b9fbe8acab8b577871094afe008efca9c3","observation_id":"63838768-dc09-4026-8baa-6769dd2aae4b","resolution":{"observed_at":"2026-08-06T23:22:02.432658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:02.031475Z","title":null,"venue":null,"work_id":"21d74c13-4278-45d2-9bb3-a42c1380f82f","year":2024},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T23:21:59.914789Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:4efcdbde9c18876219b6200ebe72308a25b684d0e9ce0123372955b0759662f8","observation_id":"d5da1b1c-023a-4ea3-99d9-63d9d35a2d6f","resolution":{"observed_at":"2026-08-06T23:22:02.151155Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:00.026278Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T23:22:00.026278Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:4ebd57cb141a405b5d240761849d7301a41331a81419f2fb45a7834765f7f24b","observation_id":"6cb74769-28fd-4cfb-baad-e0f37447b91e","resolution":{"observed_at":"2026-08-06T23:22:00.026278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:22:00.140173Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T23:22:00.140173Z"},"links":{"citing_paper":"/paper/2506.21619"},"observation_digest":"sha256:747680bab57abaac123bddd212f7c08639c4bea2c0601c2a067b1688472d5c4f","observation_id":"4c4a7b8d-536e-41d3-aa1d-07323ea46f4d","resolution":{"observed_at":"2026-08-06T23:22:00.140173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21619","last_updated":"2025-09-03T10:46:35Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T06:46:54.528137Z","submitted_at":"2025-06-23T08:33:40Z","title":"IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 42 inbound Pith citation observations for arXiv:2506.21619."}