{"as_of":"2026-08-10T04:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff906b72ef3614bf4dafaad87a723520a2b182bd90f0e87eff8ee318808adeec","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T16:43:08.790672Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":"2402.01912","doi":"10.48550/arxiv.2402.01912","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations.arXiv preprint arXiv:2402.01912","venue":"arXiv (Cornell University)","work_id":"273353a0-dd82-4b8b-9507-22052ee19859","year":2024},"citing_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T06:19:09.507440Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2412.10117"},"observation_digest":"sha256:0dff6bb5ea3fec68c1f0b5f01a88dff5a564c868071c0f91462c25c1884ad99d","observation_id":"381e5d4b-ee52-4d40-b293-c6eadfcfbea1","resolution":{"observed_at":"2026-05-13T06:19:09.598879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-09T16:43:08.790672Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-09T19:41:15.653121Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.790672Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:3a624cf4b149ee3df414a49c4176afdc0dff4ae0e58e45fd3e1c26a6d1e4ffaa","observation_id":"cd010cce-1125-4d87-ad1e-da6c7c2af2ce","resolution":{"observed_at":"2026-08-09T16:43:08.790672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-07T15:33:51.142199Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations.arXiv preprint arXiv:2402.01912, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14648","last_updated":"2025-05-20T17:36:41Z","snapshot_observed_at":"2026-08-08T04:51:39.118604Z","submitted_at":"2025-05-20T17:36:41Z","title":"Vox-Profile: A Speech Foundation Model Benchmark for Characterizing Diverse Speaker and Speech Traits","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:51.142199Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2505.14648"},"observation_digest":"sha256:6b94c061fed81a39161ecd739b7f3664cf11581582f5654906c6ef3f4880156b","observation_id":"1222f66f-e60a-4da6-a341-18a4d700dfa7","resolution":{"observed_at":"2026-08-07T15:33:51.142199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-07T14:32:42.812459Z","title":"Natural language guidance of high- fidelity text-to-speech with synthetic annotations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18609","last_updated":"2025-05-27T14:19:23Z","snapshot_observed_at":"2026-08-08T01:17:21.397743Z","submitted_at":"2025-05-24T09:16:14Z","title":"RASMALAI: Resources for Adaptive Speech Modeling in Indian Languages with Accents and Intonations","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:32:42.812459Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2505.18609"},"observation_digest":"sha256:05c023a9967bfa1d1bc9c2367ec871704a227c6acd01208be09609cff26410df","observation_id":"db7c9d04-f6fa-4db1-9bc1-def38a7a896a","resolution":{"observed_at":"2026-08-07T14:32:42.812459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-07T14:26:04.837891Z","title":"Natural language guidance of high- fidelity text-to-speech with synthetic annotations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18972","last_updated":"2025-05-25T04:43:17Z","snapshot_observed_at":"2026-08-08T00:26:18.069918Z","submitted_at":"2025-05-25T04:43:17Z","title":"Revival with Voice: Multi-modal Controllable Text-to-Speech Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:26:04.837891Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2505.18972"},"observation_digest":"sha256:6523f1fc4b70aec698938d6dd97972d8ab0dd15f8465c5d7a72112d03be6c7ca","observation_id":"1d643197-ab5f-49a1-96c9-e56bb18d5d6e","resolution":{"observed_at":"2026-08-07T14:26:04.837891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-07T14:19:55.191205Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations.ArXiv, abs/2402.01912, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.191205Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:c5a1fea12f4650f0d2fc0f7cba08d6f0b0beebeebbb60db971f0a04c1e9db974","observation_id":"a0230389-f536-413d-b453-4a4d8395e27d","resolution":{"observed_at":"2026-08-07T14:19:55.191205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-06T23:49:29.502416Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-08T22:59:15.277514Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.502416Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:501a8dc2d9a72034111d5b60c9109560a89f5f7fbc2e7b50b2af154c337f6790","observation_id":"de9f7812-7aa8-4c1b-ba5a-0257ba1e96db","resolution":{"observed_at":"2026-08-06T23:49:29.502416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-06T23:10:13.177749Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19502","last_updated":"2025-07-15T06:04:25Z","snapshot_observed_at":"2026-08-08T09:12:20.223672Z","submitted_at":"2025-06-24T10:40:23Z","title":"MATE: LLM-Powered Multi-Agent Translation Environment for Accessibility Applications","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:10:13.177749Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2506.19502"},"observation_digest":"sha256:4256aecae1c791ec3c341a53c19f290313bdcdfe6bb4c12d078058cbdc43962f","observation_id":"fb386c66-e20f-43ce-a4ca-d2c323e05703","resolution":{"observed_at":"2026-08-06T23:10:13.177749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-06T21:11:40.456914Z","title":"Natural language guidance of high- fidelity text-to-speech with synthetic annotations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-08T00:25:18.890247Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.456914Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:1f64547d89ca4ded83d2dab46476b39bdadca2ff83c18d7bf0484b9979c061ca","observation_id":"5c2cf6a8-f131-4464-984c-ec5e78ae53f9","resolution":{"observed_at":"2026-08-06T21:11:40.456914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-06T18:36:07.484115Z","title":"Lyth and S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07799","last_updated":"2025-07-10T14:26:28Z","snapshot_observed_at":"2026-08-08T00:24:15.711420Z","submitted_at":"2025-07-10T14:26:28Z","title":"SecureSpeech: Prompt-based Speaker and Content Protection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:36:07.484115Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2507.07799"},"observation_digest":"sha256:e5c64f7e19eb814ef81976646eb7ca61081c56f6d5718af7e0bf4e6841c47e08","observation_id":"9d1545d8-6f18-4bb2-92e6-f9bf768217e7","resolution":{"observed_at":"2026-08-06T18:36:07.484115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-06T18:21:33.855401Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08603","last_updated":"2025-07-11T13:55:45Z","snapshot_observed_at":"2026-08-09T04:59:19.398088Z","submitted_at":"2025-07-11T13:55:45Z","title":"Unlocking Speech Instruction Data Potential with Query Rewriting","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T18:21:33.855401Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2507.08603"},"observation_digest":"sha256:0d6aae03fda82e56126400f029b739101530c6a252acdc7e6bc64a0416f37886","observation_id":"cdb68026-84dd-4f38-be9c-6b9913761e75","resolution":{"observed_at":"2026-08-06T18:21:33.855401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-06T14:50:04.214444Z","title":"ArXiv abs/2402.01912 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.214444Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:9ead9193b8e1738390262127177274316b218908cf9b553b7249601472bf1c28","observation_id":"aea71d72-4db1-4369-9af7-bc31544e2993","resolution":{"observed_at":"2026-08-06T14:50:04.214444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-06T12:49:19.629984Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21463","last_updated":"2025-07-29T03:06:31Z","snapshot_observed_at":"2026-08-07T23:23:35.413701Z","submitted_at":"2025-07-29T03:06:31Z","title":"SpeechFake: A Large-Scale Multilingual Speech Deepfake Dataset Incorporating Cutting-Edge Generation Methods","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T12:49:19.629984Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2507.21463"},"observation_digest":"sha256:19ac3ba73185d4c82d4c6a52c96ed8efe5b5d73200672a1b30f7320a9a3946c6","observation_id":"1ce65cf1-7f38-4863-bf96-b730fdb28a2c","resolution":{"observed_at":"2026-08-06T12:49:19.629984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-05T20:04:48.453562Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.453562Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:dc46a51a40da316d344001ba0bdab1e9b28d510f17e15cdc085a9ac00763c65e","observation_id":"604d43fb-5ff3-4590-b857-a3b1e3df899f","resolution":{"observed_at":"2026-08-05T20:04:48.453562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-04T18:58:04.179780Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09550","last_updated":"2025-09-12T06:43:25Z","snapshot_observed_at":"2026-08-08T11:04:43.691668Z","submitted_at":"2025-09-11T15:39:59Z","title":"Finite Scalar Quantization Enables Redundant and Transmission-Robust Neural Audio Compression at Low Bit-rates","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:04.179780Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2509.09550"},"observation_digest":"sha256:af0cdac8ef7671a2e01df656d4462e2e94d8df21338e55a0029664938e70188e","observation_id":"aeae0d3f-9346-482b-8379-4d91f7bfc692","resolution":{"observed_at":"2026-08-04T18:58:04.179780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":"2402.01912","doi":"10.48550/arxiv.2402.01912","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations.arXiv preprint arXiv:2402.01912","venue":"arXiv (Cornell University)","work_id":"273353a0-dd82-4b8b-9507-22052ee19859","year":2024},"citing_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-04T12:22:34.670840Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T19:24:56.057631Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2601.15621"},"observation_digest":"sha256:470cf94f00f12e52118e96fe96e34056fc13928741e1387917e859c3923fc7b0","observation_id":"160ea297-49c7-498b-8f39-1db404dc9e29","resolution":{"observed_at":"2026-05-16T19:24:56.136038Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":"2402.01912","doi":"10.48550/arxiv.2402.01912","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations.arXiv preprint arXiv:2402.01912","venue":"arXiv (Cornell University)","work_id":"273353a0-dd82-4b8b-9507-22052ee19859","year":2024},"citing_paper":{"arxiv_id":"2603.02364","last_updated":"2026-06-27T13:26:12Z","snapshot_observed_at":"2026-08-02T19:24:54.855385Z","submitted_at":"2026-03-02T20:11:06Z","title":"When Spoof Detectors Travel: Evaluation Across 66 Languages in the Low-Resource Language Spoofing Corpus","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T16:29:10.899659Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2603.02364"},"observation_digest":"sha256:cd68e53188242a9427569f2916eaf2a5916f9e44caf8906db4f2af4c28858f5e","observation_id":"949c6284-1e5f-489c-ab16-b3c6e92f45be","resolution":{"observed_at":"2026-05-15T16:30:09.664146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-02T19:24:56.523051Z","title":"Natural Language Guidance of High- Fidelity Text-to-Speech with Synthetic Annotations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.02364","last_updated":"2026-06-27T13:26:12Z","snapshot_observed_at":"2026-08-02T19:24:54.855385Z","submitted_at":"2026-03-02T20:11:06Z","title":"When Spoof Detectors Travel: Evaluation Across 66 Languages in the Low-Resource Language Spoofing Corpus","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T19:24:56.523051Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2603.02364"},"observation_digest":"sha256:adb572a0e0400148cb9681bd5ac61c730334dc39bd699d3b783980055ae80010","observation_id":"91288b67-7835-4021-acc9-f75b037dc95e","resolution":{"observed_at":"2026-08-02T19:24:56.523051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":"2402.01912","doi":"10.48550/arxiv.2402.01912","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations.arXiv preprint arXiv:2402.01912","venue":"arXiv (Cornell University)","work_id":"273353a0-dd82-4b8b-9507-22052ee19859","year":2024},"citing_paper":{"arxiv_id":"2604.17958","last_updated":"2026-04-20T08:39:55Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T08:39:55Z","title":"MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T04:03:38.919545Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2604.17958"},"observation_digest":"sha256:0e53a84aefe10835b3138d174cd58825423f9fee259a1e8ac0ed919ed70375de","observation_id":"5ff90eac-0152-49b9-a645-8644c62c3689","resolution":{"observed_at":"2026-05-10T04:04:47.244302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":"2402.01912","doi":"10.48550/arxiv.2402.01912","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations.arXiv preprint arXiv:2402.01912","venue":"arXiv (Cornell University)","work_id":"273353a0-dd82-4b8b-9507-22052ee19859","year":2024},"citing_paper":{"arxiv_id":"2604.19330","last_updated":"2026-04-29T12:12:36Z","snapshot_observed_at":"2026-08-03T01:33:20.785741Z","submitted_at":"2026-04-21T10:58:48Z","title":"Text-To-Speech with Chain-of-Details: modeling temporal dynamics in speech generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T01:01:06.094276Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2604.19330"},"observation_digest":"sha256:4ab159eb2061962dbf164268bf16ce372c959052e0cb3cf2393b0d6551556106","observation_id":"4b13ef46-b70c-4ac7-87e6-6a8f1720f315","resolution":{"observed_at":"2026-05-10T01:04:50.107872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":"2402.01912","doi":"10.48550/arxiv.2402.01912","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations.arXiv preprint arXiv:2402.01912","venue":"arXiv (Cornell University)","work_id":"273353a0-dd82-4b8b-9507-22052ee19859","year":2024},"citing_paper":{"arxiv_id":"2605.00861","last_updated":"2026-04-21T10:34:41Z","snapshot_observed_at":"2026-07-06T23:14:11.211164Z","submitted_at":"2026-04-21T10:34:41Z","title":"Voice Mapping of Text-to-Speech Systems: A Metric-Based Approach for Voice Quality Assessment","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T01:07:50.243903Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2605.00861"},"observation_digest":"sha256:469b4adcb97fed646281c7c282dd22056f1f41663696171e3f71885fe3786a99","observation_id":"8758a34a-8d0e-4f9b-b29b-0d694d21bec0","resolution":{"observed_at":"2026-05-10T01:10:09.324177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":"2402.01912","doi":"10.48550/arxiv.2402.01912","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations.arXiv preprint arXiv:2402.01912","venue":"arXiv (Cornell University)","work_id":"273353a0-dd82-4b8b-9507-22052ee19859","year":2024},"citing_paper":{"arxiv_id":"2605.12242","last_updated":"2026-05-12T15:11:36Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:11:36Z","title":"Mind the Pause: Disfluency-Aware Objective Tuning for Multilingual Speech Correction with LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T05:20:35.333172Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2605.12242"},"observation_digest":"sha256:727edc699dc7b658fa7cb70446028b4a276d16d06d70a82e821bba2ce7d21c65","observation_id":"12c7d0ed-e83f-4cc2-907b-800c1af311b4","resolution":{"observed_at":"2026-05-13T05:27:18.771185Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-07-13T00:18:36.390365Z","title":"InProceedings of the AAAI Conference on Artificial Intelligence, volume 38, pages 18698– 18706","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.27376","last_updated":"2026-04-09T01:06:26Z","snapshot_observed_at":"2026-07-13T00:18:29.539736Z","submitted_at":"2026-04-09T01:06:26Z","title":"Unlocking Fine-Grained and Within-Utterance Speaking Style Control in Prompt-Based Text-to-Speech Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T00:18:36.390365Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2605.27376"},"observation_digest":"sha256:431a21571112140884335cf9ff8e37d3b924ab044c8e262ef9104056321d272c","observation_id":"b0b47817-d91b-4f24-b4e5-bb1081c9a2ee","resolution":{"observed_at":"2026-07-13T00:18:36.390365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":"2402.01912","doi":"10.48550/arxiv.2402.01912","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations.arXiv preprint arXiv:2402.01912","venue":"arXiv (Cornell University)","work_id":"273353a0-dd82-4b8b-9507-22052ee19859","year":2024},"citing_paper":{"arxiv_id":"2606.05889","last_updated":"2026-06-04T08:58:57Z","snapshot_observed_at":"2026-07-06T23:45:47.161248Z","submitted_at":"2026-06-04T08:58:57Z","title":"GLASS: GRPO-Trained LoRA for Acoustic Style Steering in Zero-Shot Text-to-Speech","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T23:53:55.385445Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2606.05889"},"observation_digest":"sha256:c0a58be5dea6499abd8b04dd0f20a4446e5b09e37b5b66354e987cbf3279feb2","observation_id":"d9f6ae9c-89d1-4459-9a1f-92ba7f33e61a","resolution":{"observed_at":"2026-07-02T15:27:04.903956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":"2402.01912","doi":"10.48550/arxiv.2402.01912","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations.arXiv preprint arXiv:2402.01912","venue":"arXiv (Cornell University)","work_id":"273353a0-dd82-4b8b-9507-22052ee19859","year":2024},"citing_paper":{"arxiv_id":"2606.06928","last_updated":"2026-06-05T05:43:15Z","snapshot_observed_at":"2026-07-06T23:46:37.903443Z","submitted_at":"2026-06-05T05:43:15Z","title":"VoxCPM2 Technical Report","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T21:18:22.911332Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2606.06928"},"observation_digest":"sha256:a8746f864ace3a52ed9833d8f142342adac8eac4799555ed25920196fad8d14e","observation_id":"f00501ae-1501-41ad-b754-7230a5da2bd1","resolution":{"observed_at":"2026-07-02T19:47:19.727005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":"2402.01912","doi":"10.48550/arxiv.2402.01912","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations.arXiv preprint arXiv:2402.01912","venue":"arXiv (Cornell University)","work_id":"273353a0-dd82-4b8b-9507-22052ee19859","year":2024},"citing_paper":{"arxiv_id":"2606.12199","last_updated":"2026-06-10T15:19:15Z","snapshot_observed_at":"2026-08-07T21:59:04.835770Z","submitted_at":"2026-06-10T15:19:15Z","title":"Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T08:18:23.182355Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2606.12199"},"observation_digest":"sha256:ec7aec34d2af02d4478c5fc2ba2acc4de06e1b88dc600b3911a686518d515a4e","observation_id":"b681c0fc-bc11-41d0-9b8e-f75c196e9e85","resolution":{"observed_at":"2026-07-03T13:18:12.790821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":"2402.01912","doi":"10.48550/arxiv.2402.01912","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations.arXiv preprint arXiv:2402.01912","venue":"arXiv (Cornell University)","work_id":"273353a0-dd82-4b8b-9507-22052ee19859","year":2024},"citing_paper":{"arxiv_id":"2606.19209","last_updated":"2026-06-18T16:42:05Z","snapshot_observed_at":"2026-08-05T18:10:28.030171Z","submitted_at":"2026-06-17T15:45:43Z","title":"FineCombo-TTS: Collaborative and Precise Controllable Speech Synthesis Using Text Descriptions and Reference Speech","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T19:09:33.605232Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2606.19209"},"observation_digest":"sha256:7f51a3b8ac4293c5f0ae8b0fae9b0e3165f1d268f1c60c98fccc275647ccc042","observation_id":"3ad237b5-80b3-46d7-9f7a-40afd9551ec8","resolution":{"observed_at":"2026-07-04T02:49:24.577822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":"2402.01912","doi":"10.48550/arxiv.2402.01912","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations.arXiv preprint arXiv:2402.01912","venue":"arXiv (Cornell University)","work_id":"273353a0-dd82-4b8b-9507-22052ee19859","year":2024},"citing_paper":{"arxiv_id":"2606.20650","last_updated":"2026-06-08T06:54:55Z","snapshot_observed_at":"2026-08-02T23:08:38.292740Z","submitted_at":"2026-06-08T06:54:55Z","title":"EmoInstruct-TTS: Dual-Path Instruction-Guided Emotional Speech Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T17:01:13.972071Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2606.20650"},"observation_digest":"sha256:8145eafa0461b624c4391970d365d3b89935e26f0c92ac1c83913faf2b1f9ce3","observation_id":"4655fea6-e4ec-4da8-8bdb-f9354cff3497","resolution":{"observed_at":"2026-07-03T00:47:30.552835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-01T18:46:13.750265Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations.arXiv preprint arXiv:2402.01912, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18662","last_updated":"2026-07-19T11:20:25Z","snapshot_observed_at":"2026-08-09T23:32:52.428669Z","submitted_at":"2026-07-19T11:20:25Z","title":"Staged Depth-Pruning Distillation of a Flow-Matching Text-to-Speech Teacher: A Compact Hindi Speech Synthesizer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T18:46:13.750265Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2607.18662"},"observation_digest":"sha256:eac828df3e8ce95ff876bd639236bdd1f94378fdfe391699887d62221c2beb6a","observation_id":"7e2215f8-42e7-4a5b-9347-715b6a74b32e","resolution":{"observed_at":"2026-08-01T18:46:13.750265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-04T16:29:26.024843Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-09T11:38:54.510697Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T16:29:26.024843Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:1b65d1383921b5aedab17b041dedbab0be82a1c09d584ee59589736a927873b1","observation_id":"69f255a2-f5d5-4f26-a467-9c911d7b2c6a","resolution":{"observed_at":"2026-08-04T16:29:26.024843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-07T00:14:46.524756Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02023","last_updated":"2026-08-04T08:54:48Z","snapshot_observed_at":"2026-08-09T11:38:54.510697Z","submitted_at":"2026-08-03T10:20:52Z","title":"SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:46.524756Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2608.02023"},"observation_digest":"sha256:74bd961a7c87f1a25e85e3d54b7f677695cb2155fcdc650e4cdf98a089da8c6e","observation_id":"d33c18b7-0caa-4bd3-9a9e-2e5011ebca0f","resolution":{"observed_at":"2026-08-07T00:14:46.524756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-04T10:58:58.620852Z","title":"Microsoft Corporation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02235","last_updated":"2026-08-03T13:49:11Z","snapshot_observed_at":"2026-08-09T21:37:29.393286Z","submitted_at":"2026-08-03T13:49:11Z","title":"Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T10:58:58.620852Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2608.02235"},"observation_digest":"sha256:d83a81ee6f05d3906b06179fd165a57053cf39f4633656266e41c362150f8871","observation_id":"8851c956-d783-434b-9400-67f0ca5946d0","resolution":{"observed_at":"2026-08-04T10:58:58.620852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.01912/citation-record","integrity":"/paper/2402.01912/integrity","json":"/paper/2402.01912/citation-record.json","paper":"/paper/2402.01912"},"outbound":[],"paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2402.01912."}