{"as_of":"2026-08-18T00:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f7e7193c759775b22e9666b755e4d0138827bf20d97a72c8d294e8841343c6f","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:43:27.497465Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:43:24.605598Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T00:43:28.653584Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"cited_work":{"arxiv_id":"2608.00545","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.00545","snapshot_observed_at":"2026-08-05T00:43:28.653584Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","venue":"cs.SD","work_id":"21303c92-3aa0-48e2-8e0e-00fa8766cb18","year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:24.605598Z"},"links":{"cited_paper":"/paper/2608.00545","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:5409187242d8960acd96948d3584d245dd7a7944bcae01c790621d829a199dbf","observation_id":"f2c67c2c-2d77-4bdf-84b3-e3939f851936","resolution":{"observed_at":"2026-08-05T00:43:28.743868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2608.00545/citation-record","integrity":"/paper/2608.00545/integrity","json":"/paper/2608.00545/citation-record.json","paper":"/paper/2608.00545"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"cited_work":{"arxiv_id":"2608.00545","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.00545","snapshot_observed_at":"2026-08-05T00:43:28.653584Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","venue":"cs.SD","work_id":"21303c92-3aa0-48e2-8e0e-00fa8766cb18","year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:24.605598Z"},"links":{"cited_paper":"/paper/2608.00545","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:5409187242d8960acd96948d3584d245dd7a7944bcae01c790621d829a199dbf","observation_id":"f2c67c2c-2d77-4bdf-84b3-e3939f851936","resolution":{"observed_at":"2026-08-05T00:43:28.743868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:34.006718Z","title":"Natural-language control of speech Controllable speech generation has traditionally relied on either global style representations or explicitly defined acoustic factors","venue":null,"work_id":"fcd99faf-ccec-4307-aa0f-eedbc4917840","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:24.660613Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:493953021c725d5e1a1fe56414c6985a37d01e873f09dba414dbfb23a0e12526","observation_id":"1af93a5b-9a40-4083-b75d-02b864f15360","resolution":{"observed_at":"2026-08-05T00:43:34.011411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.990911Z","title":"Systems and generation matrix We evaluate CosyV oice3, V oxCPM2, and Fish-Speech-S2, three in- dependently developed reference-conditioned speech-generation sys- tems","venue":null,"work_id":"24e26c4d-5904-4d32-8a6f-2911319a5199","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:24.741939Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:08bccfb63d11f39c0defe7f5dfec434974b4c05e104bff5712a43387fa60f69d","observation_id":"6db9e2a1-44e4-4da9-90bc-5cf3904900c8","resolution":{"observed_at":"2026-08-05T00:43:33.995825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.977003Z","title":"Target dir","venue":null,"work_id":"4b380a1f-afa2-463c-b9b6-3ac8fccd2852","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:24.829085Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:ab1658629b26b9eaa2c2266eb68963c2c34b5a1800e5641d423bc132e51aeb3a","observation_id":"f101efea-c6d6-4bf3-a55e-bb8d2bfb4899","resolution":{"observed_at":"2026-08-05T00:43:33.981480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.963197Z","title":"Eligible","venue":null,"work_id":"8f362597-c231-4c2d-9763-70cde41b8b17","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:24.944382Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:c830afc4537818594f53098adab81d848674f612e48384c0394f43e93208eaeb","observation_id":"000c481e-3285-4b69-b20b-f6f44bd78ae0","resolution":{"observed_at":"2026-08-05T00:43:33.967338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.949594Z","title":"H1 evaluates whether target and off-target changes are perceptible relative to a matched baseline, while H2 compares the candidates selected by V oDER-Cal and Target-only selection","venue":null,"work_id":"40bacb76-bf7f-46c5-a081-bd767bd69a65","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.031296Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:6ba52a033c8e790d8fe7774883adc538039f8f17a5ad6f8ba572964ad4deaacf","observation_id":"7a20f43f-20d1-4052-b10a-4cfed696f46f","resolution":{"observed_at":"2026-08-05T00:43:33.953904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.913751Z","title":null,"venue":null,"work_id":"c9db6290-b45d-4967-be95-ed3b8cf8b7b8","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.087400Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:5d3192aa83af52e304d4d795c0e312bb69c83b95466dc537afef6b464a945be0","observation_id":"41c289c5-1e8c-430e-b6d0-ac3219c99aa0","resolution":{"observed_at":"2026-08-05T00:43:33.939870Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.758457Z","title":"Prompt adherence and attribute preservation are comple- mentary Prompt adherence and attribute preservation capture different aspects of controllability","venue":null,"work_id":"e64cea85-4d41-4bbe-8778-9265705078d6","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.132896Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:4db012b7f2d7b25ca8b9e19e0ebfc642f4271996b325e7824dbaca02486411fe","observation_id":"f1e88653-5ac0-4c5c-a5e3-6d7d5580e918","resolution":{"observed_at":"2026-08-05T00:43:33.793626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.554532Z","title":"When attribute-specific editing is desired, evaluation must also test whether characteristics outside the requested target remain stable","venue":null,"work_id":"af8d29ea-6805-4dab-988c-1e2016450e94","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.212378Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:a4ecfcd93872a6886ca3420d6cb27d8d78715218df854edd550c1c3228cbd4fc","observation_id":"ab4a9aa8-a37a-4006-be16-2b4b6b2b442d","resolution":{"observed_at":"2026-08-05T00:43:33.617402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.335634Z","title":"PromptTTS: Controllable text-to-speech with text descriptions,","venue":null,"work_id":"d0fe9749-8368-455b-a691-6595d1ec1180","year":2023},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.300311Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:0465c38f77f3aa958f13c74ea663f9f376449116ab7858cbd3f358e9628af730","observation_id":"7c42b87d-6d7f-47f2-8c1d-c474cba9842a","resolution":{"observed_at":"2026-08-05T00:43:33.407854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:33.000105Z","title":"InstructTTS: Modelling expressive tts in discrete latent space with natural language style prompt,","venue":null,"work_id":"e7095a7f-5589-4a4f-a6e1-5ab39ed527a1","year":2024},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.376286Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:61489f5efcedf970e4feda9cc0602511c503893f623ac34bb0a4ce56bfb8dc2e","observation_id":"2b43486c-39a6-4f3f-823a-f9b0bc69cde3","resolution":{"observed_at":"2026-08-05T00:43:33.134775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:32.701154Z","title":"PromptTTS 2: Describing and generating voices with text prompt,","venue":null,"work_id":"8bb00495-867b-4632-878d-c36687a3421f","year":2024},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.450211Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:fc7619ba2de92b47ee5dd378c95bfa8538f3d815a9aa6aed6611b5b35dcfa48a","observation_id":"f128f87b-acbf-468a-8894-064982a0c5d7","resolution":{"observed_at":"2026-08-05T00:43:32.848451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19522","last_updated":"2023-06-01T09:30:41Z","snapshot_observed_at":"2026-08-16T15:28:05.625617Z","submitted_at":"2023-05-31T03:16:59Z","title":"PromptStyle: Controllable Style Transfer for Text-to-Speech with Natural Language Descriptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19522","snapshot_observed_at":"2026-08-05T00:43:25.535345Z","title":"PromptStyle: Controllable style transfer for text-to-speech with natural language descriptions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.535345Z"},"links":{"cited_paper":"/paper/2305.19522","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:d25fc281fbca2b1ac1485547cf5c3c994c7156313a8cf9a850166792112628cc","observation_id":"39ee1fe6-e0ae-4ed9-b9e4-74bdd267ec76","resolution":{"observed_at":"2026-08-05T00:43:25.535345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:32.395636Z","title":"PromptTTS++: Controlling speaker identity in prompt-based text-to-speech using natural language descriptions,","venue":null,"work_id":"087e35d3-8099-4d18-bfa7-d9d0507200b5","year":2024},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.597367Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:80ee5e0031db136906805e7227b511183859a7480a994e5397feb11e19b0ada4","observation_id":"7567a70d-f866-4bd4-92b8-1fe4e765f6fb","resolution":{"observed_at":"2026-08-05T00:43:32.608542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:32.013635Z","title":"ControlSpeech: Towards simultane- ous and independent zero-shot speaker cloning and zero-shot language style control,","venue":null,"work_id":"836290f8-8e6b-4e33-8fde-551862d8e196","year":2025},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.700590Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:25ea8bb7d1ff9a194d3eb64b90de3e23fb7e13abe11d76a40d50399641d44c4b","observation_id":"a8c758e2-63a4-43ba-9829-9ab1ff2a3fd4","resolution":{"observed_at":"2026-08-05T00:43:32.189142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-05T00:43:25.749513Z","title":"CosyV oice 3: Towards in-the-wild speech generation via scaling-up and post-training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.749513Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:c831dea732d35a5db097693016fa2805481e48ac1d96dd49c17b1ffd8e3b3928","observation_id":"956cd6c5-0acb-4932-b44c-d615a586d851","resolution":{"observed_at":"2026-08-05T00:43:25.749513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06928","last_updated":"2026-06-05T05:43:15Z","snapshot_observed_at":"2026-08-16T17:28:12.915614Z","submitted_at":"2026-06-05T05:43:15Z","title":"VoxCPM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06928","snapshot_observed_at":"2026-08-05T00:43:25.858970Z","title":"V oxCPM2 technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.858970Z"},"links":{"cited_paper":"/paper/2606.06928","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:75d2c704376af5f50709fe4f7cd751c5cc7b31e3466d3c56679071f904ab2b08","observation_id":"3284906c-4f32-48b2-b704-264a0680c73e","resolution":{"observed_at":"2026-08-05T00:43:25.858970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:25.899839Z","title":"Fish Audio S2 technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.899839Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:b2e8526e358f60d4af0114e983965ed0e7d19de54a2f1c2d62c8a899c5a7bc85","observation_id":"cbc6f3b1-03c7-47a1-8041-5a5499cbda76","resolution":{"observed_at":"2026-08-05T00:43:25.899839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:25.981554Z","title":"OV-InstructTTS: To- wards open-vocabulary instruct text-to-speech,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:25.981554Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:6e09b40e881267202b8b45c24b7841ee8261062ebd505192020e516d3aea3cbd","observation_id":"5df56a05-5f12-435d-b0bd-29cf0d59075b","resolution":{"observed_at":"2026-08-05T00:43:25.981554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:26.042228Z","title":"FlexiV oice: Enabling flexible style control in zero-shot tts with natural language instructions,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.042228Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:d267c5c6de91a81805d51b2e58188d8a4c6401ac67219a9ab3d1639626cf609d","observation_id":"2a0cba3a-5d83-4ab8-b3f3-948da64a8d1d","resolution":{"observed_at":"2026-08-05T00:43:26.042228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16381","last_updated":"2025-06-19T15:08:01Z","snapshot_observed_at":"2026-08-16T17:50:48.232882Z","submitted_at":"2025-06-19T15:08:01Z","title":"InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16381","snapshot_observed_at":"2026-08-05T00:43:26.122470Z","title":"InstructTTSEval: Benchmarking complex natural-language in- struction following in text-to-speech systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.122470Z"},"links":{"cited_paper":"/paper/2506.16381","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:de2ac8674d66fb6052d4dd82d6d0703ab65ed44058d82a0ab05faaff22d44b62","observation_id":"5e39b400-d8f9-48ee-812f-f0de8a735222","resolution":{"observed_at":"2026-08-05T00:43:26.122470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05554","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:28.237836Z","title":"SPAM: Style prompt adherence metric for prompt-based tts,","venue":null,"work_id":"84a5b84f-c9f2-4437-8fef-a3fd97463e4f","year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.187822Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:e1c07a4fe08e2b8e8295351d3c4f79a0a771227120d15fc657491377945a29af","observation_id":"83d17f93-6144-49a4-8d7e-ae14f41e4480","resolution":{"observed_at":"2026-08-05T00:43:28.270669Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:31.694651Z","title":"Towards end-to-end prosody transfer for expressive speech synthesis with tacotron,","venue":null,"work_id":"550bc967-e20a-4ada-a0dd-40a456212618","year":2018},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.255903Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:6133dc97ea544a8cfe4f806603c24bd1de1a203937ddc6bb1c4b3b3b51932eba","observation_id":"460139f4-f9ee-4b29-9205-a549ac959f73","resolution":{"observed_at":"2026-08-05T00:43:31.832623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:31.373563Z","title":"Style tokens: Unsupervised style modeling, control and transfer in end-to-end speech synthesis,","venue":null,"work_id":"c2bfa760-efcf-47be-94a0-19eb9b4e60a9","year":2018},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.360938Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:bb1fe7bb7573bc04fced01902991ffd2ad6ba2cf801d8b88fa36dceb458f98b3","observation_id":"6547024f-7e78-4574-b7cf-3c8e7571bfdc","resolution":{"observed_at":"2026-08-05T00:43:31.522677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:31.100782Z","title":"FastSpeech 2: Fast and high-quality end-to- end text to speech,","venue":null,"work_id":"b904a29e-d770-4354-950e-4cd8fc73bacd","year":2021},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.411290Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:19f3234d12ece4609fd1f05801f81e5fff7d080b1301a89d8c78988afc0118e8","observation_id":"26bb9f86-b1d1-4c8f-8c00-932ca589e3bb","resolution":{"observed_at":"2026-08-05T00:43:31.244938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.24618","last_updated":"2026-05-23T15:01:28Z","snapshot_observed_at":"2026-08-16T06:00:14.919733Z","submitted_at":"2026-05-23T15:01:28Z","title":"FC-TTS: Style and Timbre Control in Zero-Shot Text-to-Speech with Disentangled Speech Representations","version":1},"cited_work":{"arxiv_id":"2605.24618","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.24618","snapshot_observed_at":"2026-08-05T00:43:28.018841Z","title":"FC-TTS: Style and Timbre Control in Zero-Shot Text-to-Speech with Disentangled Speech Representations","venue":"eess.AS","work_id":"5c70467b-3b70-4ef4-abd4-0eb7f2ecdb98","year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.470816Z"},"links":{"cited_paper":"/paper/2605.24618","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:dc1eaaf463f3c6531b0d6043988dfc9fc0b023b2851111da78943c3174f9411f","observation_id":"08d228ec-9df4-43f1-a5a1-a493431dfbe5","resolution":{"observed_at":"2026-08-05T00:43:28.089113Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:26.523554Z","title":"DisCo-Speech: Controllable zero-shot speech generation with a disentangled speech codec,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.523554Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:c3be5de2d414bd525370a3ff4714f57b35c0b2f45502e99c8dfbf9f09a82ead2","observation_id":"c24f49b8-bcbc-4b2e-876c-343b6eb3134c","resolution":{"observed_at":"2026-08-05T00:43:26.523554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.08256","last_updated":"2026-08-05T11:29:52Z","snapshot_observed_at":"2026-08-16T11:31:09.706011Z","submitted_at":"2026-07-09T09:01:03Z","title":"Best-of-$N$ TTS Evaluation is Confounded by ASR Family Alignment","version":2},"cited_work":{"arxiv_id":"2607.08256","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.08256","snapshot_observed_at":"2026-08-05T00:43:27.779533Z","title":"Best-of-$N$ TTS Evaluation is Confounded by ASR Family Alignment","venue":"cs.CL","work_id":"66a5a290-8752-4e5f-bbd5-891647cc695a","year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.559995Z"},"links":{"cited_paper":"/paper/2607.08256","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:b385661c3d34f8cd03ee5f22355825f682ecf549f4be28d7217ee0e3367cc4d2","observation_id":"3fb23b82-7194-4f52-8e32-4d7e31332b25","resolution":{"observed_at":"2026-08-05T00:43:27.825771Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.18323","last_updated":"2026-06-16T15:41:44Z","snapshot_observed_at":"2026-08-13T03:10:55.584303Z","submitted_at":"2026-06-16T15:41:44Z","title":"Reliable Neural-Codec Text-to-Speech by ASR Self-Verification and Distillation: Near-Zero Catastrophic Failures Across Models and Codecs","version":1},"cited_work":{"arxiv_id":"2606.18323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.18323","snapshot_observed_at":"2026-08-05T00:43:27.615607Z","title":"Reliable Neural-Codec Text-to-Speech by ASR Self-Verification and Distillation: Near-Zero Catastrophic Failures Across Models and Codecs","venue":"cs.SD","work_id":"753c6b2c-a4d6-4e39-987f-e5f4d3cb9e70","year":2026},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.625365Z"},"links":{"cited_paper":"/paper/2606.18323","citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:9898856ec5fc27715c38f8bd5266e9c31e629098235a8089e66a11d1746368fa","observation_id":"c1353b3f-80c8-4ef5-b548-9c29d8c04e83","resolution":{"observed_at":"2026-08-05T00:43:27.679553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:30.763889Z","title":"librosa: Audio and music signal analysis in python,","venue":null,"work_id":"93ae3571-c27a-4543-87a4-141c2ab2f8b1","year":2015},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.695268Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:446aa8b44709f0d77ce0084daef700a4603258a6a3ed63952cf83a26af432f77","observation_id":"9f7420a2-d0ea-42b0-aace-54fc24364f4c","resolution":{"observed_at":"2026-08-05T00:43:30.908644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:30.511774Z","title":"pYIN: A fundamental fre- quency estimator using probabilistic threshold distributions,","venue":null,"work_id":"9d2571e8-8741-4446-93c1-432a56eb4093","year":2014},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.779343Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:826447bc9a347a0af415ff9053f0ec03efb901b5739c62b4814904a6cf6b5c71","observation_id":"f969820c-6a57-4b90-84b0-1c31520ec666","resolution":{"observed_at":"2026-08-05T00:43:30.637156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:30.326840Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"e15e5a99-5de2-473b-86f7-706b6f3e6415","year":2023},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.861123Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:38395455af149e1833752d2f87b951562274a04f1c36ecbd89f0b4caed7b7286","observation_id":"8ade6e93-30cd-4431-8f56-649437d81dd1","resolution":{"observed_at":"2026-08-05T00:43:30.386649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:30.208496Z","title":"ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":"3c36d0ce-efea-4b67-994d-88d0efd99404","year":2020},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:26.930724Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:bcd8de39bb7c195255039c87ca5cab28091511ad9af0deddff89c21c2d838549","observation_id":"9b296ea7-0a8f-4de5-9a0a-4a0ce7ef5de8","resolution":{"observed_at":"2026-08-05T00:43:30.275377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:30.001239Z","title":"X-vectors: Robust dnn em- beddings for speaker recognition,","venue":null,"work_id":"6a24d9f4-9891-4298-a210-b7ec49c4e5f7","year":2018},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:27.012578Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:e6a0c9762bf478f56b706e149975e4acaa447c9d00941378fa136abe7cd70a34","observation_id":"e6317aef-e4d4-4892-b8e6-4361d4a938b4","resolution":{"observed_at":"2026-08-05T00:43:30.099429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:29.836559Z","title":"Systems and model identifiers Table 3 lists the three systems, model identifiers, and control inter- faces used for generation","venue":null,"work_id":"6c62246f-dc4d-443f-8179-4dfd8b7d3560","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:27.097940Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:6219c419d318841220f746defb74fc81dd0881fbad26b903cfa213f75579b679","observation_id":"679055f3-4a95-4f43-a588-f68c48c3a2ee","resolution":{"observed_at":"2026-08-05T00:43:29.911410Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:29.630237Z","title":"Acoustic and prosodic measurements The analysis uses F0, speaking rate, duration, RMS energy, spectral centroid, 85% spectral roll-off, spectral flatness, and zero-crossing rate","venue":null,"work_id":"d8e9e42b-ae50-456a-ac70-180bf0e7f615","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:27.201910Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:f5d135d6e210863012c098d84f25563b85d1a7da9bf9db8ad66c88b0c013f76f","observation_id":"88064882-defe-47f4-becf-8dcfc1d4f365","resolution":{"observed_at":"2026-08-05T00:43:29.748678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:29.436255Z","title":"Responsive","venue":null,"work_id":"bdfd3b7d-a511-4533-86e3-faea34c8de2c","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:27.292009Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:01bc1ceb6dc60e834776a093412a5fbeee64376f7a031f9f22455e0d2bc3b30c","observation_id":"914c2ea9-e9d4-4359-8b18-3217e9097ebc","resolution":{"observed_at":"2026-08-05T00:43:29.537975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:29.269393Z","title":"Policies and operating point The candidate budget counts descriptor-conditioned generations; the matched neutral baseline y0 is shared across all policies and is not included in B","venue":null,"work_id":"b9cf59e2-f76e-4e72-bbc5-c03ee51a23cd","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:27.356823Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:3e1a1b21658466dade739db60d9ee179a511e946fbb5b75ec046248fc349d839","observation_id":"c28ffc11-fddb-45f8-b29e-95778b1ec6e0","resolution":{"observed_at":"2026-08-05T00:43:29.330524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:29.065265Z","title":"no difference","venue":null,"work_id":"436e9c61-6d95-4bfa-a9e6-8439191af309","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:27.439137Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:eb14f4a9310282ae903ab6e1a1df9288e8cc634bbbb8158ed7197eb907e5c136","observation_id":"22edf21a-4aba-4921-bd41-eb509ebf9f80","resolution":{"observed_at":"2026-08-05T00:43:29.160492Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T00:43:28.850761Z","title":"V oDER-Cal shows that preservation-aware ranking can select candidates with lower measured off-target devia- tion from a fixed pool","venue":null,"work_id":"caf4a8a8-0811-470c-abcb-a10ddb5dd666","year":null},"citing_paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T00:43:27.497465Z"},"links":{"citing_paper":"/paper/2608.00545"},"observation_digest":"sha256:081203585ef448c51a88734dcf9433f49cfbb49e27b213d2eb98866d36a65bc7","observation_id":"b80b9f84-81a7-487f-b09f-6c15861a9567","resolution":{"observed_at":"2026-08-05T00:43:28.945666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.00545","last_updated":"2026-08-01T09:04:17Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T15:40:05.597556Z","submitted_at":"2026-08-01T09:04:17Z","title":"Beyond Prompt Adherence: Auditing Attribute-Level Voice Control in Speech Generation"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":5,"verified_fuzzy":24},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2608.00545."}