{"as_of":"2026-08-10T15:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9843ac3bf122b4a9fc76f44be07e778ad1fb1ed3151ff55fe2e78ce24ff3443a","coverage":[{"denominator":195,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:59:32.450042Z","state":"measured"},{"denominator":107,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":107,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:20:42.015534Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23009","snapshot_observed_at":"2026-08-07T10:17:47.141942Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10019","last_updated":"2025-06-06T11:09:46Z","snapshot_observed_at":"2026-08-08T16:55:23.964977Z","submitted_at":"2025-06-06T11:09:46Z","title":"A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations","version":1},"reference_index":252,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:47.141942Z"},"links":{"cited_paper":"/paper/2505.23009","citing_paper":"/paper/2506.10019"},"observation_digest":"sha256:e64f20bb2559d26703c206215d655f10176cb0ea749d89a83b374741eba2a349","observation_id":"1720360c-be05-4b3c-8acb-315ef8069e53","resolution":{"observed_at":"2026-08-07T10:17:47.141942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23009","snapshot_observed_at":"2026-08-06T13:07:28.375424Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-08T08:14:38.727576Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.375424Z"},"links":{"cited_paper":"/paper/2505.23009","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:780f0653db5b4f10f42b2ef1e17df584e0366b4c3029b03fa4f5fcd0c1074315","observation_id":"493cbbe6-407d-4264-9cb9-17e1b0a7a46d","resolution":{"observed_at":"2026-08-06T13:07:28.375424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2505.23009","doi":"10.48550/arxiv.2505.23009","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23009","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergenttts- eval: Evaluating tts models on complex prosodic, expressiveness, and linguistic challenges using model-as-a-judge,","venue":"ArXiv.org","work_id":"ea15d52c-a0db-42aa-9892-ebedf7cccdef","year":2025},"citing_paper":{"arxiv_id":"2604.17958","last_updated":"2026-04-20T08:39:55Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T08:39:55Z","title":"MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T04:03:38.919545Z"},"links":{"cited_paper":"/paper/2505.23009","citing_paper":"/paper/2604.17958"},"observation_digest":"sha256:d0dda2e50a9d755d51d50cc79a909dbb0ed3656f887dd2c552ed6c498eeb4f8e","observation_id":"d0e91133-3db1-4960-854b-26a42633524b","resolution":{"observed_at":"2026-05-10T04:04:47.233152Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2505.23009","doi":"10.48550/arxiv.2505.23009","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23009","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergenttts- eval: Evaluating tts models on complex prosodic, expressiveness, and linguistic challenges using model-as-a-judge,","venue":"ArXiv.org","work_id":"ea15d52c-a0db-42aa-9892-ebedf7cccdef","year":2025},"citing_paper":{"arxiv_id":"2606.31947","last_updated":"2026-07-02T16:10:55Z","snapshot_observed_at":"2026-08-06T15:05:46.315237Z","submitted_at":"2026-06-30T16:53:15Z","title":"LuxEmo: Expressive Text-to-Speech Corpus for Luxembourgish","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-01T05:38:16.224617Z"},"links":{"cited_paper":"/paper/2505.23009","citing_paper":"/paper/2606.31947"},"observation_digest":"sha256:84bcb6c4075ff4533a0f519b54a985ffcc27f6a84a00aa6081f5cab8953b590c","observation_id":"47f0cad7-3779-472f-9023-bb7ba3939043","resolution":{"observed_at":"2026-07-01T10:15:45.044627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2505.23009","doi":"10.48550/arxiv.2505.23009","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23009","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergenttts- eval: Evaluating tts models on complex prosodic, expressiveness, and linguistic challenges using model-as-a-judge,","venue":"ArXiv.org","work_id":"ea15d52c-a0db-42aa-9892-ebedf7cccdef","year":2025},"citing_paper":{"arxiv_id":"2606.31947","last_updated":"2026-07-02T16:10:55Z","snapshot_observed_at":"2026-08-06T15:05:46.315237Z","submitted_at":"2026-06-30T16:53:15Z","title":"LuxEmo: Expressive Text-to-Speech Corpus for Luxembourgish","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-03T21:56:41.303269Z"},"links":{"cited_paper":"/paper/2505.23009","citing_paper":"/paper/2606.31947"},"observation_digest":"sha256:f9e123e862ea213a42aa0d0b7bed037d7f3a079d3ed01f07e4c0af402d6b3e1f","observation_id":"d07e2531-2480-4c73-9dc0-07dc61c8b4c1","resolution":{"observed_at":"2026-07-03T21:58:58.317517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23009","snapshot_observed_at":"2026-08-02T00:57:37.747884Z","title":"EmergentTTS-Eval: Evaluating TTS models on complex prosodic, expressiveness, and linguistic challenges using model-as-a-judge.arXiv preprint arXiv:2505.23009, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14846","last_updated":"2026-07-16T11:15:16Z","snapshot_observed_at":"2026-08-09T14:09:05.849030Z","submitted_at":"2026-07-16T11:15:16Z","title":"RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T00:57:37.747884Z"},"links":{"cited_paper":"/paper/2505.23009","citing_paper":"/paper/2607.14846"},"observation_digest":"sha256:eaec5b2e523596ce60e99d41a4bb0fdd090da9b9135561c0e03ab1d38cf4a7e4","observation_id":"15e196c1-fbef-4c31-8ffd-053bb8c9b494","resolution":{"observed_at":"2026-08-02T00:57:37.747884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23009","snapshot_observed_at":"2026-08-10T04:20:42.015534Z","title":"arXiv preprint arXiv:2505.23009 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07462","last_updated":"2026-08-07T17:57:45Z","snapshot_observed_at":"2026-08-10T15:13:05.094748Z","submitted_at":"2026-08-07T17:57:45Z","title":"SemBridge: Semantic Token Anchoring for Continuous-Latent Autoregressive Speech Generation","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-10T04:20:42.015534Z"},"links":{"cited_paper":"/paper/2505.23009","citing_paper":"/paper/2608.07462"},"observation_digest":"sha256:051701115b68d57cedb7c18f7752d1cb0e74baa17e006cd5a2ad4ea6ed9be6b0","observation_id":"f71b31b5-6633-4897-8a5c-2ae7d83e2859","resolution":{"observed_at":"2026-08-10T04:20:42.015534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23009/citation-record","integrity":"/paper/2505.23009/integrity","json":"/paper/2505.23009/citation-record.json","paper":"/paper/2505.23009"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:22.123813Z","title":"https://huggingface.co/openbmb/MiniCPM-o-2_6","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.123813Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:a4250e2375c82e6384c98f814f1b101429ffaa10968632c2b1d64a6601e08fd8","observation_id":"7d460f25-18c0-4329-9174-9cf3247ae840","resolution":{"observed_at":"2026-08-07T12:59:22.123813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:22.355934Z","title":"https://github.com/suno-ai/bark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.355934Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:108e499985ec5796e59781e8c0a2daee671695b53eb7f2909d13e02df0322396","observation_id":"176414f3-bc3c-437f-a44a-2f9f85b6a498","resolution":{"observed_at":"2026-08-07T12:59:22.355934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:22.464130Z","title":"https://github.com/neonbjb/tortoise-tts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.464130Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:a31cadfd3d396294ed8bf9931ee9b5833fb70286ed8604b19c49c842ac9dc41b","observation_id":"11bd66d3-2f8a-43c5-ac37-f34a81ba86a0","resolution":{"observed_at":"2026-08-07T12:59:22.464130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:22.598188Z","title":"https://github.com/wenet-e2e/WeTextProcessing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.598188Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:3de663a7b932a4ad9d3f20e38b82c231ef7f8e201f97494387a0a8e476e5fc60","observation_id":"205fee0c-98cd-4066-8c0f-90393b0867ad","resolution":{"observed_at":"2026-08-07T12:59:22.598188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:22.693266Z","title":"https://huggingface.co/Zyphra/Zonos-v0.1-transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.693266Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:c96b3418f4b7f1dfc8bcc7aa3645e9e1461828ae8a35c29a97ff4303fe1aef9d","observation_id":"71cea248-dfa8-4a11-a6c1-89e155429b41","resolution":{"observed_at":"2026-08-07T12:59:22.693266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:22.786045Z","title":"Seed-tts: A family of high-quality versatile speech generation models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.786045Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:64194bf43d29346248756c47094f5d18ad3030990e1a8a5283f91983ac319bb9","observation_id":"dca4f373-43c2-43b2-b8da-0eed141567e1","resolution":{"observed_at":"2026-08-07T12:59:22.786045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:22.903641Z","title":"Hifi++: A unified framework for bandwidth extension and speech enhancement","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.903641Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:9a5367ac5955dbfae89bde6adf0c7c15ee099cd6061c44c91a61db6cba526729","observation_id":"0cc3aa6f-a4f7-4cf6-bce4-5376fbf511d6","resolution":{"observed_at":"2026-08-07T12:59:22.903641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.021512Z","title":"Deep learning-based expressive speech synthesis: a systematic review of approaches, challenges, and resources","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.021512Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:87ef8b956468cf3c64ceca5ce0754961c91576351331717c348294cf6c9f551e","observation_id":"1219e962-6254-4cb4-a3d6-ffb802aac7e0","resolution":{"observed_at":"2026-08-07T12:59:23.021512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.142124Z","title":"Orpheus-tts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.142124Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:e0c1aab859897ce9f1343b8417114bdbd1dbde20d6fab8219486b69ad0000bdb","observation_id":"25f6b129-e257-4dd4-90f3-c6e970419d49","resolution":{"observed_at":"2026-08-07T12:59:23.142124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.225020Z","title":"Audio large language models can be descriptive speech quality evaluators","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.225020Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:c0b69b7434ae819eed2cf4dedf0349447654ef83af9955a1b21b4efd8fabff8c","observation_id":"9573afaa-fdaa-40fd-bd92-325d8626ffce","resolution":{"observed_at":"2026-08-07T12:59:23.225020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.364616Z","title":"SANE-TTS: Stable and natural end-to-end multilingual text-to-speech","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.364616Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:18adba18bd373614e3cb23872f0260ab9c37e331beb3b922074bf6dbc663100a","observation_id":"39b992d5-7897-4cfb-83ea-73292e43ac8c","resolution":{"observed_at":"2026-08-07T12:59:23.364616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.494815Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.494815Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:1ebc4250758d0ef4dc4bf5f936f1c1a64fb82c51bc96b01d5213ef99b6a2f6fb","observation_id":"56a54051-a366-48b9-862e-615c720327c4","resolution":{"observed_at":"2026-08-07T12:59:23.494815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.590194Z","title":"Deepseek-R1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.590194Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:0b7d99c07d9e80bf9fa063435c27bb853ece09772764c679847b97c2a9379bdf","observation_id":"5047b16f-a4b8-4120-a823-05751a391966","resolution":{"observed_at":"2026-08-07T12:59:23.590194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.715236Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.715236Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:d541348d71bfb880001b347f2889467c3f7579871d11f351320005e6b13fdc31","observation_id":"06f49cbb-da56-49b4-9248-2dd786226f6f","resolution":{"observed_at":"2026-08-07T12:59:23.715236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.847705Z","title":"Wavllm: Towards robust and adaptive speech large language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.847705Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:81342a8df66e3de873f684079e9bcb424e3e80a226b103e1d9af732c175e3bc0","observation_id":"3812c265-737b-45e2-b200-f1e471dd9f28","resolution":{"observed_at":"2026-08-07T12:59:23.847705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.943571Z","title":"Zezario, Tomoki Toda, Hsin-Min Wang, Junichi Yamagishi, and Yu Tsao","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.943571Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:ca1ccd09c6b1570a4c56c750a1f793e4b5f8348c6efc599eaaafa9895c7a7c9a","observation_id":"804fcd4e-c745-4e92-87df-30b7af093e2b","resolution":{"observed_at":"2026-08-07T12:59:23.943571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.041125Z","title":"Wavreward: Spoken dialogue models with generalist reward evaluators, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.041125Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:cf93c12c7d65191cdcb353b6f352ce632d380d16e53543669e37896985854e2c","observation_id":"9bdaf572-7d40-484f-932b-605afea9cd2c","resolution":{"observed_at":"2026-08-07T12:59:24.041125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-08-10T13:39:07.043895Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-08-07T12:59:24.161122Z","title":"BASE TTS: Lessons from building a billion-parameter text-to-speech model on 100k hours of data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.161122Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:d5346533b77846c2646ce4f29f8b73003c9e87dc4fcb8417019b7cd029b46b8d","observation_id":"a0b577b6-d7ec-4def-ad2e-7ef96c4077be","resolution":{"observed_at":"2026-08-07T12:59:24.161122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.282631Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.282631Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:652c1390376e8ce489cfbb5e84b54ed46a2edab5292f67aedd9752c31b09181b","observation_id":"225e90b0-357b-47a4-8dcf-8518578642d9","resolution":{"observed_at":"2026-08-07T12:59:24.282631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.420902Z","title":"The Application of Speech Synthesis in Car Warning System, pages 657–662","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.420902Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:0c9dcddbf74e4fc10dd254f7f9a64ad28b2c114bd38b34c5e4ab570527d1544f","observation_id":"08ecea3b-720a-4266-9a1d-f1f0f65feb4b","resolution":{"observed_at":"2026-08-07T12:59:24.420902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.521051Z","title":"Inference-time scaling for generalist reward modeling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.521051Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:6984d248891bf79c6fd2b7b0063ca265747d6749a00bc64e1a27b40faead048f","observation_id":"02998162-fed0-4d2e-a154-109f23891f60","resolution":{"observed_at":"2026-08-07T12:59:24.521051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.611021Z","title":"Generalized multilingual text-to-speech generation with language-aware style adaptation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.611021Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:0b6be11369fcce2585ddbc9d2c08c4e07138f951e6e864baf9620be937eb3272","observation_id":"220e2358-44db-4470-9ef0-1db34854ae26","resolution":{"observed_at":"2026-08-07T12:59:24.611021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.707740Z","title":"Somos: The samsung open mos dataset for the evaluation of neural text-to-speech synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.707740Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:a2be011d0558c8e3fd7b0181ba98483aaf96500d2ca66e31c02e74edfd0328d3","observation_id":"c50c5376-b576-4454-92f1-b54e576b8816","resolution":{"observed_at":"2026-08-07T12:59:24.707740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.780715Z","title":"Youth disability: Adopting text-to-speech and screen reader technologies for library and information services","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.780715Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:398ca2de94f06ceb6206fb7f7c8b187d513e715f20fe7741772264f32016e5cb","observation_id":"3fff9e79-0d00-47d1-b06b-4cdbb79b3d04","resolution":{"observed_at":"2026-08-07T12:59:24.780715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.880672Z","title":"Applications of voice quality technology in virtual assistants and call centers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.880672Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:27087ff5a40ebb58afe8461bd6f11e21ea1832aa69cd02452df08b9a02e7fbed","observation_id":"77fcdec5-a860-46eb-b800-0db6f90b69cf","resolution":{"observed_at":"2026-08-07T12:59:24.880672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.981542Z","title":"Prosody analysis of audiobooks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.981542Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:2f951d87df3c1022df5c1e721ff61bb219661e1ef2286da1c02277d728f5ae40","observation_id":"d39c6652-fea0-45fe-bac4-724212e43122","resolution":{"observed_at":"2026-08-07T12:59:24.981542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.067775Z","title":"Robust speech recognition via large-scale weak supervision, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.067775Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:5e3aafcb21a4448da8413bdca626cf9e4881bbd054712c0721168db54121115a","observation_id":"4b662415-ad37-4e82-a618-3137101bb7c6","resolution":{"observed_at":"2026-08-07T12:59:25.067775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.115166Z","title":"Text-to-speech software and reading comprehension: The impact for students with learning disabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.115166Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:65663cf46a66d74ecf9c847376daf1e5a197f02da33ad7d559cd9fe3e7313e6c","observation_id":"3f907a15-6d7c-4901-a202-182d1d49f7c4","resolution":{"observed_at":"2026-08-07T12:59:25.115166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.186851Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.186851Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:96ba6019ad0b66131b2eb8a2200c6f7445a5e51e32314ce12c6275a98d4223de","observation_id":"ccaee203-f3f2-47ed-971c-bdff8ca04546","resolution":{"observed_at":"2026-08-07T12:59:25.186851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.232231Z","title":"Mmau: A massive multi-task audio understanding and reasoning benchmark, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.232231Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:8e9d93c2053cbf997a598c90cf4d4e1e54817bf4f4de8619525cfe6412de4453","observation_id":"06b7c93c-9bb8-4859-9815-b9943bb563e2","resolution":{"observed_at":"2026-08-07T12:59:25.232231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-07T12:59:25.279897Z","title":"MMAU: A massive multi-task audio understanding and reasoning benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.279897Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:17a1b5c343bb99574dd20baf5d51f03ea6c8506df0946c54579cb8a98c0e76af","observation_id":"ce95ec3c-8843-4b13-9fc3-9731dad368bb","resolution":{"observed_at":"2026-08-07T12:59:25.279897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.341168Z","title":"Parikh, and Jason Riesa","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.341168Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:22b957ff918eda0ba55dd50b9172f9aa4e6ea20ceef8521e8848388fd998c035","observation_id":"4fedfc3c-0909-4d36-ad68-1fc6c9150207","resolution":{"observed_at":"2026-08-07T12:59:25.341168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.396915Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.396915Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:4d81245cfe76175a3d7ba5b2a5fcf09073e4a3606560577ddf4837d56ea53191","observation_id":"8764040b-11e9-4bd1-a8ac-19766a69ce11","resolution":{"observed_at":"2026-08-07T12:59:25.396915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.464461Z","title":"Salmonn: Towards generic hearing abilities for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.464461Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:64a4bb419d84d5e1a51c3fb9efb542f61446c6f6ef61e20cf3c8faa064e467b7","observation_id":"c3841355-056b-4b48-8d46-b2b8cf3cc79b","resolution":{"observed_at":"2026-08-07T12:59:25.464461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.532648Z","title":"Gemini: A family of highly capable multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.532648Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:904cf729b0d2023c86848e3ccf6479c3f138ad634463fac5a98379b2d71db5fc","observation_id":"d44b5ea1-3526-4997-8794-7eb30d365729","resolution":{"observed_at":"2026-08-07T12:59:25.532648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.625324Z","title":"Speech recognition challenges in the car navigation industry","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.625324Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:cd1fb42337b1d0cbd37d625314b2014d7ce1498e8bcf476de1c4902ee96eb5d7","observation_id":"0e9ff48b-22c2-4d19-b40c-ad3de0ec1f1b","resolution":{"observed_at":"2026-08-07T12:59:25.625324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.682024Z","title":"Freeman, and Markus Weimer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.682024Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:72eca937ecee5dbee1a11d2adb6229a6cb5503e5f10e1aa780c83dd97ad9182e","observation_id":"a94b5756-767f-4225-97dd-ce33f2d74e80","resolution":{"observed_at":"2026-08-07T12:59:25.682024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.748602Z","title":"Evaluating text-to-speech synthesis from a large discrete token-based speech language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.748602Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:1898ea08a7256a1c7c2d02f612909368c61ee58870ac8f36c2fe4dac26f4cdde","observation_id":"6f411fbb-90d1-4790-b96c-c251c41d86ae","resolution":{"observed_at":"2026-08-07T12:59:25.748602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.836674Z","title":"Enabling auditory large language models for automatic speech quality evaluation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.836674Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:b7b3ed141ac4e03b303bd43a4a37e549e63ebb5f57a58fbe78d40e8b98797bbf","observation_id":"f7022443-a363-47e2-a468-4f476e080456","resolution":{"observed_at":"2026-08-07T12:59:25.836674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.920779Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.920779Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:4046ffcb5001c9cc686eae564743e809fd092ffa2027f9a9b9b90c1ccc00789a","observation_id":"0b08332e-dd81-4e60-b141-fc9aac8937d1","resolution":{"observed_at":"2026-08-07T12:59:25.920779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.972618Z","title":"The iscslp 2024 conversational voice clone (covoc) challenge: Tasks, results and findings, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.972618Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:f185066de40c80576dc946c8a4bbbe4bf94fac90d3aadfea5d6208817844f6f0","observation_id":"836b5a4e-c5f4-4ab7-a3b0-8dbc892069a1","resolution":{"observed_at":"2026-08-07T12:59:25.972618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-08-10T07:58:15.209421Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-07T12:59:26.035027Z","title":"Wizardlm: Empowering large language models to follow complex instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.035027Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:dc0fd767c0a85fb9316692409297efa2134f33fab4166867436b04615893454a","observation_id":"debefcb3-c5e9-4b3f-a07e-524e1b50360f","resolution":{"observed_at":"2026-08-07T12:59:26.035027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.073783Z","title":"text_to_synthesize","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.073783Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:e9737372f18e852d8d517e7d88c4fa6a649a2abf4bb9f85742837a56eea19d52","observation_id":"33d7b041-cf1c-4322-8a0b-1f635b6f3629","resolution":{"observed_at":"2026-08-07T12:59:26.073783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.161264Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.161264Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:b915007565ad0af7033fcaaca2745590af80cf39bac10a1909780eccb56e8929","observation_id":"35c5e7d3-918a-4f7c-a261-3eceb2c75a1b","resolution":{"observed_at":"2026-08-07T12:59:26.161264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.206382Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.206382Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:910c4b7b9e519f2923a6c095539a62de7141f6e54fb8640d7d2489c390d29753","observation_id":"1d987801-33ba-464b-96e5-703975a92a9a","resolution":{"observed_at":"2026-08-07T12:59:26.206382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.282646Z","title":"14 The main goals for the set are:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.282646Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:2df0bdd5bb22f688b99d164f8bad431a54b8f179d3a534be611650caee4d9798","observation_id":"dd9bf107-fe39-43f5-ada9-aeeda5173772","resolution":{"observed_at":"2026-08-07T12:59:26.282646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.353017Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.353017Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:d03c3c5c248225280b8c66c334af432cc50e8a1c4233e3c14a49f1ff773cfced","observation_id":"c710b730-9660-4ff2-b29d-a405f6b5d19a","resolution":{"observed_at":"2026-08-07T12:59:26.353017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.491815Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.491815Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:9bd14cf749045e49e59ccdcf11ea9e458d2ca0b130014db994fdf2147479e4d3","observation_id":"b03ca92b-1cd0-4d77-91d6-088758653038","resolution":{"observed_at":"2026-08-07T12:59:26.491815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.573584Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.573584Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:39aef546b720b7b50f5e26ba16891b32e7f9067dcebaaa3c5cedaada0f0d93b9","observation_id":"aed2c966-d6a2-47ca-a9ec-270e912f45e0","resolution":{"observed_at":"2026-08-07T12:59:26.573584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.635309Z","title":"\"\" You are evolving a **text_to_synthesize** sample belonging to the","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.635309Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:5200ee123ef5def81756197c0d3db886f1423166e722f675e0bc433e32c4ca8b","observation_id":"a111fa93-839e-4f90-b15f-e6a2809163ea","resolution":{"observed_at":"2026-08-07T12:59:26.635309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.715583Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.715583Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:471e52e9f8bceb2a4a62f880edd504e0b5b1f0cf8eb151f15f1a18ecab0b3881","observation_id":"5d49c281-d494-455c-93db-b5a69eceac19","resolution":{"observed_at":"2026-08-07T12:59:26.715583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.792318Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.792318Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:9aca40438ac214cb894fc1be720bd85ccabe53573a6e3bae3b12a865ed876f31","observation_id":"f929fd24-fbf1-47fb-af6f-48aa39202da0","resolution":{"observed_at":"2026-08-07T12:59:26.792318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.846421Z","title":"Then, **add one** related, grammatically complete question *immediately following* the modified text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.846421Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:17360d084ee1a23c01b2ed002e89b9795b7a0bd1ca34c0e16788447f7f4590db","observation_id":"543f222a-f4d2-4bfd-b76d-01f1b0ed60cd","resolution":{"observed_at":"2026-08-07T12:59:26.846421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.919989Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.919989Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:3ba6700bc91beb87f0d526a4e35ce5f6cfa71a863227d26f3388084c2ce0ff44","observation_id":"dcb6d042-9ce0-46cd-b610-71ca305cd175","resolution":{"observed_at":"2026-08-07T12:59:26.919989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.973562Z","title":"to be\" is replace with","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.973562Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:127949c4a7ac755b05ee4930c1462e65b1476632b289e8fb6524375769e4a133","observation_id":"c0e415e7-6f73-4935-9847-edd856cb5c86","resolution":{"observed_at":"2026-08-07T12:59:26.973562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.030998Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.030998Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:12c0097c803b59861226294cefa3953c4bfa1c6170fc69b7d4df1fc088c2b923","observation_id":"30ac59cc-7920-4ada-8d77-b2e57f6cceb1","resolution":{"observed_at":"2026-08-07T12:59:27.030998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.086258Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.086258Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:1a71edc0d0946b2e8503f143d4bb1fcc9627db51d7f6d1eb480b923a28101268","observation_id":"d0565783-dcda-4219-acc0-5c6007727da4","resolution":{"observed_at":"2026-08-07T12:59:27.086258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.198739Z","title":"Ensure that each language has atleast 1 foreign phrase","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.198739Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:265bfb1b6f75e22f58706cd54db30fdd0b76b189c73d9bed929ee6c5c29510dc","observation_id":"e271a5e9-b6aa-43d6-add7-1c9afd96eaef","resolution":{"observed_at":"2026-08-07T12:59:27.198739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.292209Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.292209Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:45a7b01bcd78d48621f64608db7c2c9cbc020892d87263add87f6c4dea190598","observation_id":"9fa272ac-c5d6-4d88-a2a7-0d86d180d2e5","resolution":{"observed_at":"2026-08-07T12:59:27.292209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.467276Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.467276Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:ed49fd98c7485e757536a488f0d7d9f019acbb806f18b625c220a58d220656a9","observation_id":"6d9746e4-2927-4936-8bbf-8ee8475a7442","resolution":{"observed_at":"2026-08-07T12:59:27.467276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.624271Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.624271Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:9b512e5c91d8f85d8e29392d2a1836d42eff74d4a14c85ba2cac9a2bb51ae94a","observation_id":"32ad117d-61fc-4d78-b296-27be04880419","resolution":{"observed_at":"2026-08-07T12:59:27.624271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.745718Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.745718Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:e4046bbe786c654574978045158d7226505038e3263c4948d1cbb33b61394cc8","observation_id":"f40ed726-ba8b-45af-805f-3cc8f18be4aa","resolution":{"observed_at":"2026-08-07T12:59:27.745718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.894566Z","title":"All foreign words **MUST** not be duplicated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.894566Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:e5511aa7df009d96b31e43e8203595d95e8acb81184d036ac8b3344aa8e9b1e4","observation_id":"41121d68-b659-4905-bf8d-54906bef987f","resolution":{"observed_at":"2026-08-07T12:59:27.894566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.177302Z","title":"AT THE SAME TIME, do not use very obscure words that don’t exist in the modern vocabulary, we want to create natural day-to-day sentences that bi- lingual speakers will speak**","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.177302Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:b833631803b12d1d62e1d7f708d5ec0b3e86a03ca8b81f9b0c7eeb36094a54b7","observation_id":"243e118a-0065-476d-a402-873f629b6994","resolution":{"observed_at":"2026-08-07T12:59:28.177302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.285440Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.285440Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:4d32ac6dc3bc57bb5498ce52a693563cb48e9e7e6aa9995d82efd339b736b8cb","observation_id":"b38f60da-9773-4580-ae79-7661842875cf","resolution":{"observed_at":"2026-08-07T12:59:28.285440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.432064Z","title":"misc\" field, add a new key","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.432064Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:86fe8ad23c781716941f9996fcb05edb44a66cbc29fa71f2bc04d48633c5a3ba","observation_id":"c5c6a5f0-cdff-4316-b5ad-f9ef20036179","resolution":{"observed_at":"2026-08-07T12:59:28.432064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.565040Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.565040Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:33db33d0cca4896af059894834ad55b3bde71f61dc3fbb2fe7c3e394187f4fa2","observation_id":"c4834ec5-e4ba-42db-8704-0cabcaed7b8c","resolution":{"observed_at":"2026-08-07T12:59:28.565040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.727127Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.727127Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:3a81981355fc648d4be37e8a11ffa191c021b80c25607f210b150da3b11716be","observation_id":"ec22d491-1d67-4d98-9418-2ff6adef3e98","resolution":{"observed_at":"2026-08-07T12:59:28.727127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.874003Z","title":"Mention how this **DOES NOT** make the text syntactically awkward","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.874003Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:493c7137cb1236b65a988c017ff8298ed0707edc7cc3dd72d2472b6a2ec4fbd4","observation_id":"e601e8ff-beab-40e2-add8-1d56f1b3cf40","resolution":{"observed_at":"2026-08-07T12:59:28.874003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.949777Z","title":"**For Approach 2, state the original short phrase, the absorbed English words, and the resulting longer foreign segment with its word count.**","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.949777Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:65c3bf86385a423b8ee7307e8f1c56fc05eacde6bd9076379e923854c3f05586","observation_id":"88da4798-9a24-4e77-b28a-468d9cd03249","resolution":{"observed_at":"2026-08-07T12:59:28.949777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.040989Z","title":"**For Approach 2, emphasize the challenge of sustained foreign language synthesis and grammatical integration.**","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:29.040989Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:355bca06706d6a1c154e6feb38df62a3bd2470e34ce1862da9bc3519a299b746","observation_id":"169fe26c-aa56-422b-9329-90c2919897ea","resolution":{"observed_at":"2026-08-07T12:59:29.040989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.136251Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:29.136251Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:74768dac3c83e1b3f764cffa73caead0c8d24af1aeeb0719528303142efc7dee","observation_id":"4540adda-36e9-4873-a938-1a8ab66ec053","resolution":{"observed_at":"2026-08-07T12:59:29.136251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.222566Z","title":"7.2 Restructure, paraphrase and edit the text grammatically to ensure **NO AWKWARDNESS** in the text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:29.222566Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:8caef53c4e32bfcc68bd78676c10f003e2982bc87deb32eb370d0b922de58bff","observation_id":"8332f690-7b54-4320-92fa-122401ab0c7f","resolution":{"observed_at":"2026-08-07T12:59:29.222566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.362145Z","title":"\"\" A.3 Category 3: Paralinguistics Figure 7: Example depth-refinement for paralinguisitcs category. Starting with just one cue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:29.362145Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:de5b6b6fe88e669ab8254a3fbc9e14558d3fdbc4730e00ba785356e9805c00da","observation_id":"9e3f6aee-df8c-49ac-923a-65d3d8e5cf25","resolution":{"observed_at":"2026-08-07T12:59:29.362145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.467472Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:29.467472Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:272cb8d081da7e1405068b825ee20b9bded3c1cf3b9de25bfb1734a8e9083f15","observation_id":"09ca8552-41f1-4f9b-8b42-8d6c5dabbd12","resolution":{"observed_at":"2026-08-07T12:59:29.467472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.571387Z","title":"Uh\", \"Uhmm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:29.571387Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:8cf34b4974a1f9833ea601d87a4718c1a51a923d143333ca8a18355e3b75d4c8","observation_id":"6a6cf1f2-b8eb-4453-af8e-d5469828e5c8","resolution":{"observed_at":"2026-08-07T12:59:29.571387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.813008Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:29.813008Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:9175cfcd046085de39093cb293e72576e44cba59dd5f234cf9f74563230dd3dd","observation_id":"8b59f380-e9cc-4dce-a65f-d4e0a0a5b720","resolution":{"observed_at":"2026-08-07T12:59:29.813008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.957462Z","title":"These should be sounds that humans can produce well based on the textual cue.**","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:29.957462Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:6d153081f21685d2176d34d2e264ffc7fa45be6ec9a068993bf5db55db53463b","observation_id":"d357c59a-ccb0-4335-9dd4-cb0afbb05791","resolution":{"observed_at":"2026-08-07T12:59:29.957462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.031457Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.031457Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:7317943313eed9fa30d2f4a0ab3297d6dccee0b76f28cb66d47c9049ddce173c","observation_id":"8cdd50da-ab9f-44c1-8672-78dca6eef352","resolution":{"observed_at":"2026-08-07T12:59:30.031457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.094257Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.094257Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:0395dc8f2d18a4b5eeb538a4c933406cfde894ce123eb936602717e8b0895e57","observation_id":"4ab87708-898f-4623-8e0d-a537c1033c9a","resolution":{"observed_at":"2026-08-07T12:59:30.094257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.225119Z","title":"\"\" You are tasked with enhancing the paralinguistic complexity of the provided ** text_to_synthesize**, which belongs to the","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.225119Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:d0b4f5e564df54f9fb40b59db8c968675bcb8f92b84a320983e4ae27d678a7fc","observation_id":"2d0f7291-9fda-437e-8624-9a06a4eb00cd","resolution":{"observed_at":"2026-08-07T12:59:30.225119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.364305Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.364305Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:e87712cb856a10bed8798695f1b2cf35a904eda602359961d26751c2277c2e68","observation_id":"8d9ce7d6-1488-4ebb-b0fc-bb48fa7f0e23","resolution":{"observed_at":"2026-08-07T12:59:30.364305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.487507Z","title":"Wow !\",","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.487507Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:c2574c1654641dd70c8390e629dbd27eee15dfc11e08d0381c51387da00ded9a","observation_id":"24727f29-47b2-46a7-9a93-1d568378acf1","resolution":{"observed_at":"2026-08-07T12:59:30.487507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.594796Z","title":"Focus only on cues the TTS would encounter in the direct text-to-be- synthesized","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.594796Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:f47086ab51721101d82d0ac8224fbcefcfc5138945644d4d3c39c56273aca64a","observation_id":"f03cf393-e0c0-4fbf-b2ab-151d1e96b2f5","resolution":{"observed_at":"2026-08-07T12:59:30.594796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.704923Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.704923Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:a8b42392bcb9d620711d8ae7b1d3be10d4321071f5f1a95d1a9dd878789527d8","observation_id":"28520f57-556c-463f-b365-b4c7c009dcc3","resolution":{"observed_at":"2026-08-07T12:59:30.704923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.808239Z","title":"* It must **NOT** sound forced, nonsensical, overly exaggerated beyond plausibility, or contain cues that contradict each other","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.808239Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:17a6c449ba473158adc802d7c2a329f7eaa54af5136ed4967d99138a297392a7","observation_id":"5c44beae-ec06-48a0-b417-c6bb3026b638","resolution":{"observed_at":"2026-08-07T12:59:30.808239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.930508Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.930508Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:a5d9f03a23962833cc2e3c279c3ccf09b9e0d69c1aae16a2eb8302458012a7c0","observation_id":"e49f29be-416b-4239-8ebb-3234e85c6faa","resolution":{"observed_at":"2026-08-07T12:59:30.930508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.014314Z","title":"You can choose to add one or two cues","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.014314Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:a817d83c09a4f16799963e996d6782e0e5b9853bc2459c151cbeb518ce166110","observation_id":"bd5f39c7-82a0-47e5-b052-e528720b64c1","resolution":{"observed_at":"2026-08-07T12:59:31.014314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.102992Z","title":"Novel cues are preferred but not required","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.102992Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:f6c6c6713d0622dc5b7f100ad06901c3ac4cbc8060c6357900c1275205788204","observation_id":"1858efc9-911b-4ab5-b37c-765be498ba55","resolution":{"observed_at":"2026-08-07T12:59:31.102992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.254564Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.254564Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:d1edf37ebbe35f91dc96655301e420477209427f711ddbaa920c542329c11c81","observation_id":"f67d7969-9178-494d-9f0b-9aaccde3ca9e","resolution":{"observed_at":"2026-08-07T12:59:31.254564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.348771Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.348771Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:c4302cbe6d96298c20e2d484d3096099bd54df1d7e117f860d8418db6eb3bc53","observation_id":"be46df3a-8210-4036-b6ff-fe2477a8631e","resolution":{"observed_at":"2026-08-07T12:59:31.348771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.455382Z","title":"Emotions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.455382Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:9a8e1f25ba4c241adc9391d7cf7d47aef532c67e7a21190f2d4df5af66844dc4","observation_id":"6d52ea3c-92b3-462d-bfe4-ed5cf0beed83","resolution":{"observed_at":"2026-08-07T12:59:31.455382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.525274Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.525274Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:697bff0221a8a6ce681f99337c0742e5f704fe6dadd573eaa836125c09a7023b","observation_id":"e63bf173-1c7e-4182-8758-33248d42e2ba","resolution":{"observed_at":"2026-08-07T12:59:31.525274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.621426Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.621426Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:f1613c853d2551274e4039d8f72a2323c195b0552fe7309f07f2a1df19b8b7f8","observation_id":"9031e647-fa41-4c74-b652-45290ba6fafc","resolution":{"observed_at":"2026-08-07T12:59:31.621426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.721052Z","title":"24 The main goals for the set are:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.721052Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:ec1fbfe0dd06cf594f2c21e5e52d9f959ac60e99df18f60c2f4203af10c46826","observation_id":"ae44ed3c-3996-4870-989b-19228291633b","resolution":{"observed_at":"2026-08-07T12:59:31.721052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.890385Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.890385Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:e10cee7958ca4446f4904c35e1fafb6597bacf23c2de0f6995439bad0a11585b","observation_id":"379279bb-1331-4267-a387-cb229366b3d3","resolution":{"observed_at":"2026-08-07T12:59:31.890385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:32.018235Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:32.018235Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:7f3984764f3dfc5c42ddd2991c86a4ff3cb4dda59cdedb84279fd70ab9c29f7d","observation_id":"bdb7ddf5-6f8b-430b-9cbb-9497568f9ca8","resolution":{"observed_at":"2026-08-07T12:59:32.018235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:32.134190Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:32.134190Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:47a9060a0e3b8be34682bb1b27395da59cde123a72ef7e1d806c8496164baa51","observation_id":"5c323fcf-5f3e-4d01-a271-85252a4d8d4c","resolution":{"observed_at":"2026-08-07T12:59:32.134190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:32.308858Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:32.308858Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:e9e3162415f7c05f28e84a8ae995b9208fbfa16a6d2405b5e4682ee051b67265","observation_id":"9a3c38c9-0dcb-44fd-b6f1-0be4796b789b","resolution":{"observed_at":"2026-08-07T12:59:32.308858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:32.450042Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:32.450042Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:d546fb8b65fdc6c9c555d35be2e2986a1e7bb26e75ecab18f172155c50ae52d0","observation_id":"9f6c2e27-0f66-4f69-8bd8-ec35d2275932","resolution":{"observed_at":"2026-08-07T12:59:32.450042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T13:39:40.335807Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":195},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 195 outbound references and 7 inbound Pith citation observations for arXiv:2505.23009."}