{"as_of":"2026-08-10T15:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b90878797af4beedf54a67b45633338da2b9a919bae6b4ae937db6ec62e5e660","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:58:58.959621Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02235/citation-record","integrity":"/paper/2608.02235/integrity","json":"/paper/2608.02235/citation-record.json","paper":"/paper/2608.02235"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:58:57.643729Z","title":"Model card and checkpoint, accessed December","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02235","last_updated":"2026-08-03T13:49:11Z","snapshot_observed_at":"2026-08-09T21:37:29.393286Z","submitted_at":"2026-08-03T13:49:11Z","title":"Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T10:58:57.643729Z"},"links":{"citing_paper":"/paper/2608.02235"},"observation_digest":"sha256:e723338ba86852f9bdac856ab2f5b2954ffc3e13dafc1ed9b590c291d44ea5e4","observation_id":"9f9b3079-3214-4f14-8e00-40a084829a84","resolution":{"observed_at":"2026-08-04T10:58:57.643729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:58:57.855301Z","title":"arXiv preprint arXiv:2504.02738 Outcome of Dagstuhl Seminar 25032","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02235","last_updated":"2026-08-03T13:49:11Z","snapshot_observed_at":"2026-08-09T21:37:29.393286Z","submitted_at":"2026-08-03T13:49:11Z","title":"Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T10:58:57.855301Z"},"links":{"citing_paper":"/paper/2608.02235"},"observation_digest":"sha256:40270e18d3e47d986cb2951cb946eb7045ea3fbeb26270340c8df700effeb8b8","observation_id":"25b63c17-2354-4e40-b413-9c3aa8642340","resolution":{"observed_at":"2026-08-04T10:58:57.855301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09536","last_updated":"2023-02-17T08:09:02Z","snapshot_observed_at":"2026-07-06T14:19:47.424778Z","submitted_at":"2022-11-17T13:59:34Z","title":"Towards Building Text-To-Speech Systems for the Next Billion Users","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09536","snapshot_observed_at":"2026-08-04T10:58:58.212654Z","title":"arXiv preprint arXiv:2211.09536","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02235","last_updated":"2026-08-03T13:49:11Z","snapshot_observed_at":"2026-08-09T21:37:29.393286Z","submitted_at":"2026-08-03T13:49:11Z","title":"Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T10:58:58.212654Z"},"links":{"cited_paper":"/paper/2211.09536","citing_paper":"/paper/2608.02235"},"observation_digest":"sha256:68a1ee34ef917e54b97c74d64c50b1072aa8151ec7d888952e4de54ed617599b","observation_id":"2e74bdec-9b7c-42cd-b62c-84442a656954","resolution":{"observed_at":"2026-08-04T10:58:58.212654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:58:58.438958Z","title":"com/huggingface/parler-tts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02235","last_updated":"2026-08-03T13:49:11Z","snapshot_observed_at":"2026-08-09T21:37:29.393286Z","submitted_at":"2026-08-03T13:49:11Z","title":"Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T10:58:58.438958Z"},"links":{"citing_paper":"/paper/2608.02235"},"observation_digest":"sha256:e532f52b63571756aed5c1986310b9685ad2c8b41f8ddc9c8a16053fcf0f1060","observation_id":"ca06c257-26f3-492c-aa30-09f3b3af13aa","resolution":{"observed_at":"2026-08-04T10:58:58.438958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-10T02:15:41.685360Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-04T10:58:58.620852Z","title":"Microsoft Corporation,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02235","last_updated":"2026-08-03T13:49:11Z","snapshot_observed_at":"2026-08-09T21:37:29.393286Z","submitted_at":"2026-08-03T13:49:11Z","title":"Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T10:58:58.620852Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2608.02235"},"observation_digest":"sha256:d83a81ee6f05d3906b06179fd165a57053cf39f4633656266e41c362150f8871","observation_id":"8851c956-d783-434b-9400-67f0ca5946d0","resolution":{"observed_at":"2026-08-04T10:58:58.620852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15561","last_updated":"2021-07-23T12:32:52Z","snapshot_observed_at":"2026-08-08T12:28:23.489422Z","submitted_at":"2021-06-29T16:50:51Z","title":"A Survey on Neural Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.15561","snapshot_observed_at":"2026-08-04T10:58:58.856718Z","title":"arXiv preprint arXiv:2106.15561","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02235","last_updated":"2026-08-03T13:49:11Z","snapshot_observed_at":"2026-08-09T21:37:29.393286Z","submitted_at":"2026-08-03T13:49:11Z","title":"Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T10:58:58.856718Z"},"links":{"cited_paper":"/paper/2106.15561","citing_paper":"/paper/2608.02235"},"observation_digest":"sha256:a31fd8bc6cb9e778ea2c458dd518c7c371146fa82f9c0ca412bfe3bd7528cd1f","observation_id":"d13d5482-d48e-4789-a588-700c13809a32","resolution":{"observed_at":"2026-08-04T10:58:58.856718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2013-564","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"1781–1785","venue":null,"work_id":"56e0bc4c-8dd4-4b72-8048-6e1b7ff4050a","year":2013},"citing_paper":{"arxiv_id":"2608.02235","last_updated":"2026-08-03T13:49:11Z","snapshot_observed_at":"2026-08-09T21:37:29.393286Z","submitted_at":"2026-08-03T13:49:11Z","title":"Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-04T10:58:58.755610Z"},"links":{"citing_paper":"/paper/2608.02235"},"observation_digest":"sha256:df173b9de8a725f42fe03c938e9e43328734a99fb9b2a47e8483d59a66f593bc","observation_id":"35a0d035-a2a6-4a0e-a222-1166472d564a","resolution":{"observed_at":"2026-08-04T11:04:58.907080Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:58:58.959621Z","title":"4006–4010","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02235","last_updated":"2026-08-03T13:49:11Z","snapshot_observed_at":"2026-08-09T21:37:29.393286Z","submitted_at":"2026-08-03T13:49:11Z","title":"Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T10:58:58.959621Z"},"links":{"citing_paper":"/paper/2608.02235"},"observation_digest":"sha256:4278887a04a1d97154ce1ea0d20a3ec31845114bc1f96aa7336a42a365d0bc9e","observation_id":"3b517bd8-dc7e-41b6-8236-3099fe64470a","resolution":{"observed_at":"2026-08-04T10:58:58.959621Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:58:58.308685Z","title":"Kirkland,A.,Mehta,S.,Lameris,H.,Henter,G.E.,Szekely,E.,2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02235","last_updated":"2026-08-03T13:49:11Z","snapshot_observed_at":"2026-08-09T21:37:29.393286Z","submitted_at":"2026-08-03T13:49:11Z","title":"Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T10:58:58.308685Z"},"links":{"citing_paper":"/paper/2608.02235"},"observation_digest":"sha256:59222c129eb2d39ddc3d139a71ef47757afd52728674490fcc36d249b30cf08b","observation_id":"a6020d7e-d6ef-4a32-ad3d-e75a0d7717f3","resolution":{"observed_at":"2026-08-04T10:58:58.308685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-04T10:58:58.101467Z","title":"arXiv preprint arXiv:2210.11416","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02235","last_updated":"2026-08-03T13:49:11Z","snapshot_observed_at":"2026-08-09T21:37:29.393286Z","submitted_at":"2026-08-03T13:49:11Z","title":"Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T10:58:58.101467Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2608.02235"},"observation_digest":"sha256:c3b3c8bb54d692184c93ade0ade193334faba514b58cacf6647aa24cc5c052b9","observation_id":"42a3aad6-8c27-403c-af66-4a91274bccd5","resolution":{"observed_at":"2026-08-04T10:58:58.101467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-1354","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2195–2199","venue":null,"work_id":"1a3b9879-cac3-4efa-b5ba-c88bd1736988","year":2024},"citing_paper":{"arxiv_id":"2608.02235","last_updated":"2026-08-03T13:49:11Z","snapshot_observed_at":"2026-08-09T21:37:29.393286Z","submitted_at":"2026-08-03T13:49:11Z","title":"Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T10:58:57.952674Z"},"links":{"citing_paper":"/paper/2608.02235"},"observation_digest":"sha256:319f6352837e96c4b9bc9fc3254d3490b15a7ad04db7937369f92d5fa398c9a8","observation_id":"bbe9cf30-54ef-4944-9ffd-44729b8a004c","resolution":{"observed_at":"2026-08-04T11:04:59.098348Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26978","last_updated":"2026-05-26T13:03:20Z","snapshot_observed_at":"2026-08-09T21:36:45.735044Z","submitted_at":"2026-05-26T13:03:20Z","title":"PashtoTTS-Bench: automated screening for low-resource non-Latin-script text-to-speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26978","snapshot_observed_at":"2026-08-04T10:58:57.714856Z","title":"Arshad, H., et al.,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02235","last_updated":"2026-08-03T13:49:11Z","snapshot_observed_at":"2026-08-09T21:37:29.393286Z","submitted_at":"2026-08-03T13:49:11Z","title":"Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T10:58:57.714856Z"},"links":{"cited_paper":"/paper/2605.26978","citing_paper":"/paper/2608.02235"},"observation_digest":"sha256:4da89e4a6070592e5bd870b8fd190483e0eb297900d3a581095891addb36ef87","observation_id":"da89fa8e-7d62-4b1c-a7af-ebb9695c98fc","resolution":{"observed_at":"2026-08-04T10:58:57.714856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02235","last_updated":"2026-08-03T13:49:11Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T21:37:29.393286Z","submitted_at":"2026-08-03T13:49:11Z","title":"Domain-Specific Evaluation of Text-to-Speech Systems: A Multi-Metric Benchmarking Study"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2608.02235."}