{"as_of":"2026-08-10T10:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bbd3e7b242809802a64cb0a30b09d031f5b3c6ca9902b13fdb668b86068b5dcc","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:46:26.554154Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:46:26.469041Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T20:46:26.630275Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"cited_work":{"arxiv_id":"2507.01805","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01805","snapshot_observed_at":"2026-08-06T20:46:26.630275Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","venue":"cs.SD","work_id":"553b100a-309f-41a2-9091-55c0b8b6b0e1","year":2025},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.469041Z"},"links":{"cited_paper":"/paper/2507.01805","citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:36f3508d7b858ecb3d2e5db7cbe02138b0509dd6c982c0fdd336d649b165c31d","observation_id":"55aa937a-afbc-4ae0-a41a-52d39b608187","resolution":{"observed_at":"2026-08-06T20:46:26.632834Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.01805/citation-record","integrity":"/paper/2507.01805/integrity","json":"/paper/2507.01805/citation-record.json","paper":"/paper/2507.01805"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.843504Z","title":"They are widely used in virtual voice assistants such as Siri, Gemini and Alexa, as well as in accessibility applications designed to as- sist visually impaired individuals","venue":null,"work_id":"7cd60c2c-3858-4a1e-bc34-56c65016634d","year":null},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.465650Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:e57e0a6e63849a5b2de62477d4f066868bbec1150801582ceb6aa4626432c1bc","observation_id":"eaf3fae0-fd58-4f5e-8672-d0c86c79a543","resolution":{"observed_at":"2026-08-06T20:46:26.846350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"cited_work":{"arxiv_id":"2507.01805","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.01805","snapshot_observed_at":"2026-08-06T20:46:26.630275Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","venue":"cs.SD","work_id":"553b100a-309f-41a2-9091-55c0b8b6b0e1","year":2025},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.469041Z"},"links":{"cited_paper":"/paper/2507.01805","citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:36f3508d7b858ecb3d2e5db7cbe02138b0509dd6c982c0fdd336d649b165c31d","observation_id":"55aa937a-afbc-4ae0-a41a-52d39b608187","resolution":{"observed_at":"2026-08-06T20:46:26.632834Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.833700Z","title":"Fine-tuning NISQA Based on the subjective test responses, we fine-tuned NISQA v1.02 for Spanish TTS naturalness assessment","venue":null,"work_id":"638cddd0-2436-45da-ac3d-b62e08da08a4","year":null},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.471982Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:7b7f0883ae57adbfeb5d5c9a8fd26a256137ae21a19719d7c34ac9966a8dcc33","observation_id":"28554811-a64c-4f42-960d-84fdfc4e394d","resolution":{"observed_at":"2026-08-06T20:46:26.837073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.825138Z","title":"Dataset meta-analysis A total of 4,326 audio samples were rated in the subjective sur- vey, amounting to 226 minutes of speech data","venue":null,"work_id":"f0a22d3c-6cb2-427e-aa18-d286599c2629","year":null},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.474845Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:110daddd92a85b4d77da2b76ed9096e6afe1c69e6fec0e5b3ca26a05b26d46b1","observation_id":"7f8eff99-7720-4abe-b157-fea55e3bbb54","resolution":{"observed_at":"2026-08-06T20:46:26.828194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.816722Z","title":"Gender and voice number are indicated, and VTLP and GL suffixes specify if the samples were generated through data augmentation","venue":null,"work_id":"d1b3c8bd-a6f7-44c8-8d4c-7cb784f7289b","year":null},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.477671Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:68df9552a529c0fe9b986c876c718ab165d3e176e06a7b9b9104ed0c06cc69aa","observation_id":"9f71f772-c024-4d41-aad0-04e538198d5b","resolution":{"observed_at":"2026-08-06T20:46:26.819700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.809225Z","title":"The collected dataset consists of 4,326 audio samples from 52 different speakers (12 different TTS systems and 6 human voices)","venue":null,"work_id":"3f323d4a-77f4-44af-9d29-cd5111ee4f33","year":null},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.480434Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:97a011719a05cfda91d9ec979fab1b79aaa2b027df6805da1cce3891441d3bd2","observation_id":"0980fb11-efa6-4446-a89f-929671763a82","resolution":{"observed_at":"2026-08-06T20:46:26.811885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.801910Z","title":"P.800.1, 2016","venue":null,"work_id":"f5b8c076-1a14-46c0-900c-6f4cfa4dc30f","year":2016},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.483070Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:af9d08d689bc7cea0414f5d7c8a041594a8a7d3d08f7fc32caed95353c420a84","observation_id":"c8b2ce31-1586-45d9-88d8-8b3354eb7c91","resolution":{"observed_at":"2026-08-06T20:46:26.804436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.795023Z","title":"Analysis of the survey of voice synthesis technology,","venue":null,"work_id":"e60ea69a-8c8b-46e0-ac9a-7354ed675676","year":2023},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.485691Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:afdcca96e89b7dc3a4ed52d556e8c26da3f0258ed695946467484e93bf98f6b2","observation_id":"360eb0b3-9876-4ead-bc94-3d019d8250d2","resolution":{"observed_at":"2026-08-06T20:46:26.797272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.788026Z","title":"Perceptual eval- uation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"f9d87cc0-85b8-49c8-8071-4c158c5abaec","year":2001},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.488093Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:5cf4a4f1935e7b731ba6e865e3453105f3246166530d6036c2e9278c8aed88ef","observation_id":"68034dee-cd5a-495d-8fc8-b4129aca2721","resolution":{"observed_at":"2026-08-06T20:46:26.790569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.778346Z","title":"Perceptual objective listening quality assessment (polqa), the third generation itu-t standard for end-to- end speech quality measurement part i-temporal alignment,","venue":null,"work_id":"7241d1ee-d9e2-403b-8f89-7ac6bdc4a5cd","year":2013},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.491103Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:b9a1ae4ddcbfcbda8ba88c27eba0990685ede364c27c74f2d6914e12d051244d","observation_id":"6b4ac57a-55d1-4541-a5da-64a697d0859c","resolution":{"observed_at":"2026-08-06T20:46:26.780845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.771572Z","title":"Deep learning based assessment of syn- thetic speech naturalness,","venue":null,"work_id":"15f4710a-937d-45a4-be13-a7d322e36197","year":2020},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.494143Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:7dc382bedfadb0b5549523f846de29a6ff510892ccef8a059f05c6c7d2c152d8","observation_id":"b77a3865-be6c-4714-aa16-ab894d2205bf","resolution":{"observed_at":"2026-08-06T20:46:26.773897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08125","last_updated":"2021-10-18T17:00:52Z","snapshot_observed_at":"2026-07-06T11:48:27.995805Z","submitted_at":"2021-09-16T17:27:12Z","title":"NORESQA: A Framework for Speech Quality Assessment using Non-Matching References","version":2},"cited_work":{"arxiv_id":"2109.08125","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.08125","snapshot_observed_at":"2026-08-06T20:46:26.618938Z","title":"NORESQA: A Framework for Speech Quality Assessment using Non-Matching References","venue":"eess.AS","work_id":"b27263b5-47f5-474a-9d00-8cc54f4e921a","year":2021},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.497069Z"},"links":{"cited_paper":"/paper/2109.08125","citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:993c23d0f98106d82d3590f86fbe3aa0ccc64702a1547f8e5d7ab1c1d4ee0143","observation_id":"7161ff00-3626-4a15-bece-eeac51e5cfcc","resolution":{"observed_at":"2026-08-06T20:46:26.621694Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.764437Z","title":"Amazon Polly – Text to Speech in 47 V oices and 24 Languages,","venue":null,"work_id":"dbae710d-1a5c-4580-bc92-65cbfe3b596e","year":2025},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.500584Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:e2d82211278252efe1dc668f178d53443edbc9aba883d007944a50632272d51c","observation_id":"7ec41ad2-ea8d-48e4-808b-36521ac81324","resolution":{"observed_at":"2026-08-06T20:46:26.767064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.705917Z","title":"Dctts: Discrete diffusion model with contrastive learning for text-to-speech generation,","venue":null,"work_id":"30e7061c-71f4-4494-8a9c-1bb36c5149b8","year":2024},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.521711Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:780911fa6c145ed548b4df340aeae00e1a11545959ce059b1e7b774736c298c3","observation_id":"c8e9c4f2-68a8-4638-a7d7-6a05054e3c0b","resolution":{"observed_at":"2026-08-06T20:46:26.708384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.750141Z","title":"Microsoft Azure Speech Services,","venue":null,"work_id":"95b539f9-2a90-47da-99a5-fb2110d11c5f","year":2025},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.506618Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:2cb72530e2c9e4275ac32418e5b08ae83ca8a6ea3205355b3e9b2ed64746cb12","observation_id":"d5f6b3ad-8236-4a1e-9ce8-812fe4865a5b","resolution":{"observed_at":"2026-08-06T20:46:26.752585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.742756Z","title":"[Online]","venue":null,"work_id":"512d744e-24b5-476c-8998-bd34579af088","year":2025},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.509315Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:358b6d70603ad04b68f5b478d02b05b9fb5b5aba05f2fabb3a27271d0f8b7f79","observation_id":"50b5ff0c-c46e-476d-9dbd-06e38fc0bca8","resolution":{"observed_at":"2026-08-06T20:46:26.745168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.757141Z","title":"Available: https://aws.amazon.com/blogs/aws/ polly-text-to-speech-in-47-voices-and-24-languages/","venue":null,"work_id":"75e030f9-a2a2-426a-b306-8b4be3f4ff05","year":null},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.503380Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:2f6dcc73a647671c95bdda46e52f9d84651c5dc0184c5093f80a50c6788df1b4","observation_id":"970a5756-2a5a-4e7d-8f90-aabf30123a1e","resolution":{"observed_at":"2026-08-06T20:46:26.759535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.735615Z","title":"Servicio de Conversi ´on de Texto a Habla Hispanoamericano,","venue":null,"work_id":"1c91ff26-273c-43a0-bc30-82054884ca89","year":2025},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.512002Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:8fe64dd8d301dc6270ba10200acfbdd60dffb9111d655ef1cd6284fd89f34d86","observation_id":"3e797dc3-d2dc-4611-92d0-4df22c7c7ee8","resolution":{"observed_at":"2026-08-06T20:46:26.738140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.728072Z","title":"Texto a V oz de Loquendo Online,","venue":null,"work_id":"0c7851fd-43c0-44d8-a437-e5279739a765","year":2025},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.514667Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:bdfa9bfdea084a9e33e24129b5d8338ce19722e5caaabf5ebfe1f0793359cc2e","observation_id":"ff92029a-732d-460d-bf2c-e372f5c62d8e","resolution":{"observed_at":"2026-08-06T20:46:26.730513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.720523Z","title":"text-to-speech 1.6.1,","venue":null,"work_id":"f14e24fe-f9b9-4f0f-9fee-4136ba405072","year":2025},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.516947Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:e3430de1961b4412f08883765176a7843bce668825d8aa14e3f83ff7214d310d","observation_id":"e56075f3-20d6-4292-8a08-0dbfba4ec028","resolution":{"observed_at":"2026-08-06T20:46:26.722987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.713594Z","title":"Fastpitch: Parallel text-to-speech with pitch predic- tion,","venue":null,"work_id":"6e9051ef-55fe-446c-b3af-8eab07acf87e","year":2021},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.519301Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:ab487aeb99ad3928ef98e82db8707c0e5f8baaab4e62a0abb7a3aa040ab87b5a","observation_id":"3c271dc5-ad83-459b-a644-90220ba37996","resolution":{"observed_at":"2026-08-06T20:46:26.715935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.698807Z","title":"Speech synthesis method based on tacotron2,","venue":null,"work_id":"79031bf1-4f9f-487f-80f6-b55288de447d","year":2021},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.523956Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:be753ac2bd864830ed43bc9ef6a2ccb8c8431ab5d485a3b3a4965e916a811282","observation_id":"45224ca0-a6ec-4d6a-9758-d870666a0705","resolution":{"observed_at":"2026-08-06T20:46:26.701161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.691480Z","title":"Crowdsourcing Latin American Spanish for Low-Resource Text- to-Speech,","venue":null,"work_id":"1b5ed420-05d7-447f-81fa-d72199e3b94f","year":2020},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.526187Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:662bd757d32523eab754f1dcc3d447683d4a8e967aa44712f5733975068faba1","observation_id":"30c8c589-a65f-473b-801a-316d00bbb9f8","resolution":{"observed_at":"2026-08-06T20:46:26.693844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.683850Z","title":"Single-channel waveforms augmentations for speech recognition models","venue":null,"work_id":"b8f86fc3-08ef-4e15-ac8f-f2825d4dbf4e","year":2025},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.528431Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:ffd989bb464e0f2440a1f160d094adde35a4c1482cc34125603f4755ef3e5b5d","observation_id":"8a83aee2-5329-4f5c-8a08-41074b7b700b","resolution":{"observed_at":"2026-08-06T20:46:26.686644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.676451Z","title":"V ocal tract length perturbation (vtlp) improves speech recognition,","venue":null,"work_id":"6aa7eda6-a015-443a-8b79-6b6d9c593474","year":2013},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.530740Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:3b779468b166baf6f991478fa73b45954d126c5b10d920a48549ce0ade23ec61","observation_id":"8ae56bb5-e8de-4fd0-b216-cffd3025f470","resolution":{"observed_at":"2026-08-06T20:46:26.679076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.668686Z","title":"P.807, 2016","venue":null,"work_id":"efb273f7-cfeb-4517-b970-aba06403582c","year":2016},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.533601Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:eada29fa3a8ad81d6ed4eee40b5ebdafabaeb62b8a496096fa5544d09bd1f83d","observation_id":"11d34f26-192d-4110-bce0-a419b404d03a","resolution":{"observed_at":"2026-08-06T20:46:26.671349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.660423Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality pre- diction with crowdsourced datasets,","venue":null,"work_id":"d118351f-f813-4e5a-ac30-55b633796d14","year":2021},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.536028Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:49eeeccbbd5540ab83a4c76b9466b6e34898f9870cbf0db3062cb3f79b6f40dc","observation_id":"3d2e571a-1258-4127-95b2-ae9d9ced1e38","resolution":{"observed_at":"2026-08-06T20:46:26.663202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.652765Z","title":"Bias-aware loss for training image and speech quality prediction models from multiple datasets,","venue":null,"work_id":"2bfd6955-8ef0-4be0-a6ec-42332ed3fc25","year":2021},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.538523Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:abbe6677f8379ebc33c75fd488d74a9a95dc0ef1cf41a9d4fc09e6125e9a33a8","observation_id":"330548e2-9a60-4da2-bdc2-6921cbb741e6","resolution":{"observed_at":"2026-08-06T20:46:26.655538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-06T05:33:37.746688Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-06T20:46:26.540877Z","title":"wav2vec: Unsupervised pre-training for speech recognition,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.540877Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:9dee49644e01e7f499dc74284cc4c0dbef34808c5344ce4de0dbaa90c0fa4190","observation_id":"0d44c9b3-5ea3-4053-be17-e2763b175e0f","resolution":{"observed_at":"2026-08-06T20:46:26.540877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-08-06T20:46:26.543744Z","title":"A fine-tuned wav2vec 2.0/hubert benchmark for speech emotion recogni- tion, speaker verification and spoken language understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.543744Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:158f198ab57014ad812daeacbc9ae25d47d68c2a8c6c6e5da5e5b5d20ea89998","observation_id":"899ee35a-95c7-4794-ad69-431a93b98030","resolution":{"observed_at":"2026-08-06T20:46:26.543744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.09212","last_updated":"2020-11-18T11:10:29Z","snapshot_observed_at":"2026-08-07T12:14:57.346659Z","submitted_at":"2020-11-18T11:10:29Z","title":"On the use of Self-supervised Pre-trained Acoustic and Linguistic Features for Continuous Speech Emotion Recognition","version":1},"cited_work":{"arxiv_id":"2011.09212","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.09212","snapshot_observed_at":"2026-08-06T20:46:26.592502Z","title":"On the use of Self-supervised Pre-trained Acoustic and Linguistic Features for Continuous Speech Emotion Recognition","venue":"cs.CL","work_id":"0ecc233c-6952-4364-b6bd-c4dcc2ffe830","year":2020},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.546488Z"},"links":{"cited_paper":"/paper/2011.09212","citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:ee6f358ef9f0eac86088c84361bcb90aebc910a7fdee9f9a06e3b9d2e807f403","observation_id":"39fc0a7e-a060-417f-846a-ba618365f2c8","resolution":{"observed_at":"2026-08-06T20:46:26.595360Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.645333Z","title":"Emotion recognition from speech using wav2vec 2.0 embeddings,","venue":null,"work_id":"2217c191-5589-4a0e-a2f5-b3915b1ccb94","year":2021},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.549312Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:98ffd89d7b59792542747619aa666b7febc1360ed7f078e873f1ebcf46130056","observation_id":"68b44e2b-21b0-4762-ad0b-00bb23dfe26e","resolution":{"observed_at":"2026-08-06T20:46:26.647912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.05585","last_updated":"2020-11-11T06:18:31Z","snapshot_observed_at":"2026-08-07T17:11:04.212489Z","submitted_at":"2020-11-11T06:18:31Z","title":"Recognizing More Emotions with Less Data Using Self-supervised Transfer Learning","version":1},"cited_work":{"arxiv_id":"2011.05585","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.05585","snapshot_observed_at":"2026-08-06T20:46:26.578960Z","title":"Recognizing More Emotions with Less Data Using Self-supervised Transfer Learning","venue":"cs.LG","work_id":"4506fa3b-4258-437f-9626-f1232c7d3e4c","year":2020},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.551609Z"},"links":{"cited_paper":"/paper/2011.05585","citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:66876af2259f0d043bec96bb9702fec70960be705dd0feeffadbb87410b62920","observation_id":"3952cc81-d884-4fa7-afeb-d972d6667d03","resolution":{"observed_at":"2026-08-06T20:46:26.583707Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:46:26.638047Z","title":"Goodfellow, Y","venue":null,"work_id":"0cd9f9f4-e0ce-4b03-be3f-9c1526a0395b","year":2016},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.554154Z"},"links":{"citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:eb5cacc6f35945cbddfd0b672b7f2dabfea4a778d40b989af00840e95b21157a","observation_id":"e64f6a00-4fb2-4c15-bdff-f49e8277a9dc","resolution":{"observed_at":"2026-08-06T20:46:26.640396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":2,"verified_exact":3,"verified_fuzzy":28},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 1 inbound Pith citation observation for arXiv:2507.01805."}