{"as_of":"2026-08-10T04:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b3793c05e9e3ecbcccf098260e8d85bfe49a4155eb81e52b67bf3400e7442b96","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:17:45.506100Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:17:41.821457Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10774","snapshot_observed_at":"2026-08-04T10:17:41.821457Z","title":"While multilingual efforts like Common V oice arXiv:2510.10774v2 [cs.SD] 14 Oct 2025 Fig","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:41.821457Z"},"links":{"cited_paper":"/paper/2510.10774","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:6481ae2ba24e30d86318dee9333f72eeef979b665116e0de48da92fc7514c5a9","observation_id":"c0e8d3b0-4d08-48be-9860-72519bfe2f81","resolution":{"observed_at":"2026-08-04T10:17:41.821457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.10774/citation-record","integrity":"/paper/2510.10774/integrity","json":"/paper/2510.10774/citation-record.json","paper":"/paper/2510.10774"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:41.605111Z","title":"Persian, although spoken by more than 100 million people worldwide, remains significantly under- represented in speech corpora compared to high-resource languages such as English","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:41.605111Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:b1ad5d675b267881684d848f1316346eaf5c967cb53b7ea692c6bb3f509cf039","observation_id":"190b0dc4-c8c6-4599-9b0e-be9471148fd4","resolution":{"observed_at":"2026-08-04T10:17:41.605111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10774","snapshot_observed_at":"2026-08-04T10:17:41.821457Z","title":"While multilingual efforts like Common V oice arXiv:2510.10774v2 [cs.SD] 14 Oct 2025 Fig","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:41.821457Z"},"links":{"cited_paper":"/paper/2510.10774","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:6481ae2ba24e30d86318dee9333f72eeef979b665116e0de48da92fc7514c5a9","observation_id":"c0e8d3b0-4d08-48be-9860-72519bfe2f81","resolution":{"observed_at":"2026-08-04T10:17:41.821457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:41.976790Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:41.976790Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:4a099e9832ae670e86978283520372068cef0c9152df73a82093ce0669ee38ae","observation_id":"a399881c-b80f-44ff-93b9-bd42c650cf16","resolution":{"observed_at":"2026-08-04T10:17:41.976790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:42.188591Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:42.188591Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:6e36557c2db0a40c070ad31fcde75e19e36065c69c62be3b7b72486c94892c2f","observation_id":"b58c1500-7fe9-41d9-981f-9ce4d607146b","resolution":{"observed_at":"2026-08-04T10:17:42.188591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:42.347797Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:42.347797Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:5b6f51280e56a8813385c9aea45860e7d0b88a87504a176a5ded9e5dac9e97d4","observation_id":"e994f30d-f6d5-40f8-bc30-15a2226b03cb","resolution":{"observed_at":"2026-08-04T10:17:42.347797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:42.496763Z","title":"Binary search continues until re-transcription differs from the origi- nal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:42.496763Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:759bcb111f3b0b0e95d1acb3bf5d4a4aea1016e11b25a7057063926b315c1b37","observation_id":"3fcbdc75-9a15-49e7-bef6-1266f60a8918","resolution":{"observed_at":"2026-08-04T10:17:42.496763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:42.599071Z","title":"This approach ensures that each segment contains only the essential speech content while maintaining transcription accuracy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:42.599071Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:666f446f208f10dc371b9afab49e801463648117db6ea8b7c6b519484cc9947f","observation_id":"485a3165-3922-4f3a-a12c-59e659f2c705","resolution":{"observed_at":"2026-08-04T10:17:42.599071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:42.713961Z","title":"Collection and Processing Results Out of 3,807 books (9,538 hours), we fully processed 2,000","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:42.713961Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:5cbf9d29cefd5995b626f3c71c0213cb4e6cfcb24e0cb37aa813e28cf0f27b96","observation_id":"14bc078c-da92-4243-941b-977c74c6406f","resolution":{"observed_at":"2026-08-04T10:17:42.713961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:42.857606Z","title":"Training:A BPE model was trained, and 2,500 new Per- sian tokens were extracted from Copera and added to the GPT model vocabulary","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:42.857606Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:6819516c4f7986eba9ad61e9e08eb045788a34fcb81a427a6482f5825ee784b2","observation_id":"40d3a534-7145-466c-8b3a-e2114fc17829","resolution":{"observed_at":"2026-08-04T10:17:42.857606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:43.026902Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.026902Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:30fe0a3d0cdf1c31e6d9165777872e7d2c4ee86955954a72330e8c722f99c2a3","observation_id":"286b6f04-4f8e-4fbf-8280-d840015c4958","resolution":{"observed_at":"2026-08-04T10:17:43.026902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:43.172516Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.172516Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:78405f4d1e97957ca76b91dc2098d218a71b5e322a1948382bb26da20371a6c5","observation_id":"c90464b4-3d5a-47c5-91b4-89a77fbfc108","resolution":{"observed_at":"2026-08-04T10:17:43.172516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:43.302446Z","title":"Librispeech: An asr corpus based on public domain audio books","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.302446Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:1b664453839eb45e8eedcf919ee923b6973860d12e4a95d7eb73363aa3f7f4d0","observation_id":"e32f4bf4-0951-4849-ac5c-03b0cdce5e9c","resolution":{"observed_at":"2026-08-04T10:17:43.302446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:43.396224Z","title":"The lj speech dataset, 2017.https://keithito.com/ LJ-Speech-Dataset/","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.396224Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:5874ad44c39da89c18c34b946f130b023e9c1c0e356e24c690c85d868df763a9","observation_id":"12b5401f-a2b9-4553-8992-cfef05532687","resolution":{"observed_at":"2026-08-04T10:17:43.396224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:43.484771Z","title":"Cstr vctk corpus: English multi-speaker corpus for cstr voice cloning toolkit, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.484771Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:448f262c81a9e37821dd1e0b0e14fbd93ef450279dbaf77d2d91a12002c57ca5","observation_id":"a15d94aa-b61a-4a31-82ee-e873424bd98f","resolution":{"observed_at":"2026-08-04T10:17:43.484771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-05T11:17:11.092255Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-04T10:17:43.634745Z","title":"Common voice: A massively-multilingual speech corpus, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.634745Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:e10ae34bfc8194d40fff1bfd1872852bc95e910ebe5227728eafe756f9a31465","observation_id":"45a4395a-97e2-4646-939d-8f26357d7598","resolution":{"observed_at":"2026-08-04T10:17:43.634745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:43.775671Z","title":"Mls: A large- scale multilingual dataset for speech research","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.775671Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:f48bfd31a1a1e66f4badf3e8c46e3f515ffe54a66a8872a8445ce298427b5289","observation_id":"26ada9f8-aed5-4442-a131-dccbfd027460","resolution":{"observed_at":"2026-08-04T10:17:43.775671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-09T19:09:23.880235Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-04T10:17:43.934752Z","title":"V oxpopuli: A large-scale multilingual speech corpus for representation learn- ing, semi-supervised learning and interpretation, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:43.934752Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:6e17e2d072861d352c954b9d86df67e324e5076edebfb378ee20c3fa43889264","observation_id":"512e650d-05d0-4566-8218-f216c51451e2","resolution":{"observed_at":"2026-08-04T10:17:43.934752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.03627","last_updated":"2019-12-08T07:05:36Z","snapshot_observed_at":"2026-07-06T08:42:52.741268Z","submitted_at":"2019-12-08T07:05:36Z","title":"A Multi Purpose and Large Scale Speech Corpus in Persian and English for Speaker and Speech Recognition: the DeepMine Database","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.03627","snapshot_observed_at":"2026-08-04T10:17:44.054749Z","title":"A multi purpose and large scale speech corpus in persian and english for speaker and speech recognition: the deepmine database, 2019.https: //arxiv.org/abs/1912.03627","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:44.054749Z"},"links":{"cited_paper":"/paper/1912.03627","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:30ae19fa2d986ad7e090475271c1ca8491a6d861f5e952991ea0b7bab3b571c2","observation_id":"db3122dd-39b0-48a7-b35a-da162b972c53","resolution":{"observed_at":"2026-08-04T10:17:44.054749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03585","last_updated":"2023-04-07T10:52:55Z","snapshot_observed_at":"2026-08-07T05:16:03.289001Z","submitted_at":"2023-04-07T10:52:55Z","title":"ArmanTTS single-speaker Persian dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03585","snapshot_observed_at":"2026-08-04T10:17:44.244772Z","title":"Ar- mantts single-speaker persian dataset.arXiv preprint arXiv:2304.03585, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:44.244772Z"},"links":{"cited_paper":"/paper/2304.03585","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:132bd5ef18a9b19032bd3081aa6eac86b096f4dab915f400abba46f1ee245326","observation_id":"6c7aae63-dce6-415c-a61f-a9e1c61c1ef5","resolution":{"observed_at":"2026-08-04T10:17:44.244772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07259","last_updated":"2024-09-11T13:28:41Z","snapshot_observed_at":"2026-08-10T02:41:48.607843Z","submitted_at":"2024-09-11T13:28:41Z","title":"ManaTTS Persian: a recipe for creating TTS datasets for lower resource languages","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07259","snapshot_observed_at":"2026-08-04T10:17:44.404775Z","title":"Manatts persian: a recipe for creating tts datasets for lower resource languages.arXiv preprint arXiv:2409.07259, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:44.404775Z"},"links":{"cited_paper":"/paper/2409.07259","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:753ed9bd3cea9d6043622bd4df43154e0c92e4d57b2a9fce4303ba3e85b8c936","observation_id":"c9dc8844-02a9-4c10-89ba-57fbc9274576","resolution":{"observed_at":"2026-08-04T10:17:44.404775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:44.553412Z","title":"End-to-end multi- speaker fastspeech2 with hierarchical decoder.IEEE Ac- cess, 13:127805–127814, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:44.553412Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:c6f2e10cec67e737b4b0d6a9d1b7060b064b70a99476f7ae2ac65ccbff463016","observation_id":"d8007dbe-4b52-40df-9991-46aeedd2e9cb","resolution":{"observed_at":"2026-08-04T10:17:44.553412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:44.637374Z","title":"Deepmine-multi-tts: a persian speech corpus for multi-speaker text-to-speech.Language Resources and Evaluation, 59:2245–2264, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:44.637374Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:3977703c4725da0e075f4821e6160e960ca247139599accbed7fe22ab4814794","observation_id":"550374eb-971b-4588-95db-cec1d30a513d","resolution":{"observed_at":"2026-08-04T10:17:44.637374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:44.737114Z","title":"Parsbert: Transformer-based model for persian language under- standing.Neural Processing Letters, 53(6):3831–3847, October 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:44.737114Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:cd0ececbb6274d0b418b76a7ba4166a40c8aeae84ff2f6d173838e0a4376f92b","observation_id":"27b2bae3-c57f-4a0f-bf2b-fcde867e8d89","resolution":{"observed_at":"2026-08-04T10:17:44.737114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:44.884592Z","title":"Persianpunc, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:44.884592Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:82c1264fdd55c057a4e390140b782e2f7e98dec540ec1bb9b9d82e4c98d85029","observation_id":"aaaef879-b2b1-4ef1-b8ea-747db4f5e7c4","resolution":{"observed_at":"2026-08-04T10:17:44.884592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:45.026168Z","title":"Webrtc voice activity detector.https: //github.com/wiseman/py-webrtcvad","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:45.026168Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:8f87bf3676d70db27a79d92586f4659a7fdbc310737de0f9c812d5b1aeeb8dcc","observation_id":"87d787a5-f1b3-44db-b6e6-98cb74f4a8b6","resolution":{"observed_at":"2026-08-04T10:17:45.026168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:45.165224Z","title":"Ina’s mirex 2018 music and speech detec- tion system","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:45.165224Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:c408fd030ea8ca961e7d8308a1be51931c4d4c114781e0ced27316a49bbecb08","observation_id":"ecee115a-6c73-4fe2-a973-97143ecd780f","resolution":{"observed_at":"2026-08-04T10:17:45.165224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T10:17:45.373146Z","title":"ECAPA-TDNN: Empha- sized channel attention, propagation and aggregation in TDNN based speaker verification","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:45.373146Z"},"links":{"citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:81030b23248cfb0944037331bd01eb88cafefd18112adaeb95bb4a4d17ed7c31","observation_id":"7f02eb9d-ed3d-47f7-b723-31c9988c68c1","resolution":{"observed_at":"2026-08-04T10:17:45.373146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-06T13:29:11.244845Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-04T10:17:45.506100Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T10:17:45.506100Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2510.10774"},"observation_digest":"sha256:2a9cba1426731914d41adec09ceaa1eee1cd6a949bfabaeed854d4fa93ce6eac","observation_id":"aa2e9eef-15e4-4f97-aadc-7ed3d18401ba","resolution":{"observed_at":"2026-08-04T10:17:45.506100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.10774","last_updated":"2026-05-26T13:43:37Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T11:09:13.809003Z","submitted_at":"2025-10-12T19:33:11Z","title":"ParsVoice: A Large-Scale Multi-Speaker Persian Speech Corpus for Text-to-Speech Synthesis"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 1 inbound Pith citation observation for arXiv:2510.10774."}