{"as_of":"2026-08-10T04:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb56202270de3abe11e3b6436370b7a07a132619b78955e58d3174e99f651777","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:27:55.344163Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08319/citation-record","integrity":"/paper/2507.08319/integrity","json":"/paper/2507.08319/citation-record.json","paper":"/paper/2507.08319"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:28:00.222104Z","title":"Natural TTS synthesis by conditioning WaveNet on mel spectrogram predictions,","venue":null,"work_id":"d6e3bb07-e76c-475c-9af4-b52301b10cdb","year":2018},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.174809Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:56cfeaab3305a7f28b5001860fc088ea8933552b8c211d683ff2c6dd6ca771e5","observation_id":"118ce986-8683-4f67-b85c-914848249615","resolution":{"observed_at":"2026-08-06T18:28:00.303298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:28:00.085279Z","title":"A vector quantized ap- proach for text to speech synthesis on real-world spontaneous speech,","venue":null,"work_id":"4277243c-b361-49b4-9d8c-60de4549a74e","year":2023},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.234976Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:736fb339043d3da70766d4dc85aa8028228409b8a6c85ca2c4639a304ec3a784","observation_id":"076116c5-7b12-45cd-a9e9-c86b396fee5d","resolution":{"observed_at":"2026-08-06T18:28:00.139910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-06T18:27:53.306898Z","title":"Naturalspeech 3: Zero-shot speech syn- thesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.306898Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:fe4d0da0b8eb68879ebc0722c3ecbe25e140745be0030aa1f64c363f0a22741a","observation_id":"0ba30967-01a3-484a-aed5-4987af5df8b6","resolution":{"observed_at":"2026-08-06T18:27:53.306898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00354","last_updated":"2017-10-28T05:28:01Z","snapshot_observed_at":"2026-08-07T12:14:00.547338Z","submitted_at":"2017-10-28T05:28:01Z","title":"JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00354","snapshot_observed_at":"2026-08-06T18:27:53.371201Z","title":"JSUT corpus: free large-scale Japanese speech corpus for end-to-end speech synthesis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.371201Z"},"links":{"cited_paper":"/paper/1711.00354","citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:e69840352d3a9af5c7013bc29f0c0f5aa9bcace768c07a0e17c383c90a593ff7","observation_id":"4cce857c-0983-464f-aa9b-bf3fb64b0bad","resolution":{"observed_at":"2026-08-06T18:27:53.371201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.06248","last_updated":"2019-08-17T06:04:46Z","snapshot_observed_at":"2026-08-10T04:14:03.409069Z","submitted_at":"2019-08-17T06:04:46Z","title":"JVS corpus: free Japanese multi-speaker voice corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.06248","snapshot_observed_at":"2026-08-06T18:27:53.408284Z","title":"JVS corpus: free Japanese multi-speaker voice corpus,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.408284Z"},"links":{"cited_paper":"/paper/1908.06248","citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:bbf79dedf81729106d251aaf484011de8429e0385ecede79abd650d1ed3d5314","observation_id":"a7e6c808-0da9-4274-8872-508aabc41bba","resolution":{"observed_at":"2026-08-06T18:27:53.408284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:59.918147Z","title":"SaSLaW: Dialogue speech corpus with audio-visual egocentric information toward environment-adaptive dialogue speech synthesis,","venue":null,"work_id":"d8ddd145-eb20-44c9-9ce0-338257c9c724","year":2024},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.484224Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:4dee8891652de180a6b865d4a2fbb9c80955a1813f6801ed4c870b1e90fe2a7b","observation_id":"36f5aa05-faf8-4f27-aaf1-02f64daaba7e","resolution":{"observed_at":"2026-08-06T18:28:00.001626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:59.741424Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text- to-Speech,","venue":null,"work_id":"d095b9ff-cc4f-43e2-bd61-7639bb942bd6","year":2019},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.556671Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:e4b5d405d703da6ad3678f75d972651244a6b326abe0ad323491a5d5a0cc2131","observation_id":"9c5e6160-1e19-4dc4-bd19-5887920dc80a","resolution":{"observed_at":"2026-08-06T18:27:59.830933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:59.602175Z","title":"HUI-Audio-Corpus-German: A high quality TTS dataset,","venue":null,"work_id":"cfdc5d9b-8982-482c-8018-cd0217c2e9b1","year":2021},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.639708Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:0e5d659a2c005a431b8d25452439e549b86f7d9aa50f356a4b3505510022750e","observation_id":"6c7597bb-db5c-49e4-abab-d249df0b0910","resolution":{"observed_at":"2026-08-06T18:27:59.654498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:59.411200Z","title":"Text-to-speech synthesis from dark data with evaluation-in-the-loop data selection,","venue":null,"work_id":"628193f8-5aa1-48c0-91ec-9a626d1aabc3","year":2023},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.707559Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:faa89add2b9b971ee0ede31789f02e611a12cf89fd1da888e699d7686cbf0efe","observation_id":"62f70b8d-8166-4ea9-ab05-5e6223c11989","resolution":{"observed_at":"2026-08-06T18:27:59.459773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-09T08:32:43.969496Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-06T18:27:53.805528Z","title":"Gigaspeech: An evolving, multi- domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.805528Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:ac6ef5377cb348981ad52390d6d989a6153202738efd0a5fcb167a0161cb44d4","observation_id":"3da493c0-b1b5-47cc-afeb-a8ec8a9fa604","resolution":{"observed_at":"2026-08-06T18:27:53.805528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09323","last_updated":"2021-12-17T05:09:44Z","snapshot_observed_at":"2026-07-06T12:19:51.150913Z","submitted_at":"2021-12-17T05:09:44Z","title":"JTubeSpeech: corpus of Japanese speech collected from YouTube for speech recognition and speaker verification","version":1},"cited_work":{"arxiv_id":"2112.09323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.09323","snapshot_observed_at":"2026-08-06T18:27:55.914601Z","title":"JTubeSpeech: corpus of Japanese speech collected from YouTube for speech recognition and speaker verification","venue":"cs.SD","work_id":"d25a853e-6f6f-4282-a99e-0ef959d08cff","year":2021},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.881428Z"},"links":{"cited_paper":"/paper/2112.09323","citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:c945677139d7e274748c0b21625c51d6e3b7e0612a51e35f6d633d7acc01f20d","observation_id":"7914dd03-a75c-4d5e-8f23-4166ece8c479","resolution":{"observed_at":"2026-08-06T18:27:56.070227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2407.15828","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:55.659762Z","title":"J-CHAT: Japanese large-scale spoken dialogue corpus for spoken dialogue language modeling,","venue":null,"work_id":"c7293b45-e47b-42ae-91a1-0ab9eb6cedbc","year":2024},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:53.985871Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:085a3b46ebadabc6115bde0f0ba433297bdf4b53bfcc8f8565f4afe90ee63cc5","observation_id":"6b85a835-d610-44f8-988e-a93350e38124","resolution":{"observed_at":"2026-08-06T18:27:55.798236Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:59.217034Z","title":"Diversity-based core-set selection for text-to-speech with linguistic and acoustic fea- tures,","venue":null,"work_id":"5b812bc9-fd3b-4262-b427-fce3f4f8099f","year":2024},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.094640Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:e1f640b8693569745a38d68dd21c34a012b9fa5239887f16eb5746d0a3bf1ec5","observation_id":"d69bf310-070b-4da3-860b-9a5ff3263a86","resolution":{"observed_at":"2026-08-06T18:27:59.307447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:58.980204Z","title":"Deepcore: A comprehensive library for coreset selection in deep learning,","venue":null,"work_id":"7b8163c8-9b7e-4b51-b11b-88383ec53226","year":2022},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.212422Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:e7e5b7c0f63316955a4ca0bcaf6b245eab0ea559ed30eece2a2a1d4ac374430e","observation_id":"3c4dc365-f55d-43d8-a1ee-2ef8d31ac6dd","resolution":{"observed_at":"2026-08-06T18:27:59.104527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:58.807963Z","title":"Active learning is a strong baseline for data subset selection,","venue":null,"work_id":"ea122dbb-c374-4d2c-bb97-49ba6fdb3849","year":2022},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.296066Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:a45130c746ce964d3b549f5a9d6036907034db8c503eb19b40c1384f379ea6cf","observation_id":"06b51cf2-0a94-47f6-94e7-b1153d5eb4db","resolution":{"observed_at":"2026-08-06T18:27:58.887393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:54.394528Z","title":"A survey of deep active learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.394528Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:a9e69cfcd81702f74a0cc60023833a50007c7f30f65ceb9a8fde4bd6563c1361","observation_id":"11ac99fe-fdc0-4a83-b293-35f9693a8e0a","resolution":{"observed_at":"2026-08-06T18:27:54.394528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:54.435303Z","title":"X-vectors: Robust DNN embeddings for speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.435303Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:9120d097dbf8c41d84fdc11a959173e82570905bc1b65c90188f0464351158c6","observation_id":"9f5f5c20-6de6-40fc-a736-759e88e9676e","resolution":{"observed_at":"2026-08-06T18:27:54.435303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:58.462331Z","title":"Ctc- segmentation of large corpora for german end-to-end speech recogni- tion,","venue":null,"work_id":"ef93e6fc-1abf-4344-bc04-a73cae09e8f3","year":2020},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.521562Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:5a6418d2937dc70f415aefdee78fc5d331f6859b5b9ca615d00f7824027e4add","observation_id":"ed20ec0e-f874-44e8-87e5-edbf9143349b","resolution":{"observed_at":"2026-08-06T18:27:58.648333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:54.611739Z","title":"TTSOps: A closed- loop corpus optimization framework for training multi-speaker TTS models from dark data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.611739Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:49ddb3a028d10cd4d6be5854b693f516779d3881ac244a1260d022b5156f9d23","observation_id":"cb737d24-bba7-41c1-bd09-3916fc06a0f6","resolution":{"observed_at":"2026-08-06T18:27:54.611739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:58.203973Z","title":"Speaker generation,","venue":null,"work_id":"5ecd9a47-1820-4cef-ac47-00323ce8c9de","year":2022},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.656286Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:adf6409c1e84c1aa17b8acca4a67f1092af7675e79844c95a671a17d36b8bac0","observation_id":"145f0d5d-2e25-44fc-a068-cd37d6de6161","resolution":{"observed_at":"2026-08-06T18:27:58.324202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:57.954445Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":"5476b7b8-c0c5-4177-b84f-0ef192f561e0","year":2020},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.696419Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:f0657519abecac91bc2f4c6582af22607e268f3b2c120da78f92b3da2648a27c","observation_id":"8362134a-5a44-41ed-84d7-06187d788644","resolution":{"observed_at":"2026-08-06T18:27:58.082996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:57.573700Z","title":"Diffusion models are minimax optimal distribution estimators,","venue":null,"work_id":"5b9c9c23-015d-4f4a-8709-d8a0ecf4ca22","year":2023},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.798528Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:5a2844976afa5db6b75e23e3e1de0f1a10935883816db01211b2c76b3f26bc20","observation_id":"b77b1d56-2df1-43db-a5f5-5d0b3149cfee","resolution":{"observed_at":"2026-08-06T18:27:57.733283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:54.858512Z","title":"Diffusion models in vision: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.858512Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:b5aaeac4c58444b16514bdd9be647d381f0bf4f827f62d0752a33758cb2bf21d","observation_id":"bbc22d8c-fbac-4029-b886-a39061c92b22","resolution":{"observed_at":"2026-08-06T18:27:54.858512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:57.272665Z","title":"ITA corpus,","venue":null,"work_id":"c32add06-52bc-468c-b995-415098d457c5","year":null},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.902307Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:e0db1b6ed574d440b72b5157586505050b70ff5a3bebfd6243daa6ddee527c45","observation_id":"f265599f-8560-478f-bb09-eed3c25b8428","resolution":{"observed_at":"2026-08-06T18:27:57.422205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:57.105960Z","title":"FastSpeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":"23f7b5f6-abae-419b-9fe5-a62af40e1c55","year":2021},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:54.971264Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:d6c8f2dcd8fac445db7fa46ad51eb13d8cb687ba98b473ad3a37237e19ff1543","observation_id":"9e0de4fd-0987-481c-9a7b-4b4e78aca670","resolution":{"observed_at":"2026-08-06T18:27:57.190524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:56.970395Z","title":"HiFi-GAN: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":"a25ccdaf-238f-44b7-a7de-3dbbcfc1bf5e","year":2020},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:55.058505Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:9aa1d38240ea1c8d490b64cd9343fd4e7d3071ef7f81c7f307e13dfc5fde1d2c","observation_id":"7487de70-b9b8-43ba-a8b6-5cab2e462676","resolution":{"observed_at":"2026-08-06T18:27:57.046422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:56.730663Z","title":"HiFi-GAN,","venue":null,"work_id":"0c4af101-7d81-4572-9163-b3e56e8a8c38","year":null},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:55.142489Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:376d511f08ac4b36bb98efae2dfd4b0a3966720db19665022aea1ca5c2029c1b","observation_id":"df9a00ab-2626-49c9-8afe-8d537cc4608e","resolution":{"observed_at":"2026-08-06T18:27:56.853905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:56.497611Z","title":"FastSpeech 2-JSUT,","venue":null,"work_id":"537316f2-21b4-4ee9-812f-1261ad9ddeec","year":null},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:55.235654Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:2f8993da45c68e7ed956f422099fbac103c604489f38a02b9eac41b388ce6acf","observation_id":"9d0b883e-c82b-455e-89cb-38b3568a60ed","resolution":{"observed_at":"2026-08-06T18:27:56.623802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:27:56.224925Z","title":"x-vector,","venue":null,"work_id":"c9342864-f994-46ef-ac64-fb7fb6ee7f98","year":null},"citing_paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:27:55.344163Z"},"links":{"citing_paper":"/paper/2507.08319"},"observation_digest":"sha256:2ec3ffe7342114343d09f0e6645aff4cf21912da2556e48c1afdbc06d2e8c3a6","observation_id":"3e4dca15-a0b0-4d76-b67a-1ebfdfdbcebf","resolution":{"observed_at":"2026-08-06T18:27:56.351789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.08319","last_updated":"2025-07-11T05:11:03Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T15:37:15.955613Z","submitted_at":"2025-07-11T05:11:03Z","title":"Active Learning for Text-to-Speech Synthesis with Informative Sample Collection"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":2,"verified_fuzzy":19},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2507.08319."}