{"as_of":"2026-08-09T23:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:035c62a1d03094397ae1fd01d5e9996fc9fc2ed823d39dc3187b470dd37c23fa","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T00:27:32.622659Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T00:27:30.285078Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.01056","snapshot_observed_at":"2026-08-04T00:27:30.285078Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:30.285078Z"},"links":{"cited_paper":"/paper/2511.01056","citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:c1ab5470d77016407ea2a2ac5fe9fee8499ad8410c6c255a49e2fda7934fe521","observation_id":"2033c47d-d8b4-407a-bf84-b43e0798d82e","resolution":{"observed_at":"2026-08-04T00:27:30.285078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.01056/citation-record","integrity":"/paper/2511.01056/integrity","json":"/paper/2511.01056/citation-record.json","paper":"/paper/2511.01056"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.01056","snapshot_observed_at":"2026-08-04T00:27:30.285078Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:30.285078Z"},"links":{"cited_paper":"/paper/2511.01056","citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:c1ab5470d77016407ea2a2ac5fe9fee8499ad8410c6c255a49e2fda7934fe521","observation_id":"2033c47d-d8b4-407a-bf84-b43e0798d82e","resolution":{"observed_at":"2026-08-04T00:27:30.285078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:27:30.440254Z","title":"Overview The proposed whisper-to-speech (W2S) framework comprises three stages, as illustrated in Fig","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:30.440254Z"},"links":{"citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:0b4232c321eb73b0b7e460aa7834f38159134fcb1ba83e9902d60975fbd8c97d","observation_id":"6327563c-8ea8-4817-9ce9-72857de7159c","resolution":{"observed_at":"2026-08-04T00:27:30.440254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:27:30.539087Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:30.539087Z"},"links":{"citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:67feddfc7a54089abb83714601e547a1c2845f637ffc3ca2b97bc31952535110","observation_id":"4bb93aa6-22ec-457e-958d-9c59077066d8","resolution":{"observed_at":"2026-08-04T00:27:30.539087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:27:30.633764Z","title":"Objective evaluations show consistent gains over whispered inputs and performance approaching that of ground-truth recordings in terms of naturalness (DNSMOS 3.11, UTMOS 2.52vs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:30.633764Z"},"links":{"citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:b4f62a2a323402335fa7a4cf6d44d6aa2e12400e64032b03c8002922ad46e55b","observation_id":"83ea74e0-dfff-4670-89f7-f5e78a4d8f60","resolution":{"observed_at":"2026-08-04T00:27:30.633764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.01342","last_updated":"2021-11-02T03:00:19Z","snapshot_observed_at":"2026-08-09T18:31:11.923643Z","submitted_at":"2021-11-02T03:00:19Z","title":"Attention-Guided Generative Adversarial Network for Whisper to Normal Speech Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.01342","snapshot_observed_at":"2026-08-04T00:27:30.742369Z","title":"Attention-guided generative adversarial network for whisper to normal speech conversion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:30.742369Z"},"links":{"cited_paper":"/paper/2111.01342","citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:b8c645c457306c563fb323f5d9ba079173a3a5e13500d5fef97169b4f265d9a0","observation_id":"93ae1124-b765-4d9a-b87f-b3b786023bad","resolution":{"observed_at":"2026-08-04T00:27:30.742369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:27:30.877727Z","title":"A novel attention-guided generative ad- versarial network for whisper-to-normal speech conversion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:30.877727Z"},"links":{"citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:3f50327791dbcb12bae625ecd314bc6d28d569183b6d73242622ad6b9cff1732","observation_id":"030bb5cc-66fb-4cd9-bbca-eee124b96177","resolution":{"observed_at":"2026-08-04T00:27:30.877727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09347","last_updated":"2021-04-05T09:27:12Z","snapshot_observed_at":"2026-08-08T18:18:00.245784Z","submitted_at":"2020-04-20T14:47:46Z","title":"End-to-End Whisper to Natural Speech Conversion using Modified Transformer Network","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09347","snapshot_observed_at":"2026-08-04T00:27:31.077349Z","title":"End-to-end whisper to natural speech conversion using modified transformer network,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:31.077349Z"},"links":{"cited_paper":"/paper/2004.09347","citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:7f7ce9d3bb5a0dbc90a354525c2276c581e49959d8f839400408454ad65e1a21","observation_id":"1a6215b3-b46f-4579-b6ce-c1914bed3cea","resolution":{"observed_at":"2026-08-04T00:27:31.077349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:27:31.209083Z","title":"Gener- ative adversarial networks for whispered to voiced speech con- version: a comparative study,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:31.209083Z"},"links":{"citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:b7d3cb098e375486a70b0d163e418725b5111a7230ada231658c8dac49bc1089","observation_id":"2660c0f7-146d-46da-8c7c-55de5fa4a870","resolution":{"observed_at":"2026-08-04T00:27:31.209083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:27:31.302379Z","title":"Maskcyclegan-based whisper to normal speech conversion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:31.302379Z"},"links":{"citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:901893ab7eae1330043f8474e61a54fc1591ddf60038bced81140234c73de7ba","observation_id":"ee10939d-fc61-4a92-bc9e-324173ed39a2","resolution":{"observed_at":"2026-08-04T00:27:31.302379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:27:31.471258Z","title":"V ocoder-free non-parallel conversion of whispered speech with masked cycle-consistent generative adversarial net- works,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:31.471258Z"},"links":{"citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:46ac092e8f5a5fcf223f0e2920c79d0ec679c05effd985d00391977a19046e05","observation_id":"e08590eb-faab-4165-879b-1d715e8a37cb","resolution":{"observed_at":"2026-08-04T00:27:31.471258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:27:31.592935Z","title":"Wesper: Zero-shot and realtime whisper to normal voice conversion for whisper-based speech interac- tions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:31.592935Z"},"links":{"citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:83011d98d70ee3c1768c7d0c0110a6f043fa5537281ebfe31f5267b51692ede4","observation_id":"bd4b45c9-b9b1-4ea9-a473-2fb6394a360c","resolution":{"observed_at":"2026-08-04T00:27:31.592935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:27:31.640744Z","title":"Distillw2n: A lightweight one-shot whisper to normal voice conversion model using distillation of self- supervised features,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:31.640744Z"},"links":{"citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:7adcaa83af3a9bfc59c009ee0791b91cb6fe2227a465ea587b083995303ffbe7","observation_id":"01832f1e-6f80-4f34-b96a-89feb01029e7","resolution":{"observed_at":"2026-08-04T00:27:31.640744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11528","last_updated":"2024-08-21T11:09:48Z","snapshot_observed_at":"2026-08-09T15:52:09.543282Z","submitted_at":"2024-08-21T11:09:48Z","title":"Improvement Speaker Similarity for Zero-Shot Any-to-Any Voice Conversion of Whispered and Regular Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11528","snapshot_observed_at":"2026-08-04T00:27:31.662280Z","title":"Improvement speaker similarity for zero-shot any-to-any voice conversion of whis- pered and regular speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:31.662280Z"},"links":{"cited_paper":"/paper/2408.11528","citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:1c12f2dc76e8a1351edfc31b9be5d24ba090db2f990df1d4b9602c6f4a5bd072","observation_id":"1a2a0a42-ddca-4696-8201-fbc699ef57aa","resolution":{"observed_at":"2026-08-04T00:27:31.662280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:27:31.799075Z","title":"Whis- pered speech conversion based on the inversion of mel fre- quency cepstral coefficient features,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:31.799075Z"},"links":{"citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:d9112dad50f6384d449e2e725094bf3e92a00fe9b9382723c8e84937629bed74","observation_id":"894eef0e-9f7d-48dd-887c-61da2d95b4e9","resolution":{"observed_at":"2026-08-04T00:27:31.799075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:27:31.932344Z","title":"Glottal flow synthesis for whisper-to-speech conversion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:31.932344Z"},"links":{"citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:e36ef2abe220e9f80edee6c15b8b68f52a2f160c555a651f9e17fa4e0b50a01e","observation_id":"31dae4b7-00d6-4f15-b7a9-e23d9e3303e6","resolution":{"observed_at":"2026-08-04T00:27:31.932344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:27:32.088017Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:32.088017Z"},"links":{"citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:3c4caba200504e43e9fa2f85dba78bee31d32db1340a3e60a5b5c6e0402c3791","observation_id":"27428f30-a187-4aef-8e21-e3c211174b1b","resolution":{"observed_at":"2026-08-04T00:27:32.088017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:27:32.208797Z","title":"Aishell6-whisper: A chinese mandarin audio-visual whisper speech dataset with speech recognition baselines,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:32.208797Z"},"links":{"citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:e2a27ee15f43223179f64d14d2c2baf812a738ec2ce6a30c71fc3f70f08ecd82","observation_id":"467a1e4a-1c9b-4d7a-86b9-ec7f070fe0ce","resolution":{"observed_at":"2026-08-04T00:27:32.208797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:27:32.325364Z","title":"Soft-dtw: a differentiable loss function for time-series,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:32.325364Z"},"links":{"citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:103f4c54ef82b0d4d2928d61078569bdc62de401700b7db0e7f7c33fa2aabff5","observation_id":"1aa43ace-e3cb-442d-840a-997ac9e62c34","resolution":{"observed_at":"2026-08-04T00:27:32.325364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-04T00:27:32.435469Z","title":"Fastspeech 2: Fast and high-quality end-to- end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:32.435469Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:ece102ac9b1d832b9b9c032c09eef34bc775f275d001301d6cced9ec70dd0f95","observation_id":"7dac97be-17ba-447e-ad96-257d4e781f18","resolution":{"observed_at":"2026-08-04T00:27:32.435469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:27:32.459345Z","title":"Wespeaker: A research and production oriented speaker embedding learning toolkit,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:32.459345Z"},"links":{"citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:dc6f82843fcc79dd64406d49449a0dc0084e6ac1dcb9f5c16abc3b61cd06ae47","observation_id":"6d8a2234-0ca5-4a03-b47e-b1c4c88de3c2","resolution":{"observed_at":"2026-08-04T00:27:32.459345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11510","last_updated":"2024-07-16T08:49:30Z","snapshot_observed_at":"2026-07-06T18:47:00.524107Z","submitted_at":"2024-07-16T08:49:30Z","title":"VoxBlink2: A 100K+ Speaker Recognition Corpus and the Open-Set Speaker-Identification Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11510","snapshot_observed_at":"2026-08-04T00:27:32.487566Z","title":"V oxblink2: A 100k+ speaker recog- nition corpus and the open-set speaker-identification bench- mark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:32.487566Z"},"links":{"cited_paper":"/paper/2407.11510","citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:827c8c435d503ee9912ba202a1227ce6580626b4e8644a9d37f2bc76c1eab445","observation_id":"4ea14fc2-563a-4b30-9675-108021d84dff","resolution":{"observed_at":"2026-08-04T00:27:32.487566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-08T04:36:13.309903Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-04T00:27:32.599880Z","title":"V oxceleb2: Deep speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:32.599880Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:8a9e7b5be36a5b90335f1e0cc16f6a02a1a56225adceb79ff1053aaa853ade8f","observation_id":"3945a79a-ecfe-4eac-8e1c-4e45dd8250e5","resolution":{"observed_at":"2026-08-04T00:27:32.599880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:27:32.617233Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:32.617233Z"},"links":{"citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:06b3d3603e40972414f1c7d3ec456fb63f34140d4697ba7cf4d1f4c7e6d52021","observation_id":"de3b0585-e9fd-4f91-b6fe-3b758095457c","resolution":{"observed_at":"2026-08-04T00:27:32.617233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:27:32.620011Z","title":"Dnsmos: A non-intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:32.620011Z"},"links":{"citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:0a8bf0984d8b9dc1f2328831d058ffabf2d425c1c8f5479c05e41a401927a708","observation_id":"5cbee1b4-df98-485e-891e-deffc5ba766a","resolution":{"observed_at":"2026-08-04T00:27:32.620011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-04T00:27:32.622659Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T00:27:32.622659Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2511.01056"},"observation_digest":"sha256:7a3f6e3439ae7ec6249c3030c53d2dd6583c2a7e555eb8fa23e7cac3a6b6c0b5","observation_id":"1a38ff9c-55ca-4e97-9ee8-0db8bbd969e2","resolution":{"observed_at":"2026-08-04T00:27:32.622659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.01056","last_updated":"2026-07-20T02:49:17Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T18:31:03.706664Z","submitted_at":"2025-11-02T19:18:38Z","title":"WhisperVC: Decoupled Cross-Domain Alignment and Speech Generation for Low-Resource Whisper-to-Normal Conversion"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 1 inbound Pith citation observation for arXiv:2511.01056."}