{"as_of":"2026-08-14T23:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:117ac6798db9e941229f1c80169c773b926905f01d8338e23ff661f0339e0e30","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:47:51.689848Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.11258/citation-record","integrity":"/paper/2411.11258/integrity","json":"/paper/2411.11258/citation-record.json","paper":"/paper/2411.11258"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.10533","last_updated":"2024-09-24T01:14:07Z","snapshot_observed_at":"2026-08-13T04:17:45.090636Z","submitted_at":"2024-02-16T09:38:16Z","title":"APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10533","snapshot_observed_at":"2026-08-12T18:47:51.288451Z","title":"Apcodec: A neural audio codec with parallel amplitude and phase spectrum encoding and decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.288451Z"},"links":{"cited_paper":"/paper/2402.10533","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:7719502eca230b7b526c66d4e1454d67e26048b1f6af1c493911f654435bfa3b","observation_id":"c47f90a2-7987-4b51-b815-cbf24766bb4a","resolution":{"observed_at":"2026-08-12T18:47:51.288451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:53.116558Z","title":null,"venue":null,"work_id":"28ef1642-466b-450e-af5e-c93b9bc953b9","year":2020},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.295087Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:8594c0d37a07e117189e1ed311d25ff9948cfbd8d37a78d1ae1cdc1e2f42519b","observation_id":"4b56eaca-498e-458e-ab90-63622f40485e","resolution":{"observed_at":"2026-08-12T18:47:53.122993Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:53.099529Z","title":"APNet: An all-frame-level neural vocoder incorpo- rating direct prediction of amplitude and phase spectra.IEEE/ACM Transactions on Audio, Speech, and Language Processing , 2023","venue":null,"work_id":"45540826-8058-4253-a69a-c03473f47ccf","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.300069Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:c290ce1e60d2ab859fd88d423fc8be281fbb8dcf00cd65e38628527af6de66e6","observation_id":"e5a4ab15-641f-4883-a496-1466aaef0844","resolution":{"observed_at":"2026-08-12T18:47:53.104762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:53.083438Z","title":"Neural speech phase prediction based on parallel estimation architecture and anti-wrapping losses","venue":null,"work_id":"b5a8fab0-4520-4df8-a570-7164e656b917","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.305152Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:b9226e53780bbd52ec59be398a56c815952a39e84c608f20256f8ee3e51b1b38","observation_id":"941397a5-4586-4567-b8d9-13954a1f2a18","resolution":{"observed_at":"2026-08-12T18:47:53.089020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:53.066186Z","title":"Long-frame-shift neural speech phase prediction with spectral continuity enhancement and interpolation error compen- sation","venue":null,"work_id":"b4397973-71bd-4065-8f75-f37fe697a242","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.310478Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:1fcaae43cb75fba7db52ad0d409b594721058cc4c82d36e5ac86f3044d45a4bf","observation_id":"8acb7ca0-f313-455d-9cff-e87352053c20","resolution":{"observed_at":"2026-08-12T18:47:53.071416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05453","last_updated":"2020-02-16T18:35:27Z","snapshot_observed_at":"2026-08-11T05:38:01.369830Z","submitted_at":"2019-10-12T00:55:06Z","title":"vq-wav2vec: Self-Supervised Learning of Discrete Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.05453","snapshot_observed_at":"2026-08-12T18:47:51.315555Z","title":"vq-wav2vec: Self-supervised learning of discrete speech representations.arXiv preprint arXiv:1910.05453, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.315555Z"},"links":{"cited_paper":"/paper/1910.05453","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:e22d0d71fd41fa74e946769574b9ee9e36452de7e1e181ce0d37a20ec4023794","observation_id":"1ed81267-acbe-47a6-b11a-49bbf046eafd","resolution":{"observed_at":"2026-08-12T18:47:51.315555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:53.047475Z","title":"Audiolm: a language modeling approach to audio generation","venue":null,"work_id":"d6768a10-43bb-4518-99f0-e6030b0a7dbe","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.321616Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:934b9cab01fb48b4c7c866ca5c0a0e1586c0bb59d2e2c619c3ba288b7c8f923f","observation_id":"697d32cd-6f82-431f-8350-602e496b66b5","resolution":{"observed_at":"2026-08-12T18:47:53.053852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:53.026554Z","title":"Iso/mpeg-1 audio: A generic standard for coding of high-quality digital audio.Journal of the Audio Engineering Society , 42(10):780–792, 1994","venue":null,"work_id":"62e5fe6c-ff0b-4419-b916-b9261c615b70","year":1994},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.326911Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:52c971295821941fab704b66a188933fd279df6613b5fff68ba35c1ed5d156ab","observation_id":"9bbf6214-0846-452c-8ca2-5aa583c8fc1b","resolution":{"observed_at":"2026-08-12T18:47:53.032029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:53.009451Z","title":"Crowdsourcing preference tests, and how to detect cheating","venue":null,"work_id":"68ff311a-d6de-4d00-8365-933ace8e4ef5","year":2011},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.331806Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:5f31c5e5cd8a6e643c01335213e1eff48f29d0ba1a4da4ad8476ca91b9a7860f","observation_id":"f992542b-b0d6-4b1a-801a-b6db205cd865","resolution":{"observed_at":"2026-08-12T18:47:53.014682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.991650Z","title":"ViSQOL v3: An open source production ready objective speech and audio metric","venue":null,"work_id":"48851148-5fde-4f08-bf81-108eaddbf161","year":2020},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.337005Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:ee04324d262614d98273e5725294fff82c305fdf3377f3e331f4c835b9a154c1","observation_id":"3cb54547-c291-4b60-aed2-294195bd0fe2","resolution":{"observed_at":"2026-08-12T18:47:52.997282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.975049Z","title":"High fidelity neural audio compression","venue":null,"work_id":"e2ca7784-9239-4c51-9cb2-0e661b123889","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.342222Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:b9f7daada44c73315b54c2c29ea79052889b7069b580d737ec5b4fcb820d413a","observation_id":"96a17bfa-ada3-48f8-ace9-120a324aa15e","resolution":{"observed_at":"2026-08-12T18:47:52.980738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.958958Z","title":"Overview of the evs codec architecture","venue":null,"work_id":"49c784a4-8e5f-4ae4-8202-c897ea64a27c","year":2015},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.347324Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:19a693451ae18e0ae3fadec469d3f9355346815ca5cc189482dc47d441e46697","observation_id":"2b2e2821-aa0f-491d-8f20-500d520096b7","resolution":{"observed_at":"2026-08-12T18:47:52.964100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:51.352694Z","title":"Adversarial audio synthesis","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.352694Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:f266c3cac5dd1abc66aa56d1c52068f64cfc8138643439c3e8d92972c14fe6ee","observation_id":"76fcf08f-aaab-403a-9db2-d61b6e5653d0","resolution":{"observed_at":"2026-08-12T18:47:51.352694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00768","last_updated":"2024-10-24T04:54:27Z","snapshot_observed_at":"2026-08-13T16:09:53.714749Z","submitted_at":"2022-04-02T05:28:48Z","title":"VQTTS: High-Fidelity Text-to-Speech Synthesis with Self-Supervised VQ Acoustic Feature","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.00768","snapshot_observed_at":"2026-08-12T18:47:51.357279Z","title":"Vqtts: High-fidelity text- to-speech synthesis with self-supervised vq acoustic feature","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.357279Z"},"links":{"cited_paper":"/paper/2204.00768","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:cf58cb6fc147c023c1114663818fa6f16931987eccd82ed4c810ce3aa0db31f7","observation_id":"3a511ba9-fbc4-4dca-870e-1e75faf706da","resolution":{"observed_at":"2026-08-12T18:47:51.357279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.932311Z","title":"Apnet2: High-quality and high-efficiency neural vocoder with direct prediction of amplitude and phase spectra","venue":null,"work_id":"d0367a1c-21bd-49dd-a80a-76742568226a","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.363643Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:426814c37b6d00a60e9626970049c30f6a1f601c0ce59bd13d9b720bb06d04b1","observation_id":"ed038733-e9fb-42d2-b396-b4060d4c58c0","resolution":{"observed_at":"2026-08-12T18:47:52.937121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.917141Z","title":"Generative adversarial nets","venue":null,"work_id":"10fe47f6-512b-4b3c-9b8d-414015e4d904","year":2014},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.369873Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:2750424b26409ce3803ef4413efdea3cc1f1248ea711e68e3262e16a224a5830","observation_id":"d6403e04-e83a-4a2c-992e-ab1a71551444","resolution":{"observed_at":"2026-08-12T18:47:52.921959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.900379Z","title":"Long short-term memory","venue":null,"work_id":"95d93099-4288-44c2-8978-2bf4f16e7d71","year":2012},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.375651Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:fcace0d478a52b76e2683fd0317b588afc504742f3712f67f27084bf2fd3d2a3","observation_id":"c04a2b58-0840-49c9-b290-0f5e592b06a0","resolution":{"observed_at":"2026-08-12T18:47:52.905221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.884496Z","title":"A spectral energy distance for parallel speech synthesis","venue":null,"work_id":"013c3a27-9e3f-43dc-ba06-9813d52cb777","year":2020},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.381364Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:561ca49e03e1e7bfe78508d14511825266e0437ba58ed3db34f7d38114776234","observation_id":"4865663c-5a24-4fed-8618-85e055c53f84","resolution":{"observed_at":"2026-08-12T18:47:52.889445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10887","last_updated":"2022-09-22T09:43:17Z","snapshot_observed_at":"2026-08-13T14:21:51.903254Z","submitted_at":"2022-09-22T09:43:17Z","title":"A Multi-Stage Multi-Codebook VQ-VAE Approach to High-Performance Neural TTS","version":1},"cited_work":{"arxiv_id":"2209.10887","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.10887","snapshot_observed_at":"2026-08-12T18:47:51.894840Z","title":"A Multi-Stage Multi-Codebook VQ-VAE Approach to High-Performance Neural TTS","venue":"cs.SD","work_id":"7653d5e6-eb2a-491a-947b-4bcece15f07a","year":2022},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.386579Z"},"links":{"cited_paper":"/paper/2209.10887","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:9bf5b27e2f0cf272f2c6619e97882a2d16f9697a302ad821e6cfdd9c32795cc3","observation_id":"c6074c2d-65be-49b0-aeb0-ebc65e1dcb41","resolution":{"observed_at":"2026-08-12T18:47:51.902113Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:51.393319Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.393319Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:435f077460605a69ec45f9ef3c28a547e007ff9d71b930e59f2b6afe76adde27","observation_id":"d03e39e0-be2c-4a5f-9454-7870c72894c8","resolution":{"observed_at":"2026-08-12T18:47:51.393319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.857058Z","title":"Gaussian error linear units (GELUs)","venue":null,"work_id":"0020718d-27da-48f1-906b-da179f822d18","year":2017},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.398742Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:27ede4350862d0c7f03da60773780379e9355aa226c18f809c3c70b0f7118721","observation_id":"55f6247c-120e-4e43-8e06-93bea41fbc63","resolution":{"observed_at":"2026-08-12T18:47:52.862310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.840159Z","title":"Hubert: Self-supervised speech repre- sentation learning by masked prediction of hidden units.IEEE/ACM Transactions on Audio, Speech, and Language Processing , 29:3451–3460, 2021","venue":null,"work_id":"a514f13a-2a54-4ea9-bf43-0ae00c912b48","year":2021},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.403526Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:a10779e24bb179baae1f363b0eebbbc1731b3dda5b867a5011d3cf819904c526","observation_id":"a225fc0b-6077-4c5f-9413-b594abc6ca26","resolution":{"observed_at":"2026-08-12T18:47:52.845446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00169","last_updated":"2024-07-22T09:53:44Z","snapshot_observed_at":"2026-08-13T10:22:57.576596Z","submitted_at":"2023-08-31T23:26:10Z","title":"RepCodec: A Speech Representation Codec for Speech Tokenization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00169","snapshot_observed_at":"2026-08-12T18:47:51.409362Z","title":"Repcodec: A speech representation codec for speech tokenization.arXiv preprint arXiv:2309.00169 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.409362Z"},"links":{"cited_paper":"/paper/2309.00169","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:5c9f2099754ebc81052993acc2271c6f24465a5f7332863ebbb5849707eca9f1","observation_id":"220e17b8-b852-496c-9776-fb4f4a0d4001","resolution":{"observed_at":"2026-08-12T18:47:51.409362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.824912Z","title":"The LJ speech dataset","venue":null,"work_id":"e146cab4-d659-4ca4-80c0-6fe1aac016b7","year":2017},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.414859Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:2300697e72faea257f81fea3a21b242cf97b08bfabc762ad22a15c843067ad97","observation_id":"194898d2-e1b8-4824-9575-de9a4ccab147","resolution":{"observed_at":"2026-08-12T18:47:52.829906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.809632Z","title":"Univnet:Aneuralvocoder with multi-resolution spectrogram discriminators for high-fidelity waveform gener- ation","venue":null,"work_id":"c672d082-5a8b-49cb-8310-1c5b417968d9","year":2021},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.419681Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:d1a666e09bb28916d3deee19f6185b091fb0af286df1925530dfbeb7a4509a20","observation_id":"5843b434-5ecb-4fc7-91d5-ce407d34d7eb","resolution":{"observed_at":"2026-08-12T18:47:52.814549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.793890Z","title":"GlotNet—a raw waveform model for the glottal excitation in statistical parametric speech synthesis","venue":null,"work_id":"d258c357-bc02-4691-9893-afdff3385222","year":2019},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.425218Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:dc630d41f6ebcaf3319612cd136ffea8e16711c8676a2ff43c03451b18d4c2af","observation_id":"0f21d5a1-6e49-49fc-a94a-538caa4c5177","resolution":{"observed_at":"2026-08-12T18:47:52.798943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.777212Z","title":"iSTFTNet: Fast and lightweight mel-spectrogram vocoder incorporating inverse short-time Fourier transform","venue":null,"work_id":"21414bc8-9bbf-4e10-af70-d339d5dba09b","year":2022},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.430599Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:724d30d684fdad30f9ff829c0b258ce8d92610f668a3473b5c2d0d199640951a","observation_id":"b4063528-f205-44e2-b288-744ca791cc66","resolution":{"observed_at":"2026-08-12T18:47:52.783108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.759704Z","title":null,"venue":null,"work_id":"30acca06-f5fb-42ec-9a3b-1dddda1000a5","year":1999},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.437083Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:fa970db7cc3e7595d71d9cdb8fb414fc030598443243d1d87b1e11360783b70d","observation_id":"ccc19170-6be2-4ceb-8727-b9059f02950c","resolution":{"observed_at":"2026-08-12T18:47:52.764666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.743008Z","title":"HiFi-GAN: Generative adver- sarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":"271cbd9b-57cc-474c-b309-3d6ecd7f702c","year":2020},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.442900Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:3f45e8ad8feffe8d23c142a3aed0ad9ef351cf340d3cc24eb1efefb8220b26a8","observation_id":"499348de-367a-4e3d-b0c0-1b7306d3e7cb","resolution":{"observed_at":"2026-08-12T18:47:52.748534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.726278Z","title":null,"venue":null,"work_id":"3b1c2dfa-ad64-4d69-9c14-83fa4b2bac2c","year":1986},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.448372Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:4e9f2dfcb4406db5c496f75112379b68efa2310ac2f02221b36d41cb87a66d8c","observation_id":"a5ab773e-2581-48cb-a717-aa434258e7e0","resolution":{"observed_at":"2026-08-12T18:47:52.731393Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.710175Z","title":"MelGAN: generative adversarial networks for conditional waveform synthesis","venue":null,"work_id":"716f373c-136c-46f4-bd4b-66ace4484175","year":2019},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.453836Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:f6fb32755501db92b5ee29241ab63daca507a8d21b731188a53621935282d0f7","observation_id":"4fdfc843-8109-4659-ab48-0fae4904b63d","resolution":{"observed_at":"2026-08-12T18:47:52.715308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.694878Z","title":"PHASEAUG: A differentiable augmentation for speech synthesis to simulate one-to-many mapping","venue":null,"work_id":"d923c3f0-3de2-4e11-a11c-f16b815366bc","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.459021Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:9e10b591606b3a99b01caa53b1c4b01ac09add906aacb440de03a4012ed371aa","observation_id":"cce4f8fb-943f-431b-9f79-c3c1df243fa0","resolution":{"observed_at":"2026-08-12T18:47:52.699637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.678259Z","title":"Neural vocoder is all you need for speech super-resolution, 2022","venue":null,"work_id":"14f8e5b5-0862-4c27-9839-dda9b70bcbdd","year":2022},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.464048Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:97279f0085ec34c3858ed665de8e1294b6a705afbb7a5b57a0eab4294902ee51","observation_id":"430f0ddd-fbfb-465c-921b-6aaaf1760bc2","resolution":{"observed_at":"2026-08-12T18:47:52.683429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11972","last_updated":"2022-01-28T07:41:10Z","snapshot_observed_at":"2026-08-13T16:51:15.585651Z","submitted_at":"2022-01-28T07:41:10Z","title":"DiffGAN-TTS: High-Fidelity and Efficient Text-to-Speech with Denoising Diffusion GANs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11972","snapshot_observed_at":"2026-08-12T18:47:51.471319Z","title":"Diffgan-tts: High-fidelity and efficient text- to-speech with denoising diffusion gans.arXiv preprint arXiv:2201.11972 , 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.471319Z"},"links":{"cited_paper":"/paper/2201.11972","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:001f93f8730faad2758a3064c7c6d97a88432789deb69361abfef764443dd89e","observation_id":"7cc61c9e-f6aa-4b7b-bfcf-c4d1f4a034e3","resolution":{"observed_at":"2026-08-12T18:47:51.471319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.660697Z","title":"A convnet for the 2020s","venue":null,"work_id":"a5812eac-708f-4c8f-b5c0-af3b1d1e05ab","year":2022},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.477762Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:339d890c016c3cef20df31b41370e2d419017319124a8db77c79e94edbf9eb57","observation_id":"bf4bcccb-b280-4870-ac60-957f1ff73308","resolution":{"observed_at":"2026-08-12T18:47:52.666050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.644442Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"678810ea-3a6c-4a2a-ba47-7f888918cb2b","year":2018},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.483846Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:77965bb1580dbf2f8e3b3836c34bb3796930d06dc72cf29dc87417c1b7d6f609","observation_id":"2653fa72-aaf2-41f2-9b47-7d3f33b439a8","resolution":{"observed_at":"2026-08-12T18:47:52.649809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.626526Z","title":"Source-filter-based generative adversarial neural vocoder for high fidelity speech synthesis","venue":null,"work_id":"9a0bd4bb-89e2-4a84-a5e5-d3cfdec8022e","year":2022},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.489915Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:00dfe8a389b922ab49608b60534d9d95f93c5ed159bbb4cd84c6519da392cbdc","observation_id":"ec25e984-31ea-416e-a5ea-549839a9ae5b","resolution":{"observed_at":"2026-08-12T18:47:52.632295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13686","last_updated":"2023-05-23T04:48:51Z","snapshot_observed_at":"2026-08-13T11:35:58.254748Z","submitted_at":"2023-05-23T04:48:51Z","title":"MP-SENet: A Speech Enhancement Model with Parallel Denoising of Magnitude and Phase Spectra","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13686","snapshot_observed_at":"2026-08-12T18:47:51.494938Z","title":"Mp-senet: A speech enhancement model with parallel denoising of magnitude and phase spectra","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.494938Z"},"links":{"cited_paper":"/paper/2305.13686","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:d3497b18fc777b1e246177f16b07fa6f11a35cfd25e0afc197bc0efe86f3a485","observation_id":"8b4c81a1-b1bc-4688-99b2-95a34b50ec34","resolution":{"observed_at":"2026-08-12T18:47:51.494938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.609280Z","title":"Rectifier nonlinearities improve neural network acoustic models","venue":null,"work_id":"92691d5f-03ba-4171-99ba-5b5cbcb18afd","year":2013},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.500806Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:839e90d199e7129d7978c5bf6c1a50520b0fa01fffe05bb68a6f4ebd4eee49ff","observation_id":"c2e6fa0c-9703-4bbc-93e8-b54035ab2da8","resolution":{"observed_at":"2026-08-12T18:47:52.614586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.593108Z","title":"SampleRNN: An unconditional end-to-end neural audio generation model","venue":null,"work_id":"f9366022-354c-444e-9b1f-7ec6d936c359","year":2016},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.505578Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:3a02936f37bb538583ebd238c2824543ba56a881ff4f2b43aa7dfae127c123c2","observation_id":"28320407-d618-4955-9d2c-260111eaf5c5","resolution":{"observed_at":"2026-08-12T18:47:52.598385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.575446Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":"e49cd39b-a3a3-464d-abaf-120248df63ef","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.510632Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:cf9df8ac320ecaba56b87a73987831e42971ef9bb61e6504d07831654bbc0957","observation_id":"a8c7ddc5-5a83-458b-81dd-b176c47734f2","resolution":{"observed_at":"2026-08-12T18:47:52.580994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.556365Z","title":"WORLD: A vocoder-based high-quality speech synthesis system for real-time applications.IEICE Transac- tions on Information and Systems , 99(7):1877–1884, 2016","venue":null,"work_id":"9a646dcf-5071-4110-9f04-65b93fb0f27e","year":2016},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.515933Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:f13e9c2623b4edfcbe2080c38663968c4570fe30b6ad5f417d09664cca0ee2ef","observation_id":"c4024053-0c4c-4cc2-bc87-1602d3a5a2aa","resolution":{"observed_at":"2026-08-12T18:47:52.562869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.536100Z","title":"Expediting tts synthesis with adversarial vocoding","venue":null,"work_id":"0e0316c9-bdb8-49f8-8818-2add74caf3a6","year":2019},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.521474Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:d8b92fe0a715bc4129c84f1317b46abc22092d99ca570190414863adbf0d923c","observation_id":"c421bbc6-cd07-49eb-b690-2329909c9f50","resolution":{"observed_at":"2026-08-12T18:47:52.542031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05725","last_updated":"2023-08-10T17:41:19Z","snapshot_observed_at":"2026-08-13T10:37:03.795815Z","submitted_at":"2023-08-10T17:41:19Z","title":"EXPRESSO: A Benchmark and Analysis of Discrete Expressive Speech Resynthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05725","snapshot_observed_at":"2026-08-12T18:47:51.527155Z","title":"Ex- presso: A benchmark and analysis of discrete expressive speech resynthesis.arXiv preprint arXiv:2308.05725, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.527155Z"},"links":{"cited_paper":"/paper/2308.05725","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:ae5438b4ba3230f24bb02aa5121ad3f89eb7ed2821a7ca8ed7010d628cd1f239","observation_id":"a2a8e21e-e2b5-44d8-babd-9337ca96c34f","resolution":{"observed_at":"2026-08-12T18:47:51.527155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.518106Z","title":"Parallel WaveNet: Fast high-fidelity speech synthesis","venue":null,"work_id":"38b92b74-f972-440b-84ee-a81c1a13452f","year":2018},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.534346Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:eacdea50b0da26c9a1a8d48dc32f83edf3fafbddc2fcf89c30d05ca3b2bec4f8","observation_id":"446f2159-383d-447f-9972-00152859cf80","resolution":{"observed_at":"2026-08-12T18:47:52.525246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.501948Z","title":"WaveNet: A generative model for raw audio","venue":null,"work_id":"3999b8ef-3a78-435e-adab-e089448d4d51","year":2016},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.540109Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:2db348230c7169dc420069136924f2645385cccbbafc43f30fa232f9b64838fb","observation_id":"846bffcc-0a1a-4ed1-8977-3dbd2776866c","resolution":{"observed_at":"2026-08-12T18:47:52.507049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.484727Z","title":"Linear predictive coding","venue":null,"work_id":"8c3eef80-4a61-4cc6-8fb5-39b13043e80b","year":1988},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.544982Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:87714a6565c16eb115ef4423a8fd1ce14f6e6712dc990a4df865a0b8c071342f","observation_id":"f1ca97b6-c3cf-4cdf-9b5b-4aaeba487477","resolution":{"observed_at":"2026-08-12T18:47:52.489617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.464835Z","title":"Generativeadversarialnetwork-basedapproachtosignal reconstruction from magnitude spectrogram","venue":null,"work_id":"ee295884-605c-4479-8922-7998ef69f9f4","year":2018},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.549935Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:a2ede4c008812f3cfe7cd9f9c6b6143355d1bbdd3a4b8b3c98ea753c7b64e42f","observation_id":"ee2e052b-9e6d-4b35-b7e3-f2e102498c0f","resolution":{"observed_at":"2026-08-12T18:47:52.472077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.446487Z","title":"Wave-gan: a deep learning approach for the prediction of nonlinear regular wave loads and run-up on a fixed cylinder.Coastal Engineering, 167:103902, 2021","venue":null,"work_id":"dc236f83-4295-431f-9204-988da29f4c52","year":2021},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.554746Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:0f2d3793157f70e0ec7351acdf29762715bd498dbdc992595bf39e73fe849f1f","observation_id":"88d59813-fc92-40cf-8001-f5b6c91ff54a","resolution":{"observed_at":"2026-08-12T18:47:52.452183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.423456Z","title":"ClariNet: Parallel wave generation in end-to-end text-to-speech","venue":null,"work_id":"f2137fef-4ca8-43d0-8a6d-3aac91406e7d","year":2018},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.559532Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:6f6cf933524d3e267a37d59f87c194be4d02dcdf4acb178ec8fd7605a0c61af8","observation_id":"1cefcd94-0c6d-4474-bd30-1d4e6dffccf9","resolution":{"observed_at":"2026-08-12T18:47:52.433624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.401118Z","title":"Waveflow: A compact flow- based model for raw audio","venue":null,"work_id":"99167fec-dbe9-43b5-8f5c-2c13adabbdd0","year":2020},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.564487Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:738dd499062d67712f100a5f9f29160a54b7a3aa5dc62c093de707dcf0e24388","observation_id":"8e4a7480-60ac-4177-892d-27b0e8a90bbc","resolution":{"observed_at":"2026-08-12T18:47:52.406461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.383452Z","title":"Waveglow: A flow-based gen- erative network for speech synthesis","venue":null,"work_id":"96c5142d-8149-4a0f-8b25-fef654739d6c","year":2019},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.570862Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:27f5471ec26e79b51c29e47b18d4bb4c39704391fe9d628723cdbe2d525809a2","observation_id":"a57b22a4-2418-4bee-8c32-e4bb6897a897","resolution":{"observed_at":"2026-08-12T18:47:52.389077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.367460Z","title":null,"venue":null,"work_id":"ff90cc1f-2c98-43b6-ba6c-575a91816f93","year":2007},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.576285Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:ac5d8f532ce61a69cf2c3656dee3c1c443bb9974086c64fd044dfe63b948c814","observation_id":"0ab47423-2800-45be-9f89-3af3eb931652","resolution":{"observed_at":"2026-08-12T18:47:52.372286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.349950Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech","venue":null,"work_id":"51940b21-d5c1-4d4b-8a00-adb120238aa5","year":2020},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.582351Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:66d8bcc7576862bfa9485b879b637a43fbe49cdd57abbbdd677e43f531b9c98a","observation_id":"4a9d6b56-0a72-4a98-acf0-3178a7d499ff","resolution":{"observed_at":"2026-08-12T18:47:52.356217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.332932Z","title":"Fewer-token neural speech codec with time-invariant codes","venue":null,"work_id":"23bded05-fed8-4bb5-bfd0-5c491481480d","year":2024},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.587468Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:653b82d82af720ac6b9de02c3060441d97ddd01832d2965d970e395849b231e4","observation_id":"cce7f17d-e7df-428f-9ddd-745085f93a16","resolution":{"observed_at":"2026-08-12T18:47:52.338323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:51.592094Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.592094Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:b9fe8185bab870dd2c62a82a16592ee470b211e68ee9e6acf502b9c977777878","observation_id":"f35e040f-1fb3-4a21-bda6-ba0a552839fb","resolution":{"observed_at":"2026-08-12T18:47:51.592094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.305666Z","title":"A toll quality 8 kb/s speech codec for the personal communications system (pcs).IEEE Transactions on Vehicular Technology, 43(3):808–816, 1994","venue":null,"work_id":"984260ad-92d0-442d-9100-2e280374dc66","year":1994},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.597654Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:5217a10e73c7a89308baa0dd3a5326e30440b8948550e399c4ce53edd92f9714","observation_id":"6d485cd0-18c6-4f42-be48-006957a13a47","resolution":{"observed_at":"2026-08-12T18:47:52.311192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.289451Z","title":null,"venue":null,"work_id":"35c20509-c5b6-4c5e-93ef-95a785eace1b","year":2018},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.603829Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:e773022c6395f08dbdedcc90dbe9ea89165ec1642f4f39c487731480840d5db4","observation_id":"ad724549-5b05-493f-a20e-c0f221caf14f","resolution":{"observed_at":"2026-08-12T18:47:52.294500Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-08-13T11:27:10.322532Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-12T18:47:51.609553Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis.arXiv preprint arXiv:2306.00814, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.609553Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:842bb55c662a03b234e357e5ee9b6ce1a04147db5a27a427f26949b60901c6af","observation_id":"223fd8ff-ccae-411d-ad3f-1723c05de0e4","resolution":{"observed_at":"2026-08-12T18:47:51.609553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.272478Z","title":"Linear predictive coding systems","venue":null,"work_id":"2df62705-cec1-40c4-89a6-56f00e001587","year":1976},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.615331Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:ccb7df446b4749939ec79e3ef646d7373364f7af303c7f3e069e34ced325b984","observation_id":"d25f7265-a625-4703-a6c3-af82bb254f83","resolution":{"observed_at":"2026-08-12T18:47:52.277542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.256227Z","title":"High- quality, low-delay music coding in the opus codec","venue":null,"work_id":"841c026b-f6ff-4072-80ec-a605a84d3b13","year":2013},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.621588Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:e2ed3843e719e3b711ec1a36d8c5f44f6746d0f1934b06253deccc93546b4865","observation_id":"536dd418-5b3b-4fec-8080-3cb6b22ec255","resolution":{"observed_at":"2026-08-12T18:47:52.261629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.237237Z","title":"LPCNet: Improving neural speech synthesis through linear prediction","venue":null,"work_id":"4da16504-3731-418e-b989-d61547b51d62","year":2019},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.627258Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:c62427a2e8757d868eefea62e4770f8ed3072d6417b96b6d262f699dcefc0c21","observation_id":"455395df-d923-45ba-a8fc-d65ea5869f46","resolution":{"observed_at":"2026-08-12T18:47:52.242851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.220908Z","title":"A review of vector quantization techniques","venue":null,"work_id":"89ce1cdb-f525-431c-8566-f0cb0cb62aa2","year":2006},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.632471Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:cdb68dde9e1a7446d0aa37affe55553465533ed3ab7332222d122c2083378d15","observation_id":"5f834bf8-7453-4c3d-8c24-85198c114358","resolution":{"observed_at":"2026-08-12T18:47:52.226450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-12T18:47:51.637690Z","title":"Neural codec lan- guage models are zero-shot text to speech synthesizers.(2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.637690Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:092dec4165cae759928c6e2349c6adbb6ca96033826cabbd4c1246186db9fa1d","observation_id":"165e37aa-c693-4d38-a038-f46bb45f28ad","resolution":{"observed_at":"2026-08-12T18:47:51.637690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.203542Z","title":"Neural source-filter-based wave- form model for statistical parametric speech synthesis","venue":null,"work_id":"9da307f3-0154-4c3b-91ea-ec789807194f","year":2019},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.644418Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:0ef538e130f59fe73d301607d18cf9f478b576ca2059a4e6b09834cc5fa2d759","observation_id":"6da65fae-c7cc-433d-92dd-8627fff1668a","resolution":{"observed_at":"2026-08-12T18:47:52.209143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.185251Z","title":"Tacotron: Towards end-to-end speech synthesis.Interspeech 2017, 2017","venue":null,"work_id":"f6648187-0d6d-4d2d-92ee-9501d887d1ab","year":2017},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.650301Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:b27f8d851396e7c3b9be8b65f416c32f450c88d61a0c8686b2e681c35e440265","observation_id":"88c238f5-05fd-4d7b-b651-67814202c71e","resolution":{"observed_at":"2026-08-12T18:47:52.191451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.166332Z","title":"Convnext v2: Co-designing and scaling convnets with masked autoencoders","venue":null,"work_id":"29f11669-18e1-4aa9-9bb4-e5ca71263ece","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.655870Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:15fdb159a039db23d3e5b6a304da7168a08889639de3a6235b6d16269fc530ef","observation_id":"1bdeb114-39a5-4218-8e64-b04765d03778","resolution":{"observed_at":"2026-08-12T18:47:52.172141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.148863Z","title":"Audiodec: An open-source streaming high-fidelity neural audio codec","venue":null,"work_id":"b137cb40-2e5b-45cc-a6ae-51dd8ab0d0e9","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.662140Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:f42c1bdfe8311b7e8d46cd49bbc1b56f7f0c1230d2c6fd5951ea9aa19fff4561","observation_id":"dac23bcf-ef23-4e67-8590-0c402b8028b5","resolution":{"observed_at":"2026-08-12T18:47:52.154250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:52.001047Z","title":"Cstr vctk corpus: English multi-speaker corpus for cstr voice cloning toolkit (version 0.92)","venue":null,"work_id":"93335f45-dc71-4aa0-99c2-ec72280fb80c","year":2019},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.668031Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:75a72ed60e219ece4371d62f1cddf6382fe16bfae1023468c5dc69b1fcf8fee0","observation_id":"48aca32e-1094-499e-ad7a-dccea276c529","resolution":{"observed_at":"2026-08-12T18:47:52.136766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-13T11:49:24.433450Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-12T18:47:51.673711Z","title":"Hifi-codec: Group-residual vector quantization for high fidelity audio codec","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.673711Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:7b938813fe1ff6b5b5f868fa7d508a8a2d80dfeef2174d618a2b90483c51f6ec","observation_id":"eccdc361-0a0e-40e0-aae4-1271ce9acdc2","resolution":{"observed_at":"2026-08-12T18:47:51.673711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:51.983461Z","title":"Source-filter hifi-gan: Fast and pitch controllable high-fidelity neural vocoder","venue":null,"work_id":"f311553b-edf0-4eee-a193-306527fe33be","year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.678726Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:93616dbea7c99efe5fb4226109aca8a195877d0e27f82833364008d385152e31","observation_id":"db58b2bc-4a36-4a1d-a59c-9283c5753b11","resolution":{"observed_at":"2026-08-12T18:47:51.989129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:47:51.964934Z","title":"Soundstream: An end-to-end neural audio codec.IEEE/ACM Trans- actions on Audio, Speech, and Language Processing , 30:495–507, 2021","venue":null,"work_id":"59d9a4c2-2a03-496c-8f40-56bf208edebe","year":2021},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.683963Z"},"links":{"citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:8ebeeb85be8907f705cb1fecd144dcf60ccefb626743cd39bf331ec91c45a9f7","observation_id":"e86c4863-6802-4197-ad1c-3619e1441c71","resolution":{"observed_at":"2026-08-12T18:47:51.970628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-13T10:23:26.896178Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-12T18:47:51.689848Z","title":"Speechtok- enizer: Unified speech tokenizer for speech large language models.arXiv preprint arXiv:2308.16692, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T18:47:51.689848Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2411.11258"},"observation_digest":"sha256:7ce049dca5e2bd4a0e382af68a752ea198cec626a040c06000c3eec2ed18f94a","observation_id":"0a7a1dab-4a31-4b46-9b73-f62714c0ae11","resolution":{"observed_at":"2026-08-12T18:47:51.689848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.11258","last_updated":"2024-11-18T03:22:34Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-14T05:46:37.521823Z","submitted_at":"2024-11-18T03:22:34Z","title":"ESTVocoder: An Excitation-Spectral-Transformed Neural Vocoder Conditioned on Mel Spectrogram"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":53},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2411.11258."}