{"as_of":"2026-08-16T06:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d3a3221e99c0a4ce046780b2143a2b3027bdba6ae093c463be512d783eb4fcd","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:59:21.187694Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:26:14.455424Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T13:26:14.665558Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"cited_work":{"arxiv_id":"2501.13465","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.13465","snapshot_observed_at":"2026-08-06T13:26:14.665558Z","title":"Neural Vocoders as Speech Enhancers","venue":"cs.SD","work_id":"cb3fd2f0-cf0e-41ea-8842-a8273dab867c","year":2025},"citing_paper":{"arxiv_id":"2507.20731","last_updated":"2025-07-28T11:30:22Z","snapshot_observed_at":"2026-08-15T02:31:54.486849Z","submitted_at":"2025-07-28T11:30:22Z","title":"Learning Neural Vocoder from Range-Null Space Decomposition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:26:14.455424Z"},"links":{"cited_paper":"/paper/2501.13465","citing_paper":"/paper/2507.20731"},"observation_digest":"sha256:819fe3e3b2be2a471150c9c4f0e842e772508766750f328bcec211fffe7ce54a","observation_id":"be508643-0f5c-4216-9195-6bd4526e9ed7","resolution":{"observed_at":"2026-08-06T13:26:14.670112Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.13465/citation-record","integrity":"/paper/2501.13465/integrity","json":"/paper/2501.13465/citation-record.json","paper":"/paper/2501.13465"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.893919Z","title":"Tacotron: Towards End- to-End Speech Synthesis,","venue":null,"work_id":"26f53d28-7f54-424f-abaa-664a39735dd2","year":2017},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.012497Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:70d20aa4a965dac9aa2e8f36897225a02401eb2ef8e5d6aa0b0f514a47a012bc","observation_id":"50155a97-1f65-4130-bc0b-585f06fe892b","resolution":{"observed_at":"2026-08-10T15:59:21.899071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.879347Z","title":"Naturalspeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers,","venue":null,"work_id":"5eddc318-137e-48c3-a332-bec88b4def49","year":null},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.017287Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:3dfd271d5969b661ac0935e3d19e878722c38e8e961c6b4b69e596f80137e34a","observation_id":"9641153f-a24c-4db8-8a19-488f0a1e1d36","resolution":{"observed_at":"2026-08-10T15:59:21.884553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.865442Z","title":"Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions,","venue":null,"work_id":"86435f4a-31f5-4405-a13d-76565fefe779","year":2018},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.021720Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:23189ea60cef043662da524fae35a93924b577c6c5955c3a99df9aabb1870e37","observation_id":"4cae6b1a-aceb-4419-9e4e-715fd046e7b6","resolution":{"observed_at":"2026-08-10T15:59:21.870198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13731","last_updated":"2023-05-29T12:09:08Z","snapshot_observed_at":"2026-08-13T11:57:06.524503Z","submitted_at":"2023-04-24T07:45:28Z","title":"Text-to-Audio Generation using Instruction-Tuned LLM and Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13731","snapshot_observed_at":"2026-08-10T15:59:21.026366Z","title":"Text-to-audio generation using instruction-tuned llm and latent diffusion model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.026366Z"},"links":{"cited_paper":"/paper/2304.13731","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:43a57decf196a62d08aa166ac6a53e46edb51c0cb986e4dd3f6df969a3a6f328","observation_id":"fa2e99e3-c5b0-481b-8d65-5d64ab32c365","resolution":{"observed_at":"2026-08-10T15:59:21.026366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.852313Z","title":"Audit: Audio editing by following instructions with latent diffusion models,","venue":null,"work_id":"f1859b06-0a39-463d-bfd3-af9e2b62cbee","year":2023},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.031198Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:0e92fde780fadb6a7d7320886c91e9f3a916d26460fbd8fab8691f311d861566","observation_id":"a0e9c67a-7a5f-4146-bd1a-b4486a43fb32","resolution":{"observed_at":"2026-08-10T15:59:21.856694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.837845Z","title":"V oicefixer: Toward general speech restoration with neural vocoder,","venue":null,"work_id":"cc0a5a64-7dff-4339-b505-c253de512fbe","year":2022},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.036549Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:200c4adaf5ffc5203a846366be2ce5486ee367d3b61f7160b47307727876bf5b","observation_id":"5dc0b2d6-4012-46a5-bbe2-e65dabe9e93f","resolution":{"observed_at":"2026-08-10T15:59:21.842545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13511","last_updated":"2024-02-22T02:33:22Z","snapshot_observed_at":"2026-08-14T09:38:08.631627Z","submitted_at":"2024-02-21T03:48:53Z","title":"Mel-FullSubNet: Mel-Spectrogram Enhancement for Improving Both Speech Quality and ASR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13511","snapshot_observed_at":"2026-08-10T15:59:21.041151Z","title":"Mel-FullSubNet: Mel-Spectrogram Enhancement for Improving Both Speech Quality and Asr,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.041151Z"},"links":{"cited_paper":"/paper/2402.13511","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:c48a82136cc71cd757c1e636fd0484713f9a928f6c74a55b6ce3065b502b2f8f","observation_id":"8176fbe7-d7d8-4e38-8d29-e512dccc5614","resolution":{"observed_at":"2026-08-10T15:59:21.041151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-08-16T05:39:41.727705Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-10T15:59:21.046334Z","title":"Wavenet: A gener- ative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.046334Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:8fda65ab2d99422b0faedad4a26ba9a51ba027c1a859381d62ff9016f0a3a131","observation_id":"18582bdb-2f48-44fc-9078-8e3f6501fe95","resolution":{"observed_at":"2026-08-10T15:59:21.046334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.823046Z","title":"SampleRNN: An Unconditional End-to- End Neural Audio Generation Model,","venue":null,"work_id":"95f7225c-abba-4216-9967-30a55db5d3b6","year":2022},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.051193Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:50de1ca4192f651509027cf624a9c52737e135df505169e05d3d2a5678de245b","observation_id":"47be0e05-e25d-495e-8805-3b262ae0c533","resolution":{"observed_at":"2026-08-10T15:59:21.828162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.806452Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"d893083f-7161-4ce0-9e2d-0103bffdfb9d","year":2020},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.055510Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:8df6c9c62a34204eb6870574221b2be0d31a5dfb99b7dbbc2be43169f1020dc1","observation_id":"2d54026a-825d-4114-aeb5-38b2557aa627","resolution":{"observed_at":"2026-08-10T15:59:21.811940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.791920Z","title":"iSTFTNet: Fast and lightweight mel-spectrogram vocoder incorporating inverse short-time Fourier transform,","venue":null,"work_id":"2b792083-108c-4162-8950-c54187e032d0","year":2022},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.059647Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:f1393c946bc006595f6f23e3183ea095a3c31402a1be8a34ab2543596c205f97","observation_id":"c67f2daa-de5d-4609-8852-60ece6565016","resolution":{"observed_at":"2026-08-10T15:59:21.796963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.778675Z","title":"APNet: An all-frame-level neural vocoder incor- porating direct prediction of amplitude and phase spectra,","venue":null,"work_id":"ea422c6f-0797-4648-bcc3-acb13562c4ea","year":2023},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.063815Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:0b454021b827de6d358dc7eee5fd18d1b8b3067e0b62e59e6b4479188da75b48","observation_id":"d007f8bd-e0f6-46c2-89e8-d38e634ef73e","resolution":{"observed_at":"2026-08-10T15:59:21.783048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.764458Z","title":"V ocos: Closing the gap between time-domain and Fourier- based neural vocoders for high-quality audio synthesis,","venue":null,"work_id":"7a50322a-2605-4c17-bf02-0d9323e6c3f6","year":null},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.067920Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:678997a1f98e59976446948bdec8df6d0f3d0e368ba595080b651bd76bdd3910","observation_id":"50b1ac9b-8551-451f-a989-21a903c92490","resolution":{"observed_at":"2026-08-10T15:59:21.770094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.750122Z","title":"APNet2: High-Quality and High-Efficiency Neural Vocoder with Direct Prediction of Amplitude and Phase Spectra,","venue":null,"work_id":"6a6b740f-3236-4f7c-8f17-0b22386068b1","year":2023},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.072366Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:fff203d93c6174ce450cf79323bfd324680b4cc5d70a590b498ac1f0601baf00","observation_id":"4e31c8fd-e0fc-49c8-a39b-345ce45fcac7","resolution":{"observed_at":"2026-08-10T15:59:21.755334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08196","last_updated":"2024-06-12T13:29:36Z","snapshot_observed_at":"2026-08-12T23:44:35.510059Z","submitted_at":"2024-06-12T13:29:36Z","title":"FreeV: Free Lunch For Vocoders Through Pseudo Inversed Mel Filter","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08196","snapshot_observed_at":"2026-08-10T15:59:21.076701Z","title":"FreeV: Free Lunch For Vocoders Through Pseudo Inversed Mel Filter,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.076701Z"},"links":{"cited_paper":"/paper/2406.08196","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:64c9ba7c1d1f908eb8c4998c8abbcadd23c9a5fe662f8ecad973384d0dd132c4","observation_id":"ab271f4e-3348-44b9-8e85-9f87715b70ad","resolution":{"observed_at":"2026-08-10T15:59:21.076701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.735929Z","title":"Speech dereverberation using non- negative convolutive transfer function and spectro-temporal modeling,","venue":null,"work_id":"c2730863-76bb-4137-be4b-9c1557768fed","year":2015},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.081100Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:f7d3df68cb12dbd3492e3a0a55d8678689def4fb1870e350c6af07adcdb15db6","observation_id":"e6ca9a22-90c2-4f04-a719-f60a5940126a","resolution":{"observed_at":"2026-08-10T15:59:21.740376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.721005Z","title":"The voice bank corpus: Design, collection and data analysis of a large regional accent speech database,","venue":null,"work_id":"df6ca7c6-d534-4ce7-961f-e8de8906fcff","year":2013},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.085495Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:df2d26175865f1e880f603c53647f183d4181e3797c04911d712619de7d3f0a5","observation_id":"2a1e85ea-65f8-48a0-8792-13d8d8490c32","resolution":{"observed_at":"2026-08-10T15:59:21.726069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.707018Z","title":"On training targets for su- pervised speech separation,","venue":null,"work_id":"58acf00b-89b2-49a6-860d-ff41c05a669d","year":2014},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.090147Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:041f15d6c135aad528bbb54d145baa98ca57f53941e7db6240a721bc9d165d91","observation_id":"b7795b0f-5b6e-4681-9a5a-078a3b19950f","resolution":{"observed_at":"2026-08-10T15:59:21.711872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.691973Z","title":"Signal estimation from modified short-time Fourier transform,","venue":null,"work_id":"d55562bd-2d5b-40a5-abd5-361fc8483e26","year":1984},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.095936Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:bdc9ead0a4ae6405d134b5200e31763d518e29352edc6cd001f626d908e5b1fc","observation_id":"da323225-110a-42a1-9b80-e7d015544269","resolution":{"observed_at":"2026-08-10T15:59:21.697078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.676679Z","title":"Libritts: A Corpus Derived from LibriSpeech for Text-to- Speech,","venue":null,"work_id":"a682f3d0-cb6d-41e6-b56b-75110190e15d","year":2019},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.100279Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:bf4393438f0d6ae4368cbf49d63db7675f79252afd1e6579d1a508608348aec6","observation_id":"e0f6f397-d193-4ab3-8d43-17767c17751e","resolution":{"observed_at":"2026-08-10T15:59:21.681383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.660700Z","title":"ICASSP 2023 deep noise suppression challenge,","venue":null,"work_id":"7247e65d-6628-4de9-99eb-3b727b5771ee","year":2023},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.104366Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:7e2a1699688e5532034d021c19e6b1ef8e469b1c1ce26d215c761ddfd8f49721","observation_id":"04cc6a3a-1a3f-40d9-bebc-635a2359253c","resolution":{"observed_at":"2026-08-10T15:59:21.666483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-08-14T22:25:51.884597Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-10T15:59:21.109056Z","title":"MUSAN: A music, speech, and noise corpus,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.109056Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:0dc090ee107bffb44e3d4c5ce48388efdc98a8bb1e5aff8cb8a2f5dc81a12369","observation_id":"28154813-8b3c-4a6b-82f4-006e5936a3ea","resolution":{"observed_at":"2026-08-10T15:59:21.109056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.645042Z","title":"Hd-demucs: General speech restoration with heterogeneous decoders,","venue":null,"work_id":"cd3e4270-4a57-481f-aa9e-7c36d68a56c7","year":2023},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.113850Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:acf315ea35de663853b412c1cdf07c73bf6d01981db6d81d106ff81e262fbd0e","observation_id":"e3a7e9ef-c499-42c1-82e0-d99dcbf247fd","resolution":{"observed_at":"2026-08-10T15:59:21.650977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.631191Z","title":"Conv-TasNet: Surpassing ideal time– frequency magnitude masking for speech separation,","venue":null,"work_id":"1554856f-aea5-41ba-a35a-4f5baadb0e57","year":2019},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.118289Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:7e3b8313be80660a38d29ec28e1e60cfdc79011d5133b9dfc8b8dbc7a9f686e4","observation_id":"dabe3c41-406c-4c34-aa0d-c94eff7bca45","resolution":{"observed_at":"2026-08-10T15:59:21.635834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.617272Z","title":"Learning complex spectral mapping with gated convolutional recurrent networks for monaural speech enhancement,","venue":null,"work_id":"26a8b41b-a2c5-42c8-8cb5-29df7f301685","year":2019},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.122596Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:8e6503b2762612a8a3f0b7d949a42de3201857b6e31a1060613d258e258f0c2a","observation_id":"5efbd59f-3f4f-411d-8898-3e9f878c89bf","resolution":{"observed_at":"2026-08-10T15:59:21.621936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.126814Z","title":"Music source separation with band-split RNN,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.126814Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:d75a00e918ae81fb8e1e0bcc47c4e7645fc75f4c49f0539d1000b0fd1af87a1c","observation_id":"64722f43-6755-44ae-9a9b-24be607c4ed2","resolution":{"observed_at":"2026-08-10T15:59:21.126814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.594098Z","title":"Bandwidth extension for hierarchical speech and audio coding in itu-t rec. g. 729.1,","venue":null,"work_id":"3e8bc4ed-9a88-4fbb-abd4-6b5cb49ae0a5","year":2007},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.131058Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:557581c2f3cef0bcf1c09c12780a7c13db29fb858dad610987d4a7e1915e5a5d","observation_id":"ae23a299-cecb-4849-8023-e9590dcfeb8b","resolution":{"observed_at":"2026-08-10T15:59:21.599254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.579839Z","title":"A short- time objective intelligibility measure for time-frequency weighted noisy speech,","venue":null,"work_id":"c9771562-0446-4960-a1b3-cbff3e08bab8","year":2010},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.135377Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:82cbef3940b21e0b363783d3d8a5cd1d17a85528fbd84086d8a6fbca34d992ac","observation_id":"38d59a38-f141-4ed9-9366-17486fa1286f","resolution":{"observed_at":"2026-08-10T15:59:21.584723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.564754Z","title":"UTMOS: Utokyo-Sarulab System for V oiceMOS Chal- lenge 2022,","venue":null,"work_id":"bd2af57d-6621-4f97-b3cb-a1e6b10d3c9f","year":2022},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.139600Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:21f8c397f9a54af033d32392fee096bc76b081abc8e908ce929414936b6df958","observation_id":"dda61654-01f6-401f-84ed-1f46ae9204d0","resolution":{"observed_at":"2026-08-10T15:59:21.570063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.550579Z","title":"PHASEN: A phase-and- harmonics-aware speech enhancement network,","venue":null,"work_id":"2f3cb8b2-9e73-483f-a144-3f3f88e6fc4e","year":2020},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.144136Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:9e7d4e0a1d66fa2564869bc263c0de585e8e986fa5c68fc0d71cca26022fbcb5","observation_id":"04ad661b-3be8-4936-815d-4a6e5c5f0baf","resolution":{"observed_at":"2026-08-10T15:59:21.555189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.536413Z","title":"TF-GridNet: Making time-frequency domain models great again for monaural speaker separation,","venue":null,"work_id":"cccb9a5b-9769-4c27-9630-a3e2b8e3702a","year":2023},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.148505Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:baf11defebd300a6832a0069b276a5dee87667db836c1dd8717ccb5fc5bc4c7a","observation_id":"223100d5-9e10-4b34-acf4-ab9f49af78f0","resolution":{"observed_at":"2026-08-10T15:59:21.541346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.521303Z","title":"Taylor, can you hear me now? a taylor-unfolding framework for monaural speech enhancement,","venue":null,"work_id":"e202121d-5b00-41a3-be48-95d1b3680542","year":2022},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.152894Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:a67abfc609f5ac1674a267fc96f78579ce6f9302bf95efb433eaabb57efeb848","observation_id":"3886dc37-d724-41ed-a8b7-6c3e035d9902","resolution":{"observed_at":"2026-08-10T15:59:21.526462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.504126Z","title":"Two heads are better than one: A two-stage complex spectral mapping approach for monaural speech enhancement,","venue":null,"work_id":"df50dbe3-56ff-42e3-bbd3-d35864a5b51a","year":2021},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.157064Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:278fef5f604dc5ec794fb18a12b3f21f509d7ce7081dcd325d487b93b4e9ab97","observation_id":"a1a5da00-86ab-4e3b-8249-c9cd0daae650","resolution":{"observed_at":"2026-08-10T15:59:21.509917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.488378Z","title":"Sixty years of frequency-domain monaural speech enhance- ment: From traditional to deep learning methods,","venue":null,"work_id":"a8ab7aee-268c-4e87-9506-372aa693bbed","year":2023},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.161070Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:47bb54adfa948a85d0abb0dcb0edcf9ebb64f3bc12d7b74478eb09faf64bd5e4","observation_id":"7b5b4f4d-28c2-4bb9-83f5-517d5e76446e","resolution":{"observed_at":"2026-08-10T15:59:21.493373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.471523Z","title":"DNSMOS P. 835: A non- intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"e373145d-9a3d-4592-9c1b-0f172c0cd347","year":2022},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.165356Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:bb9db0951f994232ac604c2dc02f8e53b3a90bb6285b37ab546046d0331b8400","observation_id":"03b58b7f-5e4d-4285-8e85-e209b3bc2802","resolution":{"observed_at":"2026-08-10T15:59:21.477456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.455959Z","title":"ViSQOL v3: An open source production ready objective speech and audio metric,","venue":null,"work_id":"2fc0380a-932d-42f6-9c8b-6f3b2b15e9e3","year":2020},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.169757Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:f7f44a1716a7ac8e173cf01745fd80408a37f40f18ce3c710ba60c43496966b5","observation_id":"6507eafe-f2bd-418e-8376-9bfd2375fbee","resolution":{"observed_at":"2026-08-10T15:59:21.460993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02813","last_updated":"2021-11-04T12:26:34Z","snapshot_observed_at":"2026-08-13T19:19:02.902998Z","submitted_at":"2021-11-04T12:26:34Z","title":"WaveFake: A Data Set to Facilitate Audio Deepfake Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02813","snapshot_observed_at":"2026-08-10T15:59:21.174133Z","title":"Wavefake: A data set to facilitate audio deepfake detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.174133Z"},"links":{"cited_paper":"/paper/2111.02813","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:aba032a157b016cb1cf6566995ca7c1177aa71dea371537eb9cb5804a9015088","observation_id":"f6c9f0b6-5b8a-4c42-add6-756df69dee41","resolution":{"observed_at":"2026-08-10T15:59:21.174133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05441","last_updated":"2019-04-14T11:38:32Z","snapshot_observed_at":"2026-08-15T22:10:10.299222Z","submitted_at":"2019-04-09T15:12:52Z","title":"ASVspoof 2019: Future Horizons in Spoofed and Fake Audio Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05441","snapshot_observed_at":"2026-08-10T15:59:21.178977Z","title":"ASVspoof 2019: Future horizons in spoofed and fake audio detection,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.178977Z"},"links":{"cited_paper":"/paper/1904.05441","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:ca692b1a167616438421617af2b1ded0eac95821384d910e803b5158cc61ccd5","observation_id":"94edbe0a-9ce7-4ed5-9e8d-949e3b47bc87","resolution":{"observed_at":"2026-08-10T15:59:21.178977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:59:21.439693Z","title":"Singfake: Singing voice deepfake detection,","venue":null,"work_id":"e1b640eb-8ef4-478e-85aa-1230cdef753c","year":2024},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.183546Z"},"links":{"citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:7fa3bcca94f6bca7bc9e66ac65eb9f658990baa50b203357371fe4f0354f52e3","observation_id":"3636e44f-b18c-4f6f-a8b3-dcedea3161c7","resolution":{"observed_at":"2026-08-10T15:59:21.446096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02438","last_updated":"2024-06-18T04:21:52Z","snapshot_observed_at":"2026-08-13T03:20:17.778174Z","submitted_at":"2024-06-04T16:00:18Z","title":"CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02438","snapshot_observed_at":"2026-08-10T15:59:21.187694Z","title":"CtrSVDD: A Benchmark Dataset and Baseline Analysis for Controlled Singing Voice Deepfake Detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.187694Z"},"links":{"cited_paper":"/paper/2406.02438","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:e00d724991d0e6d867e5ed315fb6e9514d5c371b9ee387ce4ca23e141557d2e0","observation_id":"85fe2d22-0e3d-4e95-990a-34ee7b0a1f38","resolution":{"observed_at":"2026-08-10T15:59:21.187694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-15T10:50:29.685462Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2501.13465."}