Pith. sign in

Paper Citation Record · LEDGER

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

As of 14 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 4 inbound Pith citation observations for arXiv:2502.02942.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.02942 v1

Coverage vector

measured 48 of 48 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T10:37:03.781195Z

measured 52 of 52 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T14:20:49.180965Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-19T13:12:18.207183Z

Reference resolution

48 of 48 outbound references displayed

  • verified exact4
  • verified fuzzy20
  • unresolved24
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 06c49604-3c9a-4dd1-8f00-73114a9b30ea · outbound

This paper cites APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.556157Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.556157Z digest=sha256:e17e93579a6d2330e32da5031f9bfee003d696c96e8d16dc29778d8f5a6afa41

Observation 5f9c9a7a-a4bb-4285-bb43-bec73dc56985 · outbound

This paper cites an unresolved cited work.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-09T10:37:04.289191Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.771761Z digest=sha256:6c41bd1e92a4d06f40461ab68d03008473def004f0435987ea24a66e2bbee9dc

Observation 31249799-37a2-4892-b4d0-c234593b4b53 · outbound

This paper cites Unsupervised Cross-lingual Representation Learning for Speech Recognition.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Unsupervised Cross-lingual Representation Learning for Speech Recognition

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.570902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.570902Z digest=sha256:af6cf7713403b8d7078063a26bb1a58413691966b206aeb10b00219348c242b3

Observation fbe90fbe-7b1b-4277-9412-1d6f0bcfd610 · outbound

This paper cites High Fidelity Neural Audio Compression.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling High Fidelity Neural Audio Compression

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.575758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.575758Z digest=sha256:987d58033965aad0f747352f03b3812130dadf71e1c7f8e57991514e54469f7e

Observation 92ae16bd-9663-40d1-8f3b-627c34399576 · outbound

This paper cites PolyVoice: Language Models for Speech to Speech Translation.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling PolyVoice: Language Models for Speech to Speech Translation

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.580194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.580194Z digest=sha256:09042275edd9b14f8f2892ca8385f3aa1db3d4feb2f30c6c5d342b0e4edc1228

Observation e841061e-bef3-4a40-b3aa-58a2eca8e5f3 · outbound

This paper cites an unresolved cited work.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-09T10:37:04.257698Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.781195Z digest=sha256:ba4e089de92feab925107d258fc8d49dc9be38951c8a6c5c9a2dbf8ba7da75b6

Observation 48a5a75d-e41e-476f-9180-c9c63600d22c · outbound

This paper cites Variational autoencoder for speech enhancement with a noise-aware encoder.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Variational autoencoder for speech enhancement with a noise-aware encoder

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.547934Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.590284Z digest=sha256:80e371ca76f396285766cf54494fadaca923ccfab691f67b140fbb18d30655c1

Observation 12139086-bc1d-4c2b-a568-7ebed5a690f8 · outbound

This paper cites Fullsubnet: A full-band and sub-band fusion model for real-time single-channel speech enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Fullsubnet: A full-band and sub-band fusion model for real-time single-channel speech enhancement

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.517963Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.605648Z digest=sha256:f928ae9fa89f6d61cb5b0f138ed234c19149a80032d5be02dd2f0e0084480e01

Observation f2468bc9-e5a0-4d90-89f6-93ce67188133 · outbound

This paper cites Hubert: Self-supervised speech representation learning by masked prediction of hidden units.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Hubert: Self-supervised speech representation learning by masked prediction of hidden units

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.502747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.610815Z digest=sha256:04177a72c5e550d0fc9cf773119a49b2bf363451a4a40e44fffc2ca40adb2ec2

Observation 9e98d6b6-d2a6-4112-9438-43f1561609be · outbound

This paper cites ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-08-09T10:37:04.145349Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.615473Z digest=sha256:631490af95bd7c9eabe10f36e4040907db9d77ef303b8c1273fc6900f6c6875e

Observation d5073d6b-362b-4ea3-9cd6-5d5a8f4957a7 · outbound

This paper cites Language-Codec: Bridging Discrete Codec Representations and Speech Language Models.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Language-Codec: Bridging Discrete Codec Representations and Speech Language Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.620875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.620875Z digest=sha256:1884e975d718f9620dc3c9ab690e7bbb04039e09f3db33bfce20b1ea8b560593

Observation 69673469-7183-4116-9255-789da0f976fc · outbound

This paper cites Libri- light: A benchmark for asr with limited or no supervision.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Libri- light: A benchmark for asr with limited or no supervision

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.488624Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.630522Z digest=sha256:6cb4d6ba5ae1cd45ee7ce7415eaad2b27674a6f362f217e644fc38d017ee55ce

Observation 22716251-6203-4a62-82f4-731b6ca1ba61 · outbound

This paper cites A study on data augmentation of reverberant speech for robust speech recognition.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling A study on data augmentation of reverberant speech for robust speech recognition

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.473837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.634723Z digest=sha256:49ad72ba49a33f8bdb4ee3c9f0d3702c5442d719b6ffe7a74ec2375d28f6c692

Observation 949cdf6a-c968-43eb-a060-482e25189ce8 · outbound

This paper cites Lan- guage models as controlled natural language semantic parsers for knowledge graph question an- swering.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Lan- guage models as controlled natural language semantic parsers for knowledge graph question an- swering

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.459166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.643592Z digest=sha256:309383716213f3b79965b8d446826a46a59636f50998a8ff52eb2ec6f14af84b

Observation 12f57c02-ea07-424d-9f4b-e8d8571dd0f1 · outbound

This paper cites Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.648039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.648039Z digest=sha256:e6e779bc11a77b668122f8ecd3b64a300cfdd0b642e48d043c0ab278d3c454b3

Observation 873e4451-21d3-4a4d-a091-16da579da7c4 · outbound

This paper cites Noise Tokens: Learning Neural Noise Templates for Environment-Aware Speech Enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Noise Tokens: Learning Neural Noise Templates for Environment-Aware Speech Enhancement

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-08-09T10:37:04.059313Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.652516Z digest=sha256:ce1a2eeb1ece15509c2ea3a0c4445ddcfbbac582305447797acb2943cab94f80

Observation 76e3ce1d-53e6-45d8-9dea-2b7133e179f0 · outbound

This paper cites VoiceFixer: Toward General Speech Restoration with Neural Vocoder.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling VoiceFixer: Toward General Speech Restoration with Neural Vocoder

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.661876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.661876Z digest=sha256:7dc9ceb609f75f0c5409b54420a2a155dc2a29877b927110135026d4fb12227c

Observation b44fc7fe-1069-487b-b416-2d2cd9e14006 · outbound

This paper cites SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.666522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.666522Z digest=sha256:603ad071b70599abfa31bc2ffb1dc1a62ccc31486c5a387e4cd7579e5df3199a

Observation 21fbec8c-b87a-481f-b3a2-7836e1134c6f · outbound

This paper cites Speaker independence of neural vocoders and their effect on parametric resynthesis speech enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Speaker independence of neural vocoders and their effect on parametric resynthesis speech enhancement

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.444577Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.671130Z digest=sha256:24e86586dd768eb8fdfb7309150614b8e46a8dbc6c9158bb660327292bfd17ae

Observation 17a3139c-8abc-47f6-aac1-38c28d6113b0 · outbound

This paper cites Finite Scalar Quantization: VQ-VAE Made Simple.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Finite Scalar Quantization: VQ-VAE Made Simple

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.675402Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.675402Z digest=sha256:0831f46653428a993baeb3218e6944c121ff7e265e0d202d80cbf382130550b0

Observation 6acf754b-dbc7-405d-9b67-22473d9c8e3c · outbound

This paper cites Dnsmos p.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Dnsmos p

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.429747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.684725Z digest=sha256:4e16c6dbf46a8caed04fb94ca59b5427262a1907d2e97b8191cb4558a7956a7c

Observation 55d42621-87a4-4fd1-9fda-f5cc23ccb46d · outbound

This paper cites Fewer-token neural speech codec with time-invariant codes.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Fewer-token neural speech codec with time-invariant codes

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.414676Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.688823Z digest=sha256:78bfaa0056065f0978ffecd3f941f70557fbf76e9da3099c19e6f1883066c651

Observation fe002d0a-cc8c-41e1-a026-f26f74bb9db9 · outbound

This paper cites UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.693127Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.693127Z digest=sha256:056b6af09d7f00a290c524417300fb1077fd5f3d86c0ad8db13cb0416bf0b698

Observation c76a641e-ac99-424b-84f4-67a3546f93d4 · outbound

This paper cites Universal Score-based Speech Enhancement with High Content Preservation.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Universal Score-based Speech Enhancement with High Content Preservation

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.697677Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.697677Z digest=sha256:d549a2457d99f5c9ff7ad69da725c1c1704066ebe05078d8f313156dc53bf506

Observation acc77a20-f55a-4746-86b1-74de8fce3ff3 · outbound

This paper cites Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.701969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.701969Z digest=sha256:b0f5075d4972c95a3cb54fa13f70d54adf9795886951ebc3ff9acd0ed6108aa8

Observation b30ab931-29a9-4a06-b78d-1c13f78ceb4b · outbound

This paper cites The voice bank corpus: Design, collection and data analysis of a large regional accent speech database.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling The voice bank corpus: Design, collection and data analysis of a large regional accent speech database

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.399196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.706795Z digest=sha256:e888c4c982bb278c2509d57f2b67f556257d6427328852eaa751337b5b89dd3f

Observation 464655a4-19bf-40e4-abcb-5fcbbed33fcb · outbound

This paper cites WHAM!: Extending Speech Separation to Noisy Environments.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling WHAM!: Extending Speech Separation to Noisy Environments

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.716408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.716408Z digest=sha256:cd985fac9ec37dccd4f4936ee486578d75d0d190f86221dda39264d83adbfb8a

Observation afa3289d-9183-4eda-a8c8-8ba17ff32094 · outbound

This paper cites Audiodec: An open-source streaming high-fidelity neural audio codec.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Audiodec: An open-source streaming high-fidelity neural audio codec

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.383185Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.722180Z digest=sha256:febe3c83d8a8426aa8dd8f08a74b521c1d0eb4544eb46f4ce6afa84e00a13adb

Observation 1322981d-a653-44ed-a58f-ded95262096f · outbound

This paper cites HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.726917Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.726917Z digest=sha256:35f07103520ba4670feb5be7c8aba6519d6757e49fcf647bfb73c28e58e56ed6

Observation d9203ab6-3161-42cd-8002-275405161514 · outbound

This paper cites LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.731933Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.731933Z digest=sha256:fcd9616a6d9f2fcb121a9ddede1b914e881d44a1d7e01b4511385db5c9d81185

Observation d0c6c1ff-b73b-4952-93c3-ec6c44925d76 · outbound

This paper cites Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model

Reference 39

Resolution
verified exact
local_arxiv, observed 2026-08-09T10:37:03.844720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.736696Z digest=sha256:801372e0e3a63f85aaab6eef3b497c630de6449b891923bdee135326096831fa

Observation 5cc50158-7a0e-45a4-ac35-9bf2cd84f3ad · outbound

This paper cites SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.741448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.741448Z digest=sha256:4e83baf0934c7a52c0f8e7e3e6012fa55a21a20a25e50fd7de7673214f5d2038

Observation 7ef73369-47ff-47a4-8da5-f840c90aaa53 · outbound

This paper cites We discuss several common questions for the design of GenSE.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling We discuss several common questions for the design of GenSE

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.368095Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.746318Z digest=sha256:66850420916b042795322be55ae5cbc7f3c1dcb024a0a0eb0a9da6312ee288ac

Observation abf7d858-0d37-46c7-ad03-e6066347135e · outbound

This paper cites On the other hand, we chose XLSR as the semantic extractor due to the key advantage of its multilin- gual speech representation capabilities.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling On the other hand, we chose XLSR as the semantic extractor due to the key advantage of its multilin- gual speech representation capabilities

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.353500Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.751285Z digest=sha256:ca4155dc02037a6ac4bcfb92f7324463a3ae445d50649d09e63888da8460a0e8

Observation c74d7a16-07f5-49f5-bded-6d167a258413 · outbound

This paper cites To address this limitation, we also conducted an ABX test to assess the perceptual quality of the enhanced speech compared to clean speech, as shown in Figure.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling To address this limitation, we also conducted an ABX test to assess the perceptual quality of the enhanced speech compared to clean speech, as shown in Figure

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.337453Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.756648Z digest=sha256:4141a0d5908509c0389c917125e3d0f69c7c8da51fef15521347e2887da99c8b

Observation 3d73fd3b-356c-4181-a7f4-f86cd57c86b2 · outbound

This paper cites No Preference.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling No Preference

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.320599Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.761784Z digest=sha256:0d7d991406d2baab92590a83677d29273510d68d62d8ef100650a9ac296353e2

Observation 36e4c198-c62a-4e1c-a0e0-5a05278cb404 · outbound

This paper cites We also observe that finite scalar quantization (FSQ) (Mentzer et al., 2023a) demonstrates lower reconstruction quality.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling We also observe that finite scalar quantization (FSQ) (Mentzer et al., 2023a) demonstrates lower reconstruction quality

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.273771Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.776701Z digest=sha256:620f08fa7bf100b594ec6dd0f1dea69b54cb907c3ffdf6fcdec033d5e143e743

Observation 12ea5c2a-2b9b-40a2-965f-1b5b29361e4c · outbound

This paper cites We employ the AdamW optimizer with a learning rate of 1e-4 to optimize the codec model.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling We employ the AdamW optimizer with a learning rate of 1e-4 to optimize the codec model

Reference 128

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.305095Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.767028Z digest=sha256:d70780b777aaaf914afb1fc80e48e529a01938129318eb64ba0b9c37121b95bf

Observation e5545a6d-5a73-46d4-8d01-d56cb98ebb8f · outbound

This paper cites Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

Reference 2013

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.711308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.711308Z digest=sha256:cf6bd3b0d09e97de6ee88dfe8383c7e5a15e5fd253ba572eac2f43716c8877bb

Observation a752c229-8f33-415f-8e9c-fcfa022b4eb1 · outbound

This paper cites Interspeech 2021 Deep Noise Suppression Challenge.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Interspeech 2021 Deep Noise Suppression Challenge

Reference 2015

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.680242Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.680242Z digest=sha256:cf466d4bb6cb07feae624b6dc5013e393b4f5a9deb3b099f5d56e9e61816ddec

Observation df688006-3bb2-455e-8e55-212d5ed86908 · outbound

This paper cites Funcodec: A fundamental, reproducible and integrable open-source toolkit for neural speech codec.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Funcodec: A fundamental, reproducible and integrable open-source toolkit for neural speech codec

Reference 2016

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.562354Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.585622Z digest=sha256:622eb9ebc325cb6d453e644dad94976e86a03133d6d4dabfc4432222186e6516

Observation dc161ac4-b595-45a0-b79e-f979fe65ab21 · outbound

This paper cites NU-GAN: High resolution neural upsampling with GAN.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling NU-GAN: High resolution neural upsampling with GAN

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.638921Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.638921Z digest=sha256:26634a2c8df7c4b0c5f9a0f271b670633a010edd9e2a150d617dac1d8fe658f3

Observation 6c4c018e-0e23-4898-976b-24d6cfb1cec1 · outbound

This paper cites Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech

Reference 2019

Resolution
verified exact
local_arxiv, observed 2026-08-09T10:37:04.166692Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.599883Z digest=sha256:0d815f306f6b739a5df08e4cfde589097af8dc81cdbcabf5f671ce36f2e100e4

Observation 9c711ee6-7141-46e4-a003-909bbdfd5f41 · outbound

This paper cites Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.657296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.657296Z digest=sha256:2500a35d8d40f4ca27e9903a5eed62b59317ea606a26e47f17fb08916dbb3088

Observation 32685557-cfe0-42df-8a48-0100d4aa5dea · outbound

This paper cites Metricgan: Generative adversarial net- works based black-box metric scores optimization for speech enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Metricgan: Generative adversarial net- works based black-box metric scores optimization for speech enhancement

Reference 2021

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.532634Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.595122Z digest=sha256:9dfb64985be0e513769e70a2cf746f77f63302a8564618b334881b8eeb53cf14

Observation 48941f34-dddc-46bc-9f8d-d1e66e99fbc8 · outbound

This paper cites SoundStorm: Efficient Parallel Audio Generation.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling SoundStorm: Efficient Parallel Audio Generation

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.566091Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.566091Z digest=sha256:b175bcf6069c4ef83a435d89cd7cd38e8f5661e3ef55a13a8195c4008250a867

Observation 72b5b59b-50fd-4783-9f12-2e1ab27da007 · outbound

This paper cites NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.625975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.625975Z digest=sha256:43981d85f44785560991cf072ba1c782fb28e4b28a246230488f9c3f6d6df696

Observation 31880e8c-2126-42e5-8443-ce43a3992637 · outbound

This paper cites Unsupervised speech en- hancement using dynamical variational autoencoders.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:2993–3007,.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Unsupervised speech en- hancement using dynamical variational autoencoders.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:2993–3007,

Reference 2024

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.577005Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-09T10:37:03.561414Z digest=sha256:3528af442c200385affc82d9287b3b7c546b41157b5687f5de0c527381bd8655

Pith citing papers

Observation 0934fbbf-1b5d-4e48-a3c9-4affd5419835 · inbound

SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization cites this paper.

SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-19T13:12:18.210108Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-19T13:10:14.839742Z digest=sha256:731e367d9e308d93c962c416da750362db1ae575e2aa035fd5718e5aea35f21d

Observation 9fd7e768-dd26-4c45-b1b6-e75b77c43489 · inbound

GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model cites this paper.

GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-03T14:20:49.180965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:20:49.180965Z digest=sha256:eb72c8af78fb35b2f6da804b761159109685bc13c76859a8917b29d5ae5efca9

Observation 32b38a54-4b1a-46c1-afd9-a606c2a2009d · inbound

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations cites this paper.

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-05-10T10:19:19.986900Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-10T10:18:16.972414Z digest=sha256:906d8b03c235460618f5cf56c588bb2342f7a2c3aef61399e8025ebe17990d31

Observation 0edcb4b6-3f4a-40e9-b27e-001503530b53 · inbound

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations cites this paper.

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-02T16:16:37.017642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T16:16:37.017642Z digest=sha256:8372b6e990bb4f4bb63b0b4bb296c05b6958ec5db9090a723d33d5b5dfd1840b