Pith. sign in

Paper Citation Record · LEDGER

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

As of 16 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 5 inbound Pith citation observations for arXiv:2502.02942.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.02942 v1

Coverage vector

measured 48 of 48 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T10:37:03.781195Z

measured 53 of 53 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T18:04:57.555362Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-19T13:12:18.207183Z

Reference resolution

48 of 48 outbound references displayed

  • verified exact4
  • verified fuzzy20
  • unresolved24
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 06c49604-3c9a-4dd1-8f00-73114a9b30ea · outbound

This paper cites APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.556157Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.556157Z digest=sha256:e17e93579a6d2330e32da5031f9bfee003d696c96e8d16dc29778d8f5a6afa41

Observation 5f9c9a7a-a4bb-4285-bb43-bec73dc56985 · outbound

This paper cites an unresolved cited work.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Unresolved cited work

Reference 2

Resolution
unresolved
raw_fallback, observed 2026-08-09T10:37:04.289191Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.771761Z digest=sha256:d83e31c8fc4aed29fae407dc4d5861906e1836ebf070bea8be91fdfba5dcff70

Observation 31249799-37a2-4892-b4d0-c234593b4b53 · outbound

This paper cites Unsupervised Cross-lingual Representation Learning for Speech Recognition.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Unsupervised Cross-lingual Representation Learning for Speech Recognition

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.570902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.570902Z digest=sha256:af6cf7713403b8d7078063a26bb1a58413691966b206aeb10b00219348c242b3

Observation fbe90fbe-7b1b-4277-9412-1d6f0bcfd610 · outbound

This paper cites High Fidelity Neural Audio Compression.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling High Fidelity Neural Audio Compression

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.575758Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.575758Z digest=sha256:475f82df4c995c632a29ca51e656eb3b31c95c2e17513ecfcb1be024566863d4

Observation 92ae16bd-9663-40d1-8f3b-627c34399576 · outbound

This paper cites PolyVoice: Language Models for Speech to Speech Translation.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling PolyVoice: Language Models for Speech to Speech Translation

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.580194Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.580194Z digest=sha256:09042275edd9b14f8f2892ca8385f3aa1db3d4feb2f30c6c5d342b0e4edc1228

Observation e841061e-bef3-4a40-b3aa-58a2eca8e5f3 · outbound

This paper cites an unresolved cited work.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-09T10:37:04.257698Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.781195Z digest=sha256:490c96b6e54d6d633d508d22a74326d037379265e0e6ea81982c0188ba04398d

Observation 48a5a75d-e41e-476f-9180-c9c63600d22c · outbound

This paper cites Variational autoencoder for speech enhancement with a noise-aware encoder.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Variational autoencoder for speech enhancement with a noise-aware encoder

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.547934Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.590284Z digest=sha256:5db326d570d65924eee83a38e51897de4414f16d513cbbb287bc3c2516c79e40

Observation 12139086-bc1d-4c2b-a568-7ebed5a690f8 · outbound

This paper cites Fullsubnet: A full-band and sub-band fusion model for real-time single-channel speech enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Fullsubnet: A full-band and sub-band fusion model for real-time single-channel speech enhancement

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.517963Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.605648Z digest=sha256:3a20084d2012656c3347eeb1bc13e0a0f869172435d0fc94be060fbf3a9c7277

Observation f2468bc9-e5a0-4d90-89f6-93ce67188133 · outbound

This paper cites Hubert: Self-supervised speech representation learning by masked prediction of hidden units.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Hubert: Self-supervised speech representation learning by masked prediction of hidden units

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.502747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.610815Z digest=sha256:5ae20ec3ee036b7cd6f1a1e911418237f7bd5dab9c50fdd403dda8b6cb51212a

Observation 9e98d6b6-d2a6-4112-9438-43f1561609be · outbound

This paper cites ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling ReVISE: Self-Supervised Speech Resynthesis with Visual Input for Universal and Generalized Speech Enhancement

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-08-09T10:37:04.145349Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.615473Z digest=sha256:1a51ce04908a5547a0855fd45f9f932a7778417c7019daf67b56b3a5300a7d4e

Observation d5073d6b-362b-4ea3-9cd6-5d5a8f4957a7 · outbound

This paper cites Language-Codec: Bridging Discrete Codec Representations and Speech Language Models.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Language-Codec: Bridging Discrete Codec Representations and Speech Language Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.620875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.620875Z digest=sha256:1884e975d718f9620dc3c9ab690e7bbb04039e09f3db33bfce20b1ea8b560593

Observation 69673469-7183-4116-9255-789da0f976fc · outbound

This paper cites Libri- light: A benchmark for asr with limited or no supervision.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Libri- light: A benchmark for asr with limited or no supervision

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.488624Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.630522Z digest=sha256:10590951b6e471f7c0fc671a16ed92eabf2400be18b429264edb14e677cb96d6

Observation 22716251-6203-4a62-82f4-731b6ca1ba61 · outbound

This paper cites A study on data augmentation of reverberant speech for robust speech recognition.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling A study on data augmentation of reverberant speech for robust speech recognition

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.473837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.634723Z digest=sha256:042aca4f394fd98cddeee7031c307dd8935add92452d1212c177a3e581883f0c

Observation 949cdf6a-c968-43eb-a060-482e25189ce8 · outbound

This paper cites Lan- guage models as controlled natural language semantic parsers for knowledge graph question an- swering.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Lan- guage models as controlled natural language semantic parsers for knowledge graph question an- swering

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.459166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.643592Z digest=sha256:587e3f06f395603e6ec7af68dd7fa7db4ab2b6c577faa6cdf5c8bc5b91032012

Observation 12f57c02-ea07-424d-9f4b-e8d8571dd0f1 · outbound

This paper cites Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Single-Codec: Single-Codebook Speech Codec towards High-Performance Speech Generation

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.648039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.648039Z digest=sha256:e6e779bc11a77b668122f8ecd3b64a300cfdd0b642e48d043c0ab278d3c454b3

Observation 873e4451-21d3-4a4d-a091-16da579da7c4 · outbound

This paper cites Noise Tokens: Learning Neural Noise Templates for Environment-Aware Speech Enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Noise Tokens: Learning Neural Noise Templates for Environment-Aware Speech Enhancement

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-08-09T10:37:04.059313Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.652516Z digest=sha256:bf0c3963876b8ff9cb6d607749c7af33e325c86d83190065afa515c9ac149d39

Observation 76e3ce1d-53e6-45d8-9dea-2b7133e179f0 · outbound

This paper cites VoiceFixer: Toward General Speech Restoration with Neural Vocoder.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling VoiceFixer: Toward General Speech Restoration with Neural Vocoder

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.661876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.661876Z digest=sha256:7dc9ceb609f75f0c5409b54420a2a155dc2a29877b927110135026d4fb12227c

Observation b44fc7fe-1069-487b-b416-2d2cd9e14006 · outbound

This paper cites SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.666522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.666522Z digest=sha256:603ad071b70599abfa31bc2ffb1dc1a62ccc31486c5a387e4cd7579e5df3199a

Observation 21fbec8c-b87a-481f-b3a2-7836e1134c6f · outbound

This paper cites Speaker independence of neural vocoders and their effect on parametric resynthesis speech enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Speaker independence of neural vocoders and their effect on parametric resynthesis speech enhancement

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.444577Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.671130Z digest=sha256:ec38f0992a60fce762b34622c56a3e483b0605bf7b484d40620efee060c5d3c2

Observation 17a3139c-8abc-47f6-aac1-38c28d6113b0 · outbound

This paper cites Finite Scalar Quantization: VQ-VAE Made Simple.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Finite Scalar Quantization: VQ-VAE Made Simple

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.675402Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.675402Z digest=sha256:0831f46653428a993baeb3218e6944c121ff7e265e0d202d80cbf382130550b0

Observation 6acf754b-dbc7-405d-9b67-22473d9c8e3c · outbound

This paper cites Dnsmos p.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Dnsmos p

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.429747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.684725Z digest=sha256:71caed654d2f30284f6e46f4ce922442978a7f9a6e07c577adf23a5d602e0829

Observation 55d42621-87a4-4fd1-9fda-f5cc23ccb46d · outbound

This paper cites Fewer-token neural speech codec with time-invariant codes.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Fewer-token neural speech codec with time-invariant codes

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.414676Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.688823Z digest=sha256:04763a28e39d1c3b06981b5a5c81ce056af2eb095baff2a5fccb871fcf3956f1

Observation fe002d0a-cc8c-41e1-a026-f26f74bb9db9 · outbound

This paper cites UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.693127Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.693127Z digest=sha256:056b6af09d7f00a290c524417300fb1077fd5f3d86c0ad8db13cb0416bf0b698

Observation c76a641e-ac99-424b-84f4-67a3546f93d4 · outbound

This paper cites Universal Score-based Speech Enhancement with High Content Preservation.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Universal Score-based Speech Enhancement with High Content Preservation

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.697677Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.697677Z digest=sha256:d549a2457d99f5c9ff7ad69da725c1c1704066ebe05078d8f313156dc53bf506

Observation acc77a20-f55a-4746-86b1-74de8fce3ff3 · outbound

This paper cites Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.701969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.701969Z digest=sha256:b0f5075d4972c95a3cb54fa13f70d54adf9795886951ebc3ff9acd0ed6108aa8

Observation b30ab931-29a9-4a06-b78d-1c13f78ceb4b · outbound

This paper cites The voice bank corpus: Design, collection and data analysis of a large regional accent speech database.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling The voice bank corpus: Design, collection and data analysis of a large regional accent speech database

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.399196Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.706795Z digest=sha256:f84a376c68b9768ce6fe5ba78bee8a404c809cdd58f5e31a968de01a1f5a285d

Observation 464655a4-19bf-40e4-abcb-5fcbbed33fcb · outbound

This paper cites WHAM!: Extending Speech Separation to Noisy Environments.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling WHAM!: Extending Speech Separation to Noisy Environments

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.716408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.716408Z digest=sha256:cd985fac9ec37dccd4f4936ee486578d75d0d190f86221dda39264d83adbfb8a

Observation afa3289d-9183-4eda-a8c8-8ba17ff32094 · outbound

This paper cites Audiodec: An open-source streaming high-fidelity neural audio codec.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Audiodec: An open-source streaming high-fidelity neural audio codec

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.383185Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.722180Z digest=sha256:8740e0c9790eacbc496f634008b1d18582a13f1cb4a86894cd61105ca79150bd

Observation 1322981d-a653-44ed-a58f-ded95262096f · outbound

This paper cites HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.726917Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.726917Z digest=sha256:35f07103520ba4670feb5be7c8aba6519d6757e49fcf647bfb73c28e58e56ed6

Observation d9203ab6-3161-42cd-8002-275405161514 · outbound

This paper cites LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.731933Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.731933Z digest=sha256:66204b3bf8e53052828bd0b24926be23d546c972a824e7de71310de285b61503

Observation d0c6c1ff-b73b-4952-93c3-ec6c44925d76 · outbound

This paper cites Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Speaking in Wavelet Domain: A Simple and Efficient Approach to Speed up Speech Diffusion Model

Reference 39

Resolution
verified exact
local_arxiv, observed 2026-08-09T10:37:03.844720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.736696Z digest=sha256:6e2853b5e432c90eac1650e6815297f44aef2d47497f142b70096cd20a128932

Observation 5cc50158-7a0e-45a4-ac35-9bf2cd84f3ad · outbound

This paper cites SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.741448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.741448Z digest=sha256:16dbbf812fc2043e05d03ddeecbfa8cb0436b706cd2fc0f6b438571c87b157e0

Observation 7ef73369-47ff-47a4-8da5-f840c90aaa53 · outbound

This paper cites We discuss several common questions for the design of GenSE.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling We discuss several common questions for the design of GenSE

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.368095Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.746318Z digest=sha256:cea3797fa5e6be2c68a51952c94db8744ed134178490c60fd42adaae28d1360c

Observation abf7d858-0d37-46c7-ad03-e6066347135e · outbound

This paper cites On the other hand, we chose XLSR as the semantic extractor due to the key advantage of its multilin- gual speech representation capabilities.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling On the other hand, we chose XLSR as the semantic extractor due to the key advantage of its multilin- gual speech representation capabilities

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.353500Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.751285Z digest=sha256:36fc6489a614b7eeb7404c36a769477404815f448051db51a7e4fbc66a72086f

Observation c74d7a16-07f5-49f5-bded-6d167a258413 · outbound

This paper cites To address this limitation, we also conducted an ABX test to assess the perceptual quality of the enhanced speech compared to clean speech, as shown in Figure.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling To address this limitation, we also conducted an ABX test to assess the perceptual quality of the enhanced speech compared to clean speech, as shown in Figure

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.337453Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.756648Z digest=sha256:f71364d29899e9ef82465b0ee581de0067ade6fc864d346dfa12025d57305edf

Observation 3d73fd3b-356c-4181-a7f4-f86cd57c86b2 · outbound

This paper cites No Preference.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling No Preference

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.320599Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.761784Z digest=sha256:440c8e5969ab88ec527d1d81b0f7b20dc70e5b663745a6a8d3616edf43987023

Observation 36e4c198-c62a-4e1c-a0e0-5a05278cb404 · outbound

This paper cites We also observe that finite scalar quantization (FSQ) (Mentzer et al., 2023a) demonstrates lower reconstruction quality.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling We also observe that finite scalar quantization (FSQ) (Mentzer et al., 2023a) demonstrates lower reconstruction quality

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.273771Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.776701Z digest=sha256:6bd448eb6619a7fb1058cd59f1d6b6324f4e006e43fdbaaa0c4d02c4693b6c1a

Observation 12ea5c2a-2b9b-40a2-965f-1b5b29361e4c · outbound

This paper cites We employ the AdamW optimizer with a learning rate of 1e-4 to optimize the codec model.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling We employ the AdamW optimizer with a learning rate of 1e-4 to optimize the codec model

Reference 128

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.305095Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.767028Z digest=sha256:cf64f8d5ac3903f749aa4b1478cc9f6d5bd2eb0249bc67aa22bc3b3736d5dcfc

Observation e5545a6d-5a73-46d4-8d01-d56cb98ebb8f · outbound

This paper cites Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers

Reference 2013

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.711308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.711308Z digest=sha256:cf6bd3b0d09e97de6ee88dfe8383c7e5a15e5fd253ba572eac2f43716c8877bb

Observation a752c229-8f33-415f-8e9c-fcfa022b4eb1 · outbound

This paper cites Interspeech 2021 Deep Noise Suppression Challenge.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Interspeech 2021 Deep Noise Suppression Challenge

Reference 2015

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.680242Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.680242Z digest=sha256:cf466d4bb6cb07feae624b6dc5013e393b4f5a9deb3b099f5d56e9e61816ddec

Observation df688006-3bb2-455e-8e55-212d5ed86908 · outbound

This paper cites Funcodec: A fundamental, reproducible and integrable open-source toolkit for neural speech codec.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Funcodec: A fundamental, reproducible and integrable open-source toolkit for neural speech codec

Reference 2016

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.562354Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.585622Z digest=sha256:028ce1b52e3d762c750d46f9b39022ec972b1cb2ce09fadea959e2e841aee20e

Observation dc161ac4-b595-45a0-b79e-f979fe65ab21 · outbound

This paper cites NU-GAN: High resolution neural upsampling with GAN.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling NU-GAN: High resolution neural upsampling with GAN

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.638921Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.638921Z digest=sha256:26634a2c8df7c4b0c5f9a0f271b670633a010edd9e2a150d617dac1d8fe658f3

Observation 6c4c018e-0e23-4898-976b-24d6cfb1cec1 · outbound

This paper cites Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Self-Supervised Speech Quality Estimation and Enhancement Using Only Clean Speech

Reference 2019

Resolution
verified exact
local_arxiv, observed 2026-08-09T10:37:04.166692Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.599883Z digest=sha256:0a6682f23d4a95661fbdcf8566d818ffc560a298380cee34358ba87493d1d7f2

Observation 9c711ee6-7141-46e4-a003-909bbdfd5f41 · outbound

This paper cites Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Fish-Speech: Leveraging Large Language Models for Advanced Multilingual Text-to-Speech Synthesis

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.657296Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.657296Z digest=sha256:457060783dbe58b95da578067bbe44c3da613d80e25323b5c3c85d073c5d9af0

Observation 32685557-cfe0-42df-8a48-0100d4aa5dea · outbound

This paper cites Metricgan: Generative adversarial net- works based black-box metric scores optimization for speech enhancement.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Metricgan: Generative adversarial net- works based black-box metric scores optimization for speech enhancement

Reference 2021

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.532634Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.595122Z digest=sha256:8f500fd86d87d5bf4d8777623a9d24e0eece627f13c1f8aca1e29677572dd35a

Observation 48941f34-dddc-46bc-9f8d-d1e66e99fbc8 · outbound

This paper cites SoundStorm: Efficient Parallel Audio Generation.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling SoundStorm: Efficient Parallel Audio Generation

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.566091Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.566091Z digest=sha256:a3f495f99f85f4536dc0e14666a6f55b34c8e094ca834213c9bb12bbd4ff4c87

Observation 72b5b59b-50fd-4783-9f12-2e1ab27da007 · outbound

This paper cites NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-09T10:37:03.625975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T10:37:03.625975Z digest=sha256:43981d85f44785560991cf072ba1c782fb28e4b28a246230488f9c3f6d6df696

Observation 31880e8c-2126-42e5-8443-ce43a3992637 · outbound

This paper cites Unsupervised speech en- hancement using dynamical variational autoencoders.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:2993–3007,.

GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling Unsupervised speech en- hancement using dynamical variational autoencoders.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:2993–3007,

Reference 2024

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T10:37:04.577005Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-09T10:37:03.561414Z digest=sha256:a2460fefc5db086227a36ae61ae46b9873bcc1ab96f1c5acb7c39d9b71488250

Pith citing papers

Observation 0934fbbf-1b5d-4e48-a3c9-4affd5419835 · inbound

SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization cites this paper.

SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-19T13:12:18.210108Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-19T13:10:14.839742Z digest=sha256:ebc73c92d804ebabfa774c6a8b1cea05e02d40fbd09d08122bb7a6933c885ed2

Observation f00852ae-a811-43fc-8049-a209cc68b5ad · inbound

From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models cites this paper.

From Continuous to Discrete: Cross-Domain Collaborative General Speech Enhancement via Hierarchical Language Models GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T18:04:57.555362Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T18:04:57.555362Z digest=sha256:a302eb1754a0b0e81e096f66850df00b990a6b6687ecef129fa7e19a161539d2

Observation 9fd7e768-dd26-4c45-b1b6-e75b77c43489 · inbound

GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model cites this paper.

GenTSE: Enhancing Target Speaker Extraction via a Coarse-to-Fine Generative Language Model GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-03T14:20:49.180965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T14:20:49.180965Z digest=sha256:eb72c8af78fb35b2f6da804b761159109685bc13c76859a8917b29d5ae5efca9

Observation 32b38a54-4b1a-46c1-afd9-a606c2a2009d · inbound

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations cites this paper.

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-05-10T10:19:19.986900Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-10T10:18:16.972414Z digest=sha256:d868ff6dbdbd6628ed866309676f19982d054c8c13722da7e5898adecbfe781e

Observation 0edcb4b6-3f4a-40e9-b27e-001503530b53 · inbound

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations cites this paper.

UniPASE: A Generative Model for Universal Speech Enhancement with High Fidelity and Low Hallucinations GenSE: Generative Speech Enhancement via Language Models using Hierarchical Modeling

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-02T16:16:37.017642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T16:16:37.017642Z digest=sha256:8372b6e990bb4f4bb63b0b4bb296c05b6958ec5db9090a723d33d5b5dfd1840b