A four-stage pipeline (separate, correct in text, re-synthesize, align) improves speech separation quality and out-of-domain noise robustness.
w2v-bert: Combining contrastive learning and masked language modeling for self-supervised speech pre- training
1 Pith paper cite this work. Polarity classification is still indexing.
1
Pith paper citing it
fields
cs.SD 1years
2025 1verdicts
CONDITIONAL 1representative citing papers
citing papers explorer
-
SepALM: Audio Language Models Are Error Correctors for Robust Speech Separation
A four-stage pipeline (separate, correct in text, re-synthesize, align) improves speech separation quality and out-of-domain noise robustness.