arXiv:2603.18485eess.AS2026-03

通过增强混响目标训练,实现无需参考信号的单声道语音去混响

ARTT: Augmented Reverberant-Target Training for Unsupervised Monaural Speech Dereverberation

  • 先对混响信号进一步加混响,再训练网络恢复原始混响信号
  • 在无干净参考信号条件下,显著降低语音混响程度
  • 适合语音增强、远场语音处理等场景使用

由于缺乏干净参考信号和空间线索,单声道无监督语音去混响是一个困难的病态逆问题。为此,我们提出增强混响目标训练(ARTT),包含两个阶段。第一阶段提出混响目标训练(RTT),先进一步混响观测到的混响混合信号,再通过判别式训练让深度神经网络(DNN)恢复该混响混合信号。尽管目标信号是混响的,但发现所得DNN能有效减少混响。第二阶段引入基于均值教师算法的在线自蒸馏机制,进一步提升去混响效果。评估结果表明,ARTT在无监督去混响任务中表现强劲,显著优于以往基线方法。

原文摘要 · Abstract (English)

Due to the absence of clean reference signals and spatial cues, monaural unsupervised speech dereverberation is a challenging ill-posed inverse problem. To realize it, we propose augmented reverberant-target training (ARTT), which consists of two stages. In the first stage, reverberant-target training (RTT) is proposed to first further reverberate the observed reverberant mixture signal, and then train a deep neural network (DNN) to recover the observed reverberant mixture via discriminative training. Although the target signal to fit is reverberant, we find that the resulting DNN can effectively reduce reverberation. In the second stage, an online self-distillation mechanism based on the mean-teacher algorithm is proposed to further improve dereverberation. Evaluation results demonstrate that ARTT achieves strong unsupervised dereverberation performance, significantly outperforming previous baselines.

语音增强去混响无监督学习

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。