arXiv:2410.13599eess.AScs.SD2024-10被引 15

用判别模型的隐特征引导生成对抗网络,提升低信噪比下的语音增强效果

GAN-Based Speech Enhancement for Low SNR Using Latent Feature Conditioning

  • 将判别模型的隐层特征作为条件输入生成对抗网络
  • 在低信噪比下显著优于主流判别方法和端到端训练的GAN模型
  • 适合需要高质量语音增强的通信与语音识别系统

在低信噪比条件下,基于判别式深度神经网络(DNN)的语音增强仍面临挑战。本文提出DisCoGAN,一种在时频域运行的生成对抗网络(GAN),通过预训练于低信噪比语音增强任务的判别模型的隐特征进行条件控制。所提方法性能优于现有主流判别式方法,并超越端到端训练的GAN模型。同时,我们研究了不同条件配置对生成模型的影响,评估其对语音质量提升的效果。

原文摘要 · Abstract (English)

Enhancing speech quality under adverse SNR conditions remains a significant challenge for discriminative deep neural network (DNN)-based approaches. In this work, we propose DisCoGAN, which is a time-frequency-domain generative adversarial network (GAN) conditioned by the latent features of a discriminative model pre-trained for speech enhancement in low SNR scenarios. Our proposed method achieves superior performance compared to state-of-the-arts discriminative methods and also surpasses end-to-end (E2E) trained GAN models. We also investigate the impact of various configurations for conditioning the proposed GAN model with the discriminative model and assess their influence on enhancing speech quality

语音增强GAN低信噪比隐特征

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。