用骨传导信号指导语音增强,显著提升嘈杂环境下的语音质量。
Bone-conduction Guided Multimodal Speech Enhancement with Conditional Diffusion Models
- 通过条件扩散模型融合骨传导与空气传导信号
- 在极端噪声下表现优于现有多模态方法和单模态基线
- 适合智能耳机、助听器等可穿戴设备应用
单通道语音增强模型在极端噪声环境中性能显著下降。尽管已有研究证明骨传导语音可提供互补信息以辅助增强,但如何有效融合这一抗噪模态仍具挑战。本文提出一种新型多模态语音增强框架,利用条件扩散模型将骨传导传感器与空气传导麦克风信号进行融合。所提模型在多种声学条件下均显著优于现有主流多模态方法及强大的基于扩散的单模态基线。实验表明,在REVERB和NoisySpeech数据集上,该方法在PESQ、STOI等指标上分别提升了0.15和0.06以上,且对非平稳噪声具有更强鲁棒性。
原文摘要 · Abstract (English)
Single-channel speech enhancement models face significant performance degradation in extremely noisy environments. While prior work has shown that complementary bone-conducted speech can guide enhancement, effective integration of this noise-immune modality remains a challenge. This paper introduces a novel multimodal speech enhancement framework that integrates bone-conduction sensors with air-conducted microphones using a conditional diffusion model. Our proposed model significantly outperforms previously established multimodal techniques and a powerful diffusion-based single-modal baseline across a wide range of acoustic conditions.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。