用一步生成法提升语音分离的清晰度与听感质量。
MeCo: One-Step MeanFlow-based Corrector for Multi-Channel Speech Separation
- 基于均流场设计一步生成校正器,直接映射到干净语音空间。
- 在域内和域外场景下同时实现最优信噪比与听感质量。
- 计算开销极小,适合实际部署的语音增强系统。
多通道语音分离的判别模型虽在参考指标上表现优异,但人耳听感质量常不理想。为此,本文提出一种新型的基于均流场的一步生成校正器(MeCo)。MeCo学习条件平均速度场,将判别模型输出一步映射至干净语音流形。为最大化一步生成性能,引入数据空间优化(DSO):结合 $\mathbf{x}_r$-损失(惩罚长位移区间预测误差,提升听感质量)与终点 SI-SDR 损失(直接优化终态信号保真度)。实验表明,MeCo以极小计算开销达到当前最优(SOTA)性能,在域内与域外场景下同时实现优异的信号保真度与人耳听感质量。
原文摘要 · Abstract (English)
While discriminative models for multi-channel speech separation excel in reference-based metrics, they often exhibit suboptimal human listening quality. To address this, we propose a novel MeanFlow-based one-step generative corrector (MeCo). MeCo learns a conditional average velocity field to map discriminative estimates directly onto the clean speech manifold in a single step. To maximize one-step generation performance, we introduce Data-Space Optimization (DSO). DSO integrates an $\mathbf{x}_r$-loss, which penalizes prediction errors on longer displacement intervals to serve as a generative objective for human listening quality, with an Endpoint SI-SDR loss that directly optimizes terminal signal fidelity. Experiments demonstrate that MeCo achieves state-of-the-art (SOTA) performance with minimal computational overhead, simultaneously achieving superior signal fidelity and human listening quality in both in-domain and out-of-domain scenarios.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。