arXiv:2606.26903eess.AS2026-06中稿 · Interspeech 2026

通过对比学习提升语音质量评估精度,无需额外计算开销。

DNSMOS-C: Improving End-to-end Speech Quality Models via Contrastive Learning

论文配图:DNSMOS-C: Improving End-to-end Speech Quality Models via Contrastive Learning
图 1 · 摘自论文原文
  • 用MOS引导的三元组对比损失优化中间表征空间
  • 在多个数据集上相关性指标超越DNSMOS Pro
  • 模型更紧凑,适合实际部署且提升可解释性

我们提出DNSMOS-C,一种轻量级端到端语音质量评估模型,通过在中间嵌入层引入基于MOS的三元组对比损失,扩展了DNSMOS Pro框架。该对比监督使潜在空间更符合感知质量层次结构,同时保持原模型的简洁与高效。不同于依赖大型自监督预训练编码器和多阶段训练的先前方法,DNSMOS-C在单一统一框架中联合学习语音表示与MOS回归。多个数据集实验表明,相比DNSMOS Pro,DNSMOS-C在相关性指标上持续提升,并在具有挑战性的域外测试集上表现出更强泛化能力。潜在空间分析显示,本方法学习到具有低维质量排序特性的表示,增强了可解释性并改善训练稳定性。结果表明,基于MOS的对比学习可在不增加计算开销的前提下实现更鲁棒、准确的质量预测。

原文摘要 · Abstract (English)

We introduce DNSMOS-C, a compact end-to-end speech quality assessment model that extends the DNSMOS Pro framework by integrating a MOS-guided triplet-based contrastive loss. Applied directly to the intermediate embeddings, this contrastive supervision encourages the latent space to be better organized with respect to perceptual quality while preserving the simplicity and efficiency of DNSMOS Pro. Unlike prior methods that depend on large pre-trained self-supervised learning (SSL) encoders and multi-stage training, DNSMOS-C jointly learns speech representations and MOS regression within a single, unified framework. Experiments on multiple datasets show that DNSMOS-C consistently improves correlation metrics over DNSMOS Pro and achieves better generalization on challenging out-of-domain test sets. Furthermore, latent space analyses indicate that our approach learns representations that exhibit an emergent low-dimensional quality ordering, which enhances interpretability and improves training stability. These findings demonstrate that MOS-guided contrastive learning enables more robust and accurate quality predictions without incurring additional computational overhead.

语音质量评估对比学习端到端模型

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。