arXiv:2506.19446cs.SDeess.AS2025-06被引 3

Vo-Ve通过可解释的语音属性概率,实现说话人身份评估。

Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation

  • 将语音属性概率融入声纹向量,实现可解释性
  • 在说话人相似度评估上表现媲美传统方法
  • 适合需要透明度的语音识别与验证场景

本文提出一种新型声纹向量 Vo-Ve,用于捕捉说话人身份特征。与传统声纹嵌入不同,Vo-Ve 具有可解释性,其向量包含明确语音属性类别的概率。通过大量分析表明,Vo-Ve 在说话人相似度评估上表现不逊于传统技术,同时能以语音属性为依据提供可解释的判断。我们坚信,由于其高层可解释性,Vo-Ve 可显著提升各类语音任务中的评估体系效果。

原文摘要 · Abstract (English)

In this paper, we propose Vo-Ve, a novel voice-vector embedding that captures speaker identity. Unlike conventional speaker embeddings, Vo-Ve is explainable, as it contains the probabilities of explicit voice attribute classes. Through extensive analysis, we demonstrate that Vo-Ve not only evaluates speaker similarity competitively with conventional techniques but also provides an interpretable explanation in terms of voice attributes. We strongly believe that Vo-Ve can enhance evaluation schemes across various speech tasks due to its high-level explainability.

声纹识别可解释性语音属性

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。