Vo-Ve通过可解释的语音属性概率,实现说话人身份评估。
Vo-Ve: An Explainable Voice-Vector for Speaker Identity Evaluation
- 将语音属性概率融入声纹向量,实现可解释性
- 在说话人相似度评估上表现媲美传统方法
- 适合需要透明度的语音识别与验证场景
本文提出一种新型声纹向量 Vo-Ve,用于捕捉说话人身份特征。与传统声纹嵌入不同,Vo-Ve 具有可解释性,其向量包含明确语音属性类别的概率。通过大量分析表明,Vo-Ve 在说话人相似度评估上表现不逊于传统技术,同时能以语音属性为依据提供可解释的判断。我们坚信,由于其高层可解释性,Vo-Ve 可显著提升各类语音任务中的评估体系效果。
原文摘要 · Abstract (English)
In this paper, we propose Vo-Ve, a novel voice-vector embedding that captures speaker identity. Unlike conventional speaker embeddings, Vo-Ve is explainable, as it contains the probabilities of explicit voice attribute classes. Through extensive analysis, we demonstrate that Vo-Ve not only evaluates speaker similarity competitively with conventional techniques but also provides an interpretable explanation in terms of voice attributes. We strongly believe that Vo-Ve can enhance evaluation schemes across various speech tasks due to its high-level explainability.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。