用元数据动态融合得分,提升多语言语音验证准确率
AMECxSV: Adaptive Metadata-Driven Embedding-Fusion Calibration for X-Lingual Speaker Verification

- 根据元数据动态融合评分,生成校准后置信度
- 多语言场景下错误率最低降至0.43%
- 适合有元数据的语音验证系统优化
在多语言自动语音验证中,固定前端得分的可靠性随语言匹配、时长和得分来源变化。本文提出AMECxSV,一种面向元数据可用场景的自适应元数据驱动嵌入融合校准后端。该方法通过融合试验得分与元数据,生成校准后的目标后验概率,并可选地引入后验置信度弃权机制;元数据仅作为校准上下文,不作为说话人证据。在基于开发集划分的独立测试集上,得分+元数据头将官方TidyVoice得分源的等错误率(EER)从3.15%降至2.42%,将LI-MSV的EER从0.64%降至0.43%;双得分头实现0.43%全覆盖EER。在0.79覆盖下,弃权机制使接受试验的EER降至0.03%(非全覆盖指标)。匹配得分仅、元数据置换及元数据仅控制实验支持校准上下文解释,限制了对元数据可用评分的推广范围。
原文摘要 · Abstract (English)
In X-lingual automatic speaker verification (ASV), fixed front-end scores vary in reliability with language match, duration, and score source. We propose AMECxSV, an adaptive metadata-driven embedding-fusion calibration backend for metadata-available settings. AMECxSV fuses trial scores with metadata to produce calibrated target posteriors, with optional posterior-confidence abstention; metadata serve as calibration context, not speaker evidence. On a development-derived speaker-disjoint held-out split, score+metadata heads reduce equal error rate (EER) from 3.15% to 2.42% for the official TidyVoice score source and from 0.64% to 0.43% for LI-MSV; the dual-score head reaches 0.43% full-coverage EER. At 0.79 coverage, abstention yields 0.03% accepted-trial EER, not a full-coverage metric. Matched score-only, metadata-permutation, and metadata-only controls support a calibration-context interpretation and limit claims to metadata-available scoring.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。