L-Proto让多语言语音识别更准,通过按语言分组训练提升跨语言泛化能力。
L-Proto: Language-Aware Episodic Prototypical Training for Multilingual Speaker Verification

- 按语言分组构造训练样本,避免语言特征干扰说话人识别。
- 在多个模型架构上均优于传统微调和随机采样方法。
- 适合需要跨语言说话人验证的语音系统开发者使用。
多语言说话人验证仍具挑战性,因语言相关的声学差异导致说话人身份与语言特征纠缠,降低跨语言泛化能力。在多语言训练中,嵌入向量常编码语言线索,使说话人形成语言特异的聚类。我们提出L-Proto,一种语言感知的周期原型训练策略,通过每轮采样仅来自单一语言的说话人构建语言一致的训练批次,减少训练过程中的语言驱动变异,促使嵌入更专注于说话人身份。在TidyVoice Challenge基准上的实验表明,无论采用何种主干网络,该方法均持续优于传统微调和随机周期采样。
原文摘要 · Abstract (English)
Multilingual speaker verification remains challenging because language-dependent acoustic variability causes speaker identity to become entangled with linguistic characteristics, degrading generalization across languages. In multilingual training, embeddings often encode language cues with speaker identity, causing speakers to form language-specific clusters. We propose L-Proto, a language-aware episodic prototypical training strategy that constructs language-consistent episodes. By sampling speakers from a single language per episode, L-Proto reduces language-driven variation during training and encourages embeddings to focus more directly on speaker identity. Experiments on the TidyVoice Challenge benchmark demonstrate consistent performance improvements over conventional fine-tuning and random episodic sampling across multiple backbone architectures.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。