用统一非自回归模型实现端到端语音分离,刷新多个数据集记录。
Pushing the Limits of End-to-End Diarization
- 采用单一非自回归模型EEND-TA,统一处理端到端说话人分离任务。
- 在DIHARD III数据集上达到14.49%的说话人分离错误率新低。
- 通过8人混音预训练增强模型泛化能力,适合大规模语音分析场景。
本文在多个公开数据集(包括AliMeeting-far、AliMeeting-near、AMI-Mix、AMI-SDM、DIHARD III和MagicData RAMC)上实现了最先进的说话人分离错误率(DER)。我们基于EEND-TA——一种用于端到端说话人分离的统一非自回归模型,取得了新的基准结果,尤其在DIHARD III上达到了14.49%的DER。该方法通过8人模拟混音进行预训练,确保每种说话人混合配置均被充分覆盖。实验表明,基于EEND的架构具有远超以往探索范围的学习能力,在保持高效推理速度的同时,优于许多现有分离方案。
原文摘要 · Abstract (English)
In this paper, we present state-of-the-art diarization error rates (DERs) on multiple publicly available datasets, including AliMeeting-far, AliMeeting-near, AMI-Mix, AMI-SDM, DIHARD III, and MagicData RAMC. Leveraging EEND-TA, a single unified non-autoregressive model for end-to-end speaker diarization, we achieve new benchmark results, most notably a DER of 14.49% on DIHARD III. Our approach scales pretraining through 8-speaker simulation mixtures, ensuring each generated speaker mixture configuration is sufficiently represented. These experiments highlight that EEND-based architectures possess a greater capacity for learning than previously explored, surpassing many existing diarization solutions while maintaining efficient speeds during inference.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。