arXiv:2606.11542cs.CLcs.AI2026-06中稿 · Interspeech 2026

自监督语音模型能准确识别罕见的啧音,突破语言资源不均限制。

Pretrained self-supervised speech models can recognize unseen consonants

论文配图:Pretrained self-supervised speech models can recognize unseen consonants
图 1 · 摘自论文原文
  • 用自监督模型在啧音丰富的科伊桑语上微调,测试其识别能力。
  • 微调后模型对啧音的识别准确率高于其他普通辅音。
  • 适合关注语音模型泛化性与低资源语言研究的学者。

现代预训练自监督语音识别模型通过大规模音频数据学习上下文表示,但其训练数据主要集中在高资源语言,对低资源语言中典型罕见发音如科伊桑语中的啧音覆盖不足,引发对其识别能力的担忧。本文针对这一问题,考察这些模型能否像识别常见音素一样准确识别啧音。我们在两种富含啧音的科伊桑语言(G|ui 和 West !Xoon)上对 Wav2Vec2 与 HuBERT 模型进行微调并对比。结果表明,微调后的模型对啧音的识别准确率始终高于非啧音,说明自监督学习具备跨人类语音音素的泛化能力,包括稀有音素。

原文摘要 · Abstract (English)

Modern pretrained self-supervised automatic speech recognition models are trained on large-scale audio data to encode speech into contextualized representations. However, their training data are heavily skewed toward high-resource languages with little data from low-resource languages, raising concerns about the potential underrepresentation of typologically uncommon speech sounds such as click consonants primarily found in Khoisan languages. This leads to our central research question: Can these models recognize click consonants as accurately as other speech sounds? To address this question, we fine-tune and compare pretrained self-supervised speech models (Wav2Vec2 and HuBERT) on data from two click-rich Khoisan languages (G|ui and West !Xoon). Our results reveal that the fine-tuned models consistently recognize clicks more accurately than non-clicks, suggesting that self-supervision enables generalization across human speech sounds including rare phonemes.

语音识别自监督学习罕见音素低资源语言

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。