构建多样罗马尼亚语语音数据集,提升低资源场景下语音识别泛化能力
RO-N3WS: Enhancing Generalization in Low-Resource ASR with Diverse Romanian Speech Benchmarks
- 构建覆盖新闻、文学、影视等5类风格的126小时罗马尼亚语语音数据集
- 在零样本和微调设置下,使用真实数据微调可显著降低词错误率
- 适合多语言语音识别、领域自适应及轻量部署研究者参考
我们提出RO-N3WS,一个用于提升自动语音识别(ASR)泛化能力的罗马尼亚语语音基准数据集,尤其适用于低资源和分布外(OOD)场景。该数据集包含超过126小时的带标注音频,来源涵盖广播新闻、文学有声书、电影对白、儿童故事及对话播客。其多样性支持跨风格领域的鲁棒训练与微调。我们在零样本与微调设置下评估了Whisper、Wav2Vec 2.0等先进ASR系统,并使用表达性强的文本转语音(TTS)模型生成合成数据进行对照实验。结果表明,仅用真实语音数据进行有限微调,即可在词错误率(WER)上显著优于零样本基线。所有模型、脚本与数据划分将公开,以支持多语言ASR、领域自适应及轻量部署的可复现研究。
原文摘要 · Abstract (English)
We introduce RO-N3WS, a benchmark Romanian speech dataset designed to improve generalization in automatic speech recognition (ASR), particularly in low-resource and out-of-distribution (OOD) conditions. RO-N3WS comprises over 126 hours of transcribed audio collected from broadcast news, literary audiobooks, film dialogue, children's stories, and conversational podcast speech. This diversity enables robust training and fine-tuning across stylistically distinct domains. We evaluate several state-of-the-art ASR systems (Whisper, Wav2Vec 2.0) in both zero-shot and fine-tuned settings, and conduct controlled comparisons using synthetic data generated with expressive TTS models. Our results show that even limited fine-tuning on real speech from RO-N3WS yields substantial WER improvements over zero-shot baselines. We will release all models, scripts, and data splits to support reproducible research in multilingual ASR, domain adaptation, and lightweight deployment.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。