arXiv:2607.14310eess.AS2026-07

构建高质量俄语对话语音数据集,支持自然表达的对话式语音合成。

Dialogs: a studio-quality expressive conversational Russian speech corpus for dialog assistants

  • 在专业录音棚录制20.6小时真人互动对话,含12类情感标签
  • 经人工评测,音质与可懂度媲美顶尖俄语语音基线,表达力更优
  • 验证了小样本下仍可训练出自然对话风格的语音合成模型

我们推出了Dialogs,一个面向对话助手的高质量俄语对话语音语料库。该数据集包含在专业录音棚中录制的20.6小时面对面表演式对话(44.1 kHz立体声),共分割为11,796个话语片段,涉及3位说话人。与朗读型语音资源不同,Dialogs捕捉了真实对话中的交替节奏与富有表现力的语调,并为每个话语提供了涵盖12个类别的风格/情感标签。通过众包语音质量评分测试(crowd MOS)验证,其音频质量与可懂度达到与现有俄语专业基线相当的水平,同时在表达力和对话自然性方面获得更高评价。最后,我们以VITS2模型作为概念验证,证明即使每说话人数据有限,Dialogs仍能支持训练出具有表现力、类对话风格的语音合成系统。

原文摘要 · Abstract (English)

We introduce Dialogs, a studio-quality Russian conversational speech corpus for dialog assistants. The dataset contains 20.6 hours of face-to-face acted dialogs recorded in a professional studio (44.1 kHz stereo) and segmented into 11,796 utterances across 3 speakers. Unlike read-speech resources, Dialogs captures turn-taking rhythm and expressive prosody, and provides per-utterance style/emotion labels spanning 12 categories. We validate corpus quality with crowd MOS tests, showing comparable audio quality and intelligibility to strong Russian studio baselines while achieving higher ratings for expressiveness and conversational naturalness. Finally, we train a VITS2 model as a proof of concept, demonstrating that Dialogs supports training expressive, dialog-like TTS despite limited per-speaker data.

语音合成对话系统俄语数据

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。