arXiv:2512.07005cs.SDcs.AI2025-12中稿 · ACMMM 2025被引 1

构建首个多口音普通话独唱数据集,助力声乐口音识别研究

Multi-Accent Mandarin Dry-Vocal Singing Dataset: Benchmark for Singing Accent Recognition

  • 采集4206名母语者9个地区独唱音频,覆盖3首流行歌和语音练习
  • 数据集超670小时,含完整元音与音高范围,支持口音识别基准测试
  • 可分析方言对声乐口音影响,适合语音、音乐信息检索研究者

与语音口音研究相比,声乐口音研究仍属空白,主要因缺乏合适数据集。现有歌唱数据集常因人声与伴奏分离导致细节丢失,且普遍缺少地域口音标注。为此,我们提出多口音普通话独唱干声数据集(MADVSD),包含来自中国九个地区的4,206名母语者超过670小时的干声录音。每位参与者以自身口音演唱三首流行歌曲,并录制涵盖所有普通话元音及一个八度音程的语音练习。通过基准实验验证了MADVSD在声乐口音识别任务中的有效性,展示了其在评估先进语音模型于歌唱场景下的应用价值。此外,利用独特语音练习,我们探索了方言对声乐口音的影响,并分析了元音在口音差异中的作用。

原文摘要 · Abstract (English)

Singing accent research is underexplored compared to speech accent studies, primarily due to the scarcity of suitable datasets. Existing singing datasets often suffer from detail loss, frequently resulting from the vocal-instrumental separation process. Additionally, they often lack regional accent annotations. To address this, we introduce the Multi-Accent Mandarin Dry-Vocal Singing Dataset (MADVSD). MADVSD comprises over 670 hours of dry vocal recordings from 4,206 native Mandarin speakers across nine distinct Chinese regions. In addition to each participant recording audio of three popular songs in their native accent, they also recorded phonetic exercises covering all Mandarin vowels and a full octave range. We validated MADVSD through benchmark experiments in singing accent recognition, demonstrating its utility for evaluating state-of-the-art speech models in singing contexts. Furthermore, we explored dialectal influences on singing accent and analyzed the role of vowels in accentual variations, leveraging MADVSD's unique phonetic exercises.

声乐识别口音研究语音数据集

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。