构建首个真实场景的语音合成数据集,提升语音合成在复杂环境下的表现。
Text-To-Speech Synthesis In The Wild
- 基于VoxCeleb1自动构建真实环境语音数据集,分难易两版
- 使用TITW-Easy训练可使语音质量达3.0以上UTMOS评分
- 适合研究真实场景语音合成、降噪与鲁棒性优化的开发者
传统语音合成系统依赖于受控环境下的录音。近年来,为利用真实场景语音数据,出现了噪声语音合成(noisy-TTS)训练方法,但缺乏专用数据集成为主要瓶颈。本文提出公开的TTS In the Wild(TITW)数据集,通过全自动流程处理VoxCeleb1数据集,包含两个训练集:TITW-Hard来自原始数据的转录、分割与筛选;TITW-Easy则结合DNSMOS评估进行增强与数据选择。使用最先进语音合成模型,在TITW-Easy上可达到超过3.0的UTMOS得分,而TITW-Hard仍具挑战性,得分低于2.8。
原文摘要 · Abstract (English)
Traditional Text-to-Speech (TTS) systems rely on studio-quality speech recorded in controlled settings.a Recently, an effort known as noisy-TTS training has emerged, aiming to utilize in-the-wild data. However, the lack of dedicated datasets has been a significant limitation. We introduce the TTS In the Wild (TITW) dataset, which is publicly available, created through a fully automated pipeline applied to the VoxCeleb1 dataset. It comprises two training sets: TITW-Hard, derived from the transcription, segmentation, and selection of raw VoxCeleb1 data, and TITW-Easy, which incorporates additional enhancement and data selection based on DNSMOS. State-of-the-art TTS models achieve over 3.0 UTMOS score with TITW-Easy, while TITW-Hard remains difficult showing UTMOS below 2.8.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。