用直接偏好优化提升语音扩散模型的表达力和长文本稳定性
Direct Preference Optimization for Speech Autoregressive Diffusion Models
- 将直接偏好优化应用于自回归扩散语音模型,避免复杂离散分词
- 在长文本生成上显著提升语音表现力与鲁棒性
- 适合关注语音合成质量与训练效率的研究者
自回归扩散模型(ARDMs)最近被用于语音生成,在零样本文本转语音任务中达到当前最优性能。通过自回归地以扩散方式生成连续语音标记,这类模型为替代传统的下一个词预测提供了新思路,避免了离散语音标记化带来的技术复杂性。作为较新的范式,针对语音ARDMs的强化学习微调研究仍有限。本文提出自回归扩散-直接偏好优化(ARDM-DPO),对近期提出的零样本文本转语音模型DiTAR进行DPO微调,显著提升了语音表达力和长文本生成的鲁棒性。
原文摘要 · Abstract (English)
Autoregressive diffusion models (ARDMs) have recently been applied to speech generation, achieving state-of-the-art (SOTA) performance in zero-shot text-to-speech. By autoregressively generating continuous speech tokens with next-token diffusion, these models offer a promising alternative to next-token prediction, avoiding the technical complexities associated with discrete speech tokenization. As a relatively new paradigm, research on reinforcement learning (RL)-based fine-tuning of speech ARDMs remains limited. In this paper, we propose Autoregressive Diffusion-Direct Preference Optimization (ARDM-DPO) to advance this research. By fine-tuning the recently proposed zero-shot text-to-speech model DiTAR with DPO, we achieve significant improvements in terms of speech expressiveness and robustness for long texts.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。