arXiv:2603.18090cs.SDcs.AI2026-03被引 9

MOSS-TTS用离散音符实现高效语音生成,支持零样本克隆和精准控制。

MOSS-TTS Technical Report

  • 用离散音频标记+自回归建模,构建可扩展的语音生成基础模型
  • 支持零样本语音克隆、词素级发音控制及长文本稳定生成
  • 适合需要高可控性、多语言、快速出声的语音应用开发者

本技术报告介绍MOSS-TTS,一种基于可扩展训练范式的语音生成基础模型:使用离散音频标记、自回归建模与大规模预训练。基于MOSS-Audio-Tokenizer(一个因果Transformer分词器,将24 kHz音频压缩至12.5帧/秒,采用可变比特率向量量化,统一语义与声学表示),我们发布两个互补生成器:MOSS-TTS强调结构简洁性、可扩展性及长上下文/控制导向部署;MOSS-TTS-Local-Transformer引入帧局部自回归模块,提升建模效率、说话人保留能力,并缩短首次音频输出时间。在多语言和开放域场景下,MOSS-TTS支持零样本语音克隆、标记级时长控制、音素/拼音级发音控制、流畅的跨语言切换及稳定的长文本生成。本报告总结了所发布模型的设计、训练方法与实证特性。

原文摘要 · Abstract (English)

This technical report presents MOSS-TTS, a speech generation foundation model built on a scalable recipe: discrete audio tokens, autoregressive modeling, and large-scale pretraining. Built on MOSS-Audio-Tokenizer, a causal Transformer tokenizer that compresses 24 kHz audio to 12.5 fps with variable-bitrate RVQ and unified semantic-acoustic representations, we release two complementary generators: MOSS-TTS, which emphasizes structural simplicity, scalability, and long-context/control-oriented deployment, and MOSS-TTS-Local-Transformer, which introduces a frame-local autoregressive module for higher modeling efficiency, stronger speaker preservation, and a shorter time to first audio. Across multilingual and open-domain settings, MOSS-TTS supports zero-shot voice cloning, token-level duration control, phoneme-/pinyin-level pronunciation control, smooth code-switching, and stable long-form generation. This report summarizes the design, training recipe, and empirical characteristics of the released models.

语音生成基础模型零样本克隆可控生成

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。