arXiv:2607.03118cs.CVcs.LG2026-07被引 2

用语音实时控制虚拟角色生成高清视频,支持无限长时输出。

Vidu S1: A Real-Time Interactive Video Generation Model

论文配图:Vidu S1: A Real-Time Interactive Video Generation Model
图 1 · 摘自论文原文
  • 基于TurboDiffusion与TurboServe,实现语音驱动的实时视频生成。
  • 在普通消费级显卡上稳定运行,540p分辨率下达42帧/秒。
  • 支持自定义人物图像与音色,适合互动娱乐与内容创作场景。

我们提出Vidu S1,一种支持语音控制数字角色的实时交互式视频生成模型。用户可通过语音指令随时控制视频生成内容。Vidu S1可在不出现模糊、漂移或视觉失真的情况下实现无限长度的实时视频生成。该模型基于TurboDiffusion和TurboServe构建,在普通消费级GPU上可输出540p分辨率、最高达42帧/秒的视频。用户可上传真实人物、动漫或宠物的自定义图像,并选择不同语音音色以获得个性化体验。实验表明,Vidu S1在所有测试指标中表现最佳,同时完全满足实时推理要求。可玩的在线演示已开放:https://vidu.com/vidu-stream。

原文摘要 · Abstract (English)

We introduce Vidu S1, a real-time interactive video generation model supporting voice control of digital characters. Users can control video generation content at any moment through voice instructions. Vidu S1 supports infinite-length real-time video generation without blurring, drift, or visual distortion. Built with TurboDiffusion and TurboServe, Vidu S1 outputs 540p real-time videos at up to 42 FPS on regular consumer GPUs. Users can upload custom images of real people, anime, and pets, and choose different voice tones for personalized experiences. Experiments show that Vidu S1 achieves the best performance across all test metrics while fully meeting real-time inference requirements. A playable online demo is available at https://vidu.com/vidu-stream.

视频生成实时交互语音控制扩散模型

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。