arXiv:2608.14706cs.CVcs.AI2026-08

无需噪声条件的视频生成新框架,提升质量与一致性

Equilibrium Forcing: Adaptive Video Generation Without Noise Conditioning

论文配图:Equilibrium Forcing: Adaptive Video Generation Without Noise Conditioning
图 1 · 摘自论文原文
  • 不依赖噪声水平条件,解耦训练与采样过程
  • 在复杂视频生成任务上超越传统方法,显著提升质量
  • 适合追求高质量自回归视频生成的研究者

基于扩散和流匹配的标准自回归视频生成算法依赖固定训练目标和静态采样策略,限制了推理过程对数据的适应能力。本文提出均衡驱动(Equilibrium Forcing, EqF),一种无需噪声水平条件的视频去噪生成模型简化框架。EqF 首次实现噪声无关生成的模块化训练与推理设计,将去噪场学习与采样过程解耦。这种灵活性使推理算法能在闭环中根据样本反馈动态调整,显著提升在挑战性自回归视频生成基准上的视频质量和一致性。大量分析表明,去除噪声水平条件使 EqF 具备数据依赖的推理特性,性能优于标准噪声条件去噪方法。

原文摘要 · Abstract (English)

Standard autoregressive video generation algorithms based on Diffusion and Flow Matching rely on rigid training objectives and static sampling schedules, limiting inference procedures from adapting to the data. We introduce Equilibrium Forcing (EqF), a simplified framework for video denoising generative models without noise level conditioning. EqF pioneers modular training- and inference-time designs for noise-unconditional generation that decouple learning the denoising field from sampling. This flexibility allows for inference-time algorithms that operate in a closed loop by adapting to feedback from the sample, improving video quality and consistency on challenging autoregressive video generation benchmarks. Extensive analysis elucidates exactly how removing the noise level conditioning enables EqF's data-dependent inference properties to surpass the performance of standard noise level-conditional denoising video methods.

视频生成扩散模型自回归

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。