arXiv:2605.24509cs.CVcs.AI2026-05

无需训练即可通过相位噪声控制视频动态,实现精准运动建模。

Φ-Noise: Training-Free Temporal Video Conditioning via Phase-Based Noise Manipulation

论文配图:Φ-Noise: Training-Free Temporal Video Conditioning via Phase-Based Noise Manipulation
图 1 · 摘自论文原文
  • 直接在扩散噪声潜空间注入参考视频的低频相位信息,实现无训练运动控制。
  • 生成视频在外观与动态上均可控,效果优于或媲美复杂训练方法。
  • 适用于需要快速调整视频运动轨迹的场景,如视频编辑与动画生成。

潜在视频扩散模型通过逐步将高斯噪声转化为真实样本,实现基于文本或视觉输入的视频生成。然而,现有条件控制方法通常需要额外训练和计算开销。受生成模型中频率成分重要性的启发,我们提出一种简单、无需训练的运动条件视频生成方法:直接将参考视频的低频相位信息注入扩散噪声潜空间。该方法无需修改模型架构或推理流程,即可有效传递运动线索。通过多种应用场景验证,该方法可实现对生成视频外观与动态的精确控制,在性能上达到或超过更复杂的条件化方法。

原文摘要 · Abstract (English)

Latent video diffusion models generate videos by progressively transforming Gaussian noise into realistic samples conditioned on text or visual inputs. However, existing conditioning methods often require additional training and computational overhead. Motivated by recent findings on the importance of frequency components in generative models, we propose a simple, training-free approach for motion-conditioned video generation by injecting low-frequency phase information from a reference video directly into the diffusion noise latents. Our method transfers motion cues without modifying the model architecture or inference pipeline. Using several applications, we demonstrate effective control over both appearance and dynamics in generated videos, while achieving competitive or superior results compared to more complex conditioning approaches.

视频生成扩散模型无训练

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。