arXiv:2606.22042cs.CV2026-06

提出无需训练的多对象视频编辑方法,提升时序一致性与精细控制能力

IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance

论文配图:IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance
图 1 · 摘自论文原文
  • 通过布局引导注意力调制实现多对象协同编辑
  • 引入实例级掩码保持物体身份,避免注意力泄露
  • 适合需要精准可控多对象视频修改的研究与应用

基于扩散模型的视频编辑已取得显著进展,但在多对象场景下实现精确且时序一致的对象级控制仍具挑战,主要受限于注意力泄露、身份漂移和不稳定的时序动态。本文提出IDAG-Edit,一种无需训练的细粒度多对象视频编辑框架,具备强时序一致性。该框架采用布局引导注意力调制,促进多对象间的协调编辑;同时引入实例级掩码,保留每个对象的身份,并在各对象区域内部强制局部注意力,从而实现精细化的对象级编辑。大量定性和定量评估表明,该方法在时序稳定性与多对象可控性方面优于现有最先进视频编辑技术。

原文摘要 · Abstract (English)

Diffusion-based video editing has made significant progress; however, achieving precise and temporally consistent object-level control, especially in multi-object scenarios, remains challenging due to attention leakage, identity drift, and unstable temporal dynamics. In this work, we propose IDAGEdit, a training-free framework for fine-grained multi-object video editing with strong temporal consistency. The framework adopts Layout-guided Attention Modulation to facilitate coherent multi-object editing, while Instance-level Masks are introduced to preserve individual object identity and enforce localized attention within each object region, thereby enabling fine-grained, object-level editing. Extensive qualitative and quantitative evaluations demonstrate that our method improves temporal stability and multi-object controllability over state-of-the-art video editing approaches.

视频编辑扩散模型多对象控制时序一致性

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。