arXiv:2608.17566cs.CV2026-08

构建大规模视频编辑数据集,支持多指令复合操作。

CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing

论文配图:CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing
图 1 · 摘自论文原文
  • 设计生成与筛选流程,确保指令忠实与画面质量。
  • 含200K样本,每段视频有2至5个原子编辑操作。
  • 适合研究多指令视频编辑的算法与模型开发者。

现有基于指令的视频编辑数据集多聚焦单一编辑操作,难以支持复合指令引导的视频编辑。为此,我们提出CoinVE-200K,一个大规模高质量数据集,用于组合式指令引导视频编辑。该数据集包含1080p、长达201帧的视频编辑对,覆盖多样组合场景,每个样本涉及2至5个原子编辑操作,指令涵盖人物、物体和背景,操作类型包括添加、移除、修改与风格化。所有样本通过精心设计的生成与过滤流程构建,保障指令忠实性、视觉质量、时间一致性与组合多样性。我们还引入CoinVE-Bench基准,评估跨主题、操作类型与指令复杂度下的组合式视频编辑能力。此外,基于Wan2.1-T2V-14B与Qwen3-VL-8B-Instruct构建了220亿参数的CoinVE-Edit模型,通过区域感知注意力解耦不同编辑指令,实现精准多区域编辑,同时保留无关内容与时间连贯性。在CoinVE-Bench上的实验表明,CoinVE-Edit在指令遵循、组合编辑准确率、视觉质量与时间一致性方面均表现优异。

原文摘要 · Abstract (English)

The quality and diversity of instruction-based video editing datasets are steadily improving, yet existing datasets mainly focus on single editing operations and fall short in supporting compositional instruction-guided video editing. In particular, multiple editing intents must be jointly understood and faithfully executed within the same video. To address this issue, we introduce CoinVE-200K, a large-scale, high-quality dataset for Compositional Instruction-Guided Video Editing. CoinVE-200K contains 1080p video-editing pairs of up to 201 frames, covering diverse compositional scenarios where each sample involves 2 to 5 atomic editing operations. The instructions target humans, objects, and backgrounds, and cover edit types such as addition, removal, modification, and stylization. All samples are built through a carefully designed generation and filtering pipeline to ensure instruction faithfulness, visual quality, temporal consistency, and compositional diversity. We also introduce CoinVE-Bench, a benchmark for compositional-instruction video editing across diverse subjects, operation types, and instruction complexities. Furthermore, we present CoinVE-Edit, a 22B compositional video editing model built upon Wan2.1-T2V-14B and Qwen3-VL-8B-Instruct. CoinVE-Edit disentangles region-aware attention for different editing instructions, enabling precise multi-region editing while preserving irrelevant content and temporal coherence. Experiments on CoinVE-Bench show that CoinVE-Edit achieves strong performance in instruction following, compositional editing accuracy, visual quality, and temporal consistency.

视频编辑多指令数据集生成模型

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。