构建大规模视频编辑数据集,支持多指令复合操作。
CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing

- 设计生成与筛选流程,确保指令忠实与画面质量。
- 含200K样本,每段视频有2至5个原子编辑操作。
- 适合研究多指令视频编辑的算法与模型开发者。
现有基于指令的视频编辑数据集多聚焦单一编辑操作,难以支持复合指令引导的视频编辑。为此,我们提出CoinVE-200K,一个大规模高质量数据集,用于组合式指令引导视频编辑。该数据集包含1080p、长达201帧的视频编辑对,覆盖多样组合场景,每个样本涉及2至5个原子编辑操作,指令涵盖人物、物体和背景,操作类型包括添加、移除、修改与风格化。所有样本通过精心设计的生成与过滤流程构建,保障指令忠实性、视觉质量、时间一致性与组合多样性。我们还引入CoinVE-Bench基准,评估跨主题、操作类型与指令复杂度下的组合式视频编辑能力。此外,基于Wan2.1-T2V-14B与Qwen3-VL-8B-Instruct构建了220亿参数的CoinVE-Edit模型,通过区域感知注意力解耦不同编辑指令,实现精准多区域编辑,同时保留无关内容与时间连贯性。在CoinVE-Bench上的实验表明,CoinVE-Edit在指令遵循、组合编辑准确率、视觉质量与时间一致性方面均表现优异。
原文摘要 · Abstract (English)
The quality and diversity of instruction-based video editing datasets are steadily improving, yet existing datasets mainly focus on single editing operations and fall short in supporting compositional instruction-guided video editing. In particular, multiple editing intents must be jointly understood and faithfully executed within the same video. To address this issue, we introduce CoinVE-200K, a large-scale, high-quality dataset for Compositional Instruction-Guided Video Editing. CoinVE-200K contains 1080p video-editing pairs of up to 201 frames, covering diverse compositional scenarios where each sample involves 2 to 5 atomic editing operations. The instructions target humans, objects, and backgrounds, and cover edit types such as addition, removal, modification, and stylization. All samples are built through a carefully designed generation and filtering pipeline to ensure instruction faithfulness, visual quality, temporal consistency, and compositional diversity. We also introduce CoinVE-Bench, a benchmark for compositional-instruction video editing across diverse subjects, operation types, and instruction complexities. Furthermore, we present CoinVE-Edit, a 22B compositional video editing model built upon Wan2.1-T2V-14B and Qwen3-VL-8B-Instruct. CoinVE-Edit disentangles region-aware attention for different editing instructions, enabling precise multi-region editing while preserving irrelevant content and temporal coherence. Experiments on CoinVE-Bench show that CoinVE-Edit achieves strong performance in instruction following, compositional editing accuracy, visual quality, and temporal consistency.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。