首个文本视频编辑评估基准,全面评测模型性能
EditBoard: Towards a Comprehensive Evaluation Benchmark for Text-Based Video Editing Models
- 构建涵盖9项指标的多维评估体系
- 覆盖4类任务,引入3项新指标衡量编辑保真度
- 开源助力模型公平对比,推动技术发展
扩散模型的快速发展显著推进了AI生成内容(AIGC)的发展,尤其在文本到图像(T2I)和文本到视频(T2V)生成方面。基于这些生成能力的文本视频编辑技术应运而生,可实现根据文本提示对视频进行精确修改。尽管涌现出众多创新的视频编辑模型,但缺乏全面、系统的评估基准来从多个维度综合评价其性能。现有评估方法有限且不一致,通常仅以单一分数概括整体表现,掩盖了模型在具体编辑任务上的实际效果。为此,我们提出EditBoard——首个面向文本视频编辑模型的综合性评估基准。该基准包含四个维度下的九项自动指标,覆盖四类任务,并引入三项新指标用于评估编辑保真度。这一任务导向的评估体系能够客观呈现模型表现,揭示各模型的优势与不足。通过开源EditBoard,我们旨在统一评估标准,推动鲁棒性视频编辑模型的发展。
原文摘要 · Abstract (English)
The rapid development of diffusion models has significantly advanced AI-generated content (AIGC), particularly in Text-to-Image (T2I) and Text-to-Video (T2V) generation. Text-based video editing, leveraging these generative capabilities, has emerged as a promising field, enabling precise modifications to videos based on text prompts. Despite the proliferation of innovative video editing models, there is a conspicuous lack of comprehensive evaluation benchmarks that holistically assess these models' performance across various dimensions. Existing evaluations are limited and inconsistent, typically summarizing overall performance with a single score, which obscures models' effectiveness on individual editing tasks. To address this gap, we propose EditBoard, the first comprehensive evaluation benchmark for text-based video editing models. EditBoard encompasses nine automatic metrics across four dimensions, evaluating models on four task categories and introducing three new metrics to assess fidelity. This task-oriented benchmark facilitates objective evaluation by detailing model performance and providing insights into each model's strengths and weaknesses. By open-sourcing EditBoard, we aim to standardize evaluation and advance the development of robust video editing models.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。