提出多维度评测框架,检验图像编辑是否真懂用户隐含逻辑。
Is This Edit Correct? A Multi-Dimensional Benchmark for Reasoning-Aware Image Editing

- 构建五个维度的推理评测基准,涵盖物理、环境、文化等约束
- 1000个精心设计样本显示,主流模型常因忽略隐含逻辑出错
- 轻量级推理后处理可提升逻辑一致性,适用于各类编辑模型
基于扩散模型的图像编辑在自然语言指令下已实现高视觉保真度,但多数系统仅停留在表面指令执行层面,缺乏对真实请求中隐含上下文约束的推理能力,导致生成结果看似合理却逻辑矛盾。本文提出RE-Edit,一个面向推理感知图像编辑的多维评测基准,涵盖物理、环境、文化、因果和指称五个互补维度。该基准包含1000个精心设计的样本,每个样本均要求仅靠视觉合理性不足以判断正确性,真正正确的编辑必须满足隐含的逻辑约束。为支持细粒度分析,我们建立了与维度对齐的评估标准,并对十款开源及两款商用图像编辑模型进行了全面评测。结果表明,即使先进模型在高视觉质量下仍频繁在多维度推理上失败。我们进一步提出一种轻量级推理引导的后编辑基线方法,验证了显式插入推理过程可有效缓解此类问题,且具备模型无关性。
原文摘要 · Abstract (English)
Diffusion-based image editing has achieved strong visual fidelity under natural language instructions, yet most existing systems still operate at the level of surface instruction following, without reasoning about the implicit contextual constraints embedded in real user requests. This often leads to visually plausible but logically inconsistent edits. In this work, we introduce RE-Edit, a benchmark for REasoning-aware image Editing that evaluates image editing systems across five complementary reasoning dimensions: physical, environmental, cultural, causal, and referential. RE-Edit comprises 1,000 carefully curated samples, each designed such that visual plausibility alone is insufficient and correct editing requires satisfying implicit logical constraints. To support fine-grained analysis, we establish dimension-aligned evaluation criteria and conduct a comprehensive study of ten open-source and two commercial image editing models. Our results show that even advanced systems frequently struggle with implicit multi-dimensional reasoning despite producing high-quality visuals. We further present a lightweight reasoning-guided post-edit baseline as an initial exploration, illustrating how inserting explicit reasoning can help mitigate such failures in a model-agnostic manner.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。