arXiv:2606.05576cs.CV2026-06

构建超分辨率图像问答诊断基准,揭示视觉模型推理短板

UltraVR: A Diagnostic Ultra-Resolution Image-VQA Benchmark for Evidence-Grounded Reasoning

论文配图:UltraVR: A Diagnostic Ultra-Resolution Image-VQA Benchmark for Evidence-Grounded Reasoning
图 1 · 摘自论文原文
  • 设计结构化链式标注,分解视觉到决策全流程
  • 模型在微小证据定位上准确率不足40%,远低于整体表现
  • 适合研究超分辨率视觉推理的算法开发者与评估者

视觉语言模型在视觉问答和多模态推理任务中表现优异,但在超分辨率图像(关键证据微小、隐蔽、空间分散)上的能力仍不明确。现有评估多依赖最终答案准确率,难以判断模型是否真正获取并整合视觉证据。我们提出UltraVR,一个针对超分辨率图像的诊断性基准,涵盖四个高价值场景:CCTV监控、遥感(RS)、全切片病理(WSI)和工业异常检测(AD)。这些领域分别面临复杂场景细粒度目标定位、长距离空间对比、多尺度证据导航及重复布局中的细微异常检测挑战。每个样本不仅包含标准问答三元组,还提供结构化真实推理链:分步问题、中间答案与推理标签,涵盖证据定位、局部感知、量化、证据融合与决策推断。基于此,我们评估前沿视觉语言模型发现,当前模型在超分辨率推理中仍不可靠,错误主要集中于证据定位与局部感知阶段,而下游推理在给出中间视觉事实后可显著恢复。该结果表明UltraVR能诊断模型在视觉到决策全流程中的失效环节。

原文摘要 · Abstract (English)

Vision-language models (VLMs) excel on visual question answering and multimodal reasoning benchmarks. Yet their capability on ultra-resolution images - where critical evidence is tiny, subtle, spatially distant, or distributed - remains unclear. Existing evaluations largely report final-answer accuracy, offering limited insight into whether models acquire and integrate the necessary visual evidence. We introduce UltraVR, a diagnostic benchmark for evidence-grounded visual reasoning over ultra-resolution images. UltraVR spans four high-value scenarios: CCTV surveillance, remote sensing (RS), whole-slide image (WSI) pathology, and industrial anomaly detection (AD). These domains pose complementary challenges: fine-grained object grounding in crowded CCTV scenes, long-range spatial comparison in RS, multi-scale evidence navigation in WSI, and subtle irregularity detection in repetitive industrial layouts. Beyond standard QA triples, each instance includes a structured ground-truth chain of thought with step-level questions, intermediate answers, and reasoning labels. These labels decompose reasoning into evidence grounding, local perception, quantification, evidence integration, and decision inference, enabling process-level diagnosis over black-box scoring. Using UltraVR, we evaluate frontier VLMs and show that current models remain far from reliable on ultra-resolution reasoning. Importantly, the structured annotations allow us to localize failures across the visual-to-decision pipeline: errors concentrate in evidence grounding and local perception, while downstream inference often recovers when intermediate visual facts are supplied. These findings demonstrate UltraVR as a diagnostic testbed for measuring not only whether VLMs answer correctly, but where their ultra-resolution reasoning process breaks.

视觉问答超分辨率诊断评估多模态推理

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。