arXiv:2607.19790cs.CV2026-07

构建可验证的多领域视觉推理环境,提升视觉语言模型推理能力

Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

论文配图:Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning
图 1 · 摘自论文原文
  • 用场景语法与可执行任务程序分离视觉与答案计算
  • 在64000个实例上训练使模型在24个基准上平均提升超3.5%
  • 适合研究视觉推理、强化学习与可验证奖励的学者

基于可验证奖励的强化学习(RLVR)显著提升了语言模型的推理能力,但其在视觉语言模型中的应用受限于缺乏广泛、精确可验证且可复现的训练数据。我们提出Trace,一个基于分类体系的多领域视觉推理环境。Trace将任务构建分解为场景语法和可执行任务程序,实现视觉呈现与答案计算的解耦。共享语义状态决定渲染图像、提示、类型化答案、验证器状态及可重放的任务轨迹。该环境包含1000个任务、277种场景语法和11个视觉领域,具备受控的语义与视觉变化。在64,000个Trace实例上进行RLVR训练,使Qwen2.5-VL-3B在24个外部基准上的宏平均得分提升3.51个百分点,Qwen2.5-VL-7B提升4.06个百分点,证明广泛的过程式训练可有效迁移至生成任务分布之外。项目页面:https://maveryn.github.io/trace/

原文摘要 · Abstract (English)

Reinforcement learning with verifiable rewards (RLVR) has substantially improved language-model reasoning, yet its extension to vision-language models remains constrained by the lack of training data that are simultaneously broad, exactly verifiable, and reproducible. We introduce Trace, a taxonomy-guided environment for multidomain visual reasoning. Trace factorizes task construction into a scene grammar and an executable task program, separating visual realization from answer computation. A shared semantic state determines the rendered image, prompt, typed answer, verifier state, and replayable instance trace. The resulting environment comprises 1,000 tasks over 277 scene grammars and 11 visual domains, with controlled semantic and visual variation. RLVR on 64,000 Trace instances improves the macro-average across 24 external benchmarks by 3.51 percentage points for Qwen2.5-VL-3B and 4.06 points for Qwen2.5-VL-7B, providing evidence that broad procedural training can transfer beyond the generated task distributions. Project page: https://maveryn.github.io/trace/.

视觉推理强化学习可验证奖励多领域

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。