通过推理工程提升视觉问答系统鲁棒性,无需微调即获佳绩。
FAU at ImageCLEF 2026 Task on Multimodal Reasoning Robust Candidate Scoring and Concise Multilingual Visual Answering

- 用标签得分替代生成,融合多轮结果提升准确性
- 开放题答案经增强、提示与清理,去除非必要内容
- 无需训练,仅靠推理优化便在两项任务中分别夺亚冠
我们介绍了在 ImageCLEF 2026 多模态推理任务中针对视觉选择题(Visual MCQ)和视觉开放题(Visual OpenQA)的系统方案。挑战要求对包含密集文本、图表、公式等多语言教育与科学图像进行可靠推理,并严格控制答案格式。核心发现是:输出控制的鲁棒性不亚于模型选择。对于视觉选择题,我们以视觉语言模型的逻辑值直接评分候选标签,取代易错的自由生成,再通过分数融合与投票整合多轮结果;对于开放题,采用图像增强、简洁答案提示、确定性解码及针对性后处理,去除推理痕迹与格式错误。未进行任务特定模型训练的情况下,官方提交在视觉选择题中取得 0.7108 准确率,位列第三;在视觉开放题中以 0.6488 COMET、0.1391 BLEU、0.2762 ROUGE L 与 0.2383 METEOR 高分夺冠。结果表明,推理工程具有显著实践价值:精心设计的评分、集成、提示与清理策略,可将强大视觉语言模型转化为稳定可靠的竞赛系统。
原文摘要 · Abstract (English)
We present our ImageCLEF 2026 Multimodal Reasoning system for the Visual Multiple Choice Question Answering (Visual MCQ) and Visual Open Question Answering (Visual OpenQA) subtasks. The challenge requires reliable reasoning over multilingual educational and scientific images with dense text, diagrams, charts, tables, formulas, and units, while enforcing strict answer formats. Our central finding is that robust output control is as important as model choice. For Visual MCQ, we replace fragile free-form generation with direct candidate label scoring from vision-language model logits, then combine complementary runs through score fusion and voting. For Visual OpenQA, we use image enhancement, concise final answer prompting, deterministic decoding, and targeted post-processing to remove reasoning traces and formatting artifacts. Without task-specific model training, our official submissions achieved third place in Visual MCQ with 0.7108 accuracy and first place in Visual OpenQA with 0.6488 COMET, 0.1391 BLEU, 0.2762 ROUGE L, and 0.2383 METEOR. The results highlight the practical value of inference engineering: careful scoring, ensembling, prompting, and cleanup can turn strong VLMs into reliable competition systems.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。