arXiv:2509.19090cs.CVcs.AI2025-09被引 7

一个统一框架实现医学影像精确定位与临床推理。

Citrus-V: Advancing Medical Foundation Models with Unified Medical Image Grounding for Clinical Reasoning

论文配图:Citrus-V: Advancing Medical Foundation Models with Unified Medical Image Grounding for Clinical Reasoning
图 1 · 摘自论文原文
  • 融合检测、分割与多模态思维链,实现像素级病灶定位。
  • 在多个基准上超越开源模型和专家系统,支持精准量化与自动报告。
  • 适合医疗AI研发、临床辅助诊断系统构建者使用。

医学影像为临床诊断、治疗规划和手术决策提供关键依据,但现有影像模型普遍功能单一,需多个专用网络,限制了泛化能力。尽管大规模语言与多模态模型具备强大推理与多任务能力,真实临床应用仍需精确视觉定位、多模态融合及思维链推理。我们提出Citrus-V,一种结合图像分析与文本推理的多模态医学基础模型。该模型集成检测、分割与多模态思维链推理,可在单一框架内实现像素级病灶定位、结构化报告生成与类医生诊断推理。我们提出一种新型多模态训练方法,并发布一个精心整理的开源数据集,涵盖推理、检测、分割与文档理解任务。评估显示,Citrus-V在多个基准上优于现有开源医学模型及专家级影像系统,实现从视觉定位到临床推理的统一流程,支持精确病灶量化、自动化报告生成与可靠第二意见。

原文摘要 · Abstract (English)

Medical imaging provides critical evidence for clinical diagnosis, treatment planning, and surgical decisions, yet most existing imaging models are narrowly focused and require multiple specialized networks, limiting their generalization. Although large-scale language and multimodal models exhibit strong reasoning and multi-task capabilities, real-world clinical applications demand precise visual grounding, multimodal integration, and chain-of-thought reasoning. We introduce Citrus-V, a multimodal medical foundation model that combines image analysis with textual reasoning. The model integrates detection, segmentation, and multimodal chain-of-thought reasoning, enabling pixel-level lesion localization, structured report generation, and physician-like diagnostic inference in a single framework. We propose a novel multimodal training approach and release a curated open-source data suite covering reasoning, detection, segmentation, and document understanding tasks. Evaluations demonstrate that Citrus-V outperforms existing open-source medical models and expert-level imaging systems across multiple benchmarks, delivering a unified pipeline from visual grounding to clinical reasoning and supporting precise lesion quantification, automated reporting, and reliable second opinions.

医学影像多模态基础模型临床推理

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。