arXiv:2502.01535cs.CVcs.CL2025-02被引 3

用对比学习对齐影像与病灶描述,实现阿尔茨海默病可解释诊断

VisTA: Vision-Text Alignment Model with Contrastive Learning using Multimodal Data for Evidence-Driven, Reliable, and Explainable Alzheimer's Disease Diagnosis

  • 基于医学影像与专家标注描述的对比学习对齐
  • 异常识别准确率74%,痴呆预测准确率达88%
  • 生成与医生意见高度一致的诊断解释,适合临床辅助决策

阿尔茨海默病(AD)的高维影像评估在临床上至关重要但极具挑战。尽管人工智能(AI)推动了AD诊断进展,如何设计兼具可预测性与可解释性的模型仍不明确。本文提出VisTA——一种结合对比学习的多模态语言-视觉模型,用于优化疾病预测与基于证据的可解释性分析。该模型基于BiomedCLIP构建,通过对比学习对齐影像与经专家验证的病灶及其描述。训练使用自建参考数据集,包含图像、异常类型及专家验证描述。VisTA输出包括:预测异常类型、与参考病例的相似度、证据驱动的解释及最终诊断。结果表明,仅用170样本微调,相比1500万图像预训练基线,异常识别准确率提升至74%(AUC 0.87),痴呆预测准确率达88%(AUC 0.82)。生成解释与人类专家高度一致,揭示了诊断逻辑。整体上,VisTA优化了预测性能、临床推理与可解释性。

原文摘要 · Abstract (English)

Objective: Assessing Alzheimer's disease (AD) using high-dimensional radiology images is clinically important but challenging. Although Artificial Intelligence (AI) has advanced AD diagnosis, it remains unclear how to design AI models embracing predictability and explainability. Here, we propose VisTA, a multimodal language-vision model assisted by contrastive learning, to optimize disease prediction and evidence-based, interpretable explanations for clinical decision-making. Methods: We developed VisTA (Vision-Text Alignment Model) for AD diagnosis. Architecturally, we built VisTA from BiomedCLIP and fine-tuned it using contrastive learning to align images with verified abnormalities and their descriptions. To train VisTA, we used a constructed reference dataset containing images, abnormality types, and descriptions verified by medical experts. VisTA produces four outputs: predicted abnormality type, similarity to reference cases, evidence-driven explanation, and final AD diagnoses. To illustrate VisTA's efficacy, we reported accuracy metrics for abnormality retrieval and dementia prediction. To demonstrate VisTA's explainability, we compared its explanations with human experts' explanations. Results: Compared to 15 million images used for baseline pretraining, VisTA only used 170 samples for fine-tuning and obtained significant improvement in abnormality retrieval and dementia prediction. For abnormality retrieval, VisTA reached 74% accuracy and an AUC of 0.87 (26% and 0.74, respectively, from baseline models). For dementia prediction, VisTA achieved 88% accuracy and an AUC of 0.82 (30% and 0.57, respectively, from baseline models). The generated explanations agreed strongly with human experts' and provided insights into the diagnostic process. Taken together, VisTA optimize prediction, clinical reasoning, and explanation.

阿尔茨海默病多模态可解释性对比学习

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。