用符号规则+视觉模型提升糖尿病眼病诊断的跨域泛化能力
Single Domain Generalization in Diabetic Retinopathy: A Neuro-Symbolic Learning Approach
- 融合临床病变知识与视觉特征,通过规则推理增强模型鲁棒性
- 跨域测试最高提升5.2%准确率,纯符号模型达63.67%平均精度
- 适合追求可解释性和真实场景部署的医疗AI研究者
领域泛化在医学影像中仍具挑战性,单一数据源训练的模型常因真实分布变化而失效。本文提出KG-DG,一种结合视觉变换器与专家引导符号推理的神经符号框架,用于糖尿病视网膜病变(DR)分类,实现对未见领域的稳健泛化。该方法通过结构化规则特征和视网膜血管分割,融合临床病变本体与深度视觉表示,采用置信度加权融合策略。框架同时支持单领域泛化(SDG)与多领域泛化(MDG),通过最小化领域嵌入间的KL散度,对齐高层临床语义。在四个公开数据集(APTOS、EyePACS、Messidor-1、Messidor-2)上实验显示:跨域设置下准确率最高提升5.2%,较基线ViT模型提高6%。值得注意的是,纯符号模型在MDG中达63.67%平均准确率;完整神经符号融合模型在挑战性的SDG场景中优于现有公开基线与基准。消融实验表明,基于病变的特征(准确率84.65%)显著优于纯神经方法,证实符号组件不仅是可解释性增强,更具备有效正则化作用。研究确立神经符号融合是构建临床稳健、领域不变医疗AI系统的重要范式。
原文摘要 · Abstract (English)
Domain generalization remains a critical challenge in medical imaging, where models trained on single sources often fail under real-world distribution shifts. We propose KG-DG, a neuro-symbolic framework for diabetic retinopathy (DR) classification that integrates vision transformers with expert-guided symbolic reasoning to enable robust generalization across unseen domains. Our approach leverages clinical lesion ontologies through structured, rule-based features and retinal vessel segmentation, fusing them with deep visual representations via a confidence-weighted integration strategy. The framework addresses both single-domain generalization (SDG) and multi-domain generalization (MDG) by minimizing the KL divergence between domain embeddings, thereby enforcing alignment of high-level clinical semantics. Extensive experiments across four public datasets (APTOS, EyePACS, Messidor-1, Messidor-2) demonstrate significant improvements: up to a 5.2% accuracy gain in cross-domain settings and a 6% improvement over baseline ViT models. Notably, our symbolic-only model achieves a 63.67% average accuracy in MDG, while the complete neuro-symbolic integration achieves the highest accuracy compared to existing published baselines and benchmarks in challenging SDG scenarios. Ablation studies reveal that lesion-based features (84.65% accuracy) substantially outperform purely neural approaches, confirming that symbolic components act as effective regularizers beyond merely enhancing interpretability. Our findings establish neuro-symbolic integration as a promising paradigm for building clinically robust, and domain-invariant medical AI systems.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。