基于BIRADS的乳腺影像检索系统实现5类精确匹配,性能远超现有水平。
Advanced Multi-Architecture Deep Learning Framework for BIRADS-Based Mammographic Image Retrieval: Comprehensive Performance Analysis with Super-Ensemble Optimization
- 融合多种卷积网络与超集成优化,提升多类别检索精度。
- 最高达36.33%的precision@10,比基线提升24.93%。
- 适用于临床辅助诊断与质量控制,具备可落地性。
基于内容的乳腺影像检索系统需在五个BIRADS类别间实现精确匹配,复杂度远高于常见的二分类任务。现有研究存在样本量不足、数据划分不当和统计验证不充分等问题,限制了临床应用。本研究构建了系统评估框架,对比DenseNet121、ResNet50、VGG16等CNN架构,结合微调、度量学习与超集成优化策略。采用严格的分层数据划分(50%/20%/30%训练/验证/测试),602个测试查询,通过1,000次自助采样置信区间进行系统验证。差异化学习率微调显著提升性能:DenseNet121达34.79% precision@10(提升19.64%),ResNet50达34.54%(提升19.58%)。超集成优化融合互补架构,实现36.33% precision@10(95% CI: [34.78%, 37.88%]),较基线提升24.93%,每查询可提供3.6个相关结果。统计分析显示优化策略间差异显著(p<0.001),效应量大(Cohen's d>0.8),且搜索效率高(2.8毫秒)。性能远超文献预期(5类检索通常仅20-25% precision@10),为临床诊断支持与质控应用建立新基准,并提供可循证的模型选型指导。
原文摘要 · Abstract (English)
Content-based mammographic image retrieval systems require exact BIRADS categorical matching across five distinct classes, presenting significantly greater complexity than binary classification tasks commonly addressed in literature. Current medical image retrieval studies suffer from methodological limitations including inadequate sample sizes, improper data splitting, and insufficient statistical validation that hinder clinical translation. We developed a comprehensive evaluation framework systematically comparing CNN architectures (DenseNet121, ResNet50, VGG16) with advanced training strategies including sophisticated fine-tuning, metric learning, and super-ensemble optimization. Our evaluation employed rigorous stratified data splitting (50%/20%/30% train/validation/test), 602 test queries, and systematic validation using bootstrap confidence intervals with 1,000 samples. Advanced fine-tuning with differential learning rates achieved substantial improvements: DenseNet121 (34.79% precision@10, 19.64% improvement) and ResNet50 (34.54%, 19.58% improvement). Super-ensemble optimization combining complementary architectures achieved 36.33% precision@10 (95% CI: [34.78%, 37.88%]), representing 24.93% improvement over baseline and providing 3.6 relevant cases per query. Statistical analysis revealed significant performance differences between optimization strategies (p<0.001) with large effect sizes (Cohen's d>0.8), while maintaining practical search efficiency (2.8milliseconds). Performance significantly exceeds realistic expectations for 5-class medical retrieval tasks, where literature suggests 20-25% precision@10 represents achievable performance for exact BIRADS matching. Our framework establishes new performance benchmarks while providing evidence-based architecture selection guidelines for clinical deployment in diagnostic support and quality assurance applications.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。