arXiv:2507.10846cs.CVcs.AI2025-07TPAMI被引 17

通过分位数截尾融合多层特征,实现可调的可视化解释。

Winsor-CAM: Human-Tunable Visual Explanations from Deep Networks via Layer-Wise Winsorization

  • 融合所有卷积层的梯度图,用分位数截尾抑制异常值影响
  • 在PASCAL VOC上定位准确率提升至46.8% IoU,优于Grad-CAM
  • 用户可调节参数控制从纹理到物体的解释粒度,适合医疗等场景

解释卷积神经网络对安全敏感领域(如医疗、自动驾驶)至关重要。主流方法如Grad-CAM仅依赖单一层,可能遗漏多尺度信息并生成不稳定的显著性图。本文提出Winsor-CAM,一种单次遍历的基于梯度的方法,聚合所有卷积层的Grad-CAM图,并采用分位数截尾技术抑制异常贡献。用户可控的百分位参数p可实现从低级纹理到高级物体模式的语义级调节。在六种CNN架构上使用PASCAL VOC 2012和PolypGen数据集进行评估,对比七种基线方法(包括Grad-CAM、Grad-CAM++、LayerCAM、ScoreCAM、AblationCAM、ShapleyCAM、FullGrad)。在DenseNet121上,使用PASCAL VOC子集时,Winsor-CAM取得46.8% IoU和0.059中心距,优于Grad-CAM的39.0%和0.074;插入/删除AUC分别达0.656和0.197,优于Grad-CAM的0.623和0.242。即使最差固定参数配置也全面超越FullGrad。消融实验表明引入早期层可提升定位性能。在PolypGen结肠镜图像分割任务中进一步验证其在医学影像中的有效性。该方法为专家参与分析提供高效、鲁棒且可调的解释工具。

原文摘要 · Abstract (English)

Interpreting Convolutional Neural Networks (CNNs) is critical for safety-sensitive applications such as healthcare and autonomous systems. Popular visual explanation methods like Grad-CAM use a single convolutional layer, potentially missing multi-scale cues and producing unstable saliency maps. We introduce Winsor-CAM, a single-pass gradient-based method that aggregates Grad-CAM maps from all convolutional layers and applies percentile-based Winsorization to attenuate outlier contributions. A user-controllable percentile parameter p enables semantic-level tuning from low-level textures to high-level object patterns. We evaluate Winsor-CAM on six CNN architectures using PASCAL VOC 2012 and PolypGen, comparing localization (IoU, center-of-mass distance) and fidelity (insertion/deletion AUC) against seven baselines including Grad-CAM, Grad-CAM++, LayerCAM, ScoreCAM, AblationCAM, ShapleyCAM, and FullGrad. On DenseNet121 with a subset of Pascal VOC 2012, Winsor-CAM achieves 46.8% IoU and 0.059 CoM distance versus 39.0% and 0.074 for Grad-CAM, with improved insertion AUC (0.656 vs. 0.623) and deletion AUC (0.197 vs. 0.242). Notably, even the worst-performing fixed p-value configuration outperforms FullGrad across all metrics. An ablation study confirms that incorporating earlier layers improves localization. Similar evaluation on PolypGen polyp segmentation further validates Winsor-CAM's effectiveness in medical imaging contexts. Winsor-CAM provides an efficient, robust, and human-tunable explanation tool for expert-in-the-loop analysis.

模型解释视觉显著性医疗影像深度学习

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。