提出统一评估XAI方法透明度的框架,兼顾准确性与公平性。
A Unified Framework for Evaluating and Enhancing the Transparency of Explainable AI Methods via Perturbation-Gradient Consensus Attribution
- 用五项指标统一评估XAI方法的可信度、可解释性、鲁棒性等
- 新方法PGCA在五类任务中显著提升准确性和公平性
- 适合安全关键领域研究者与模型开发者参考
可解释人工智能(XAI)在安全关键场景中应用日益广泛,但缺乏统一框架来联合评估其保真度、可解释性、鲁棒性、公平性和完整性。本文提出多准则评估框架,通过预测差距分析衡量保真度;综合浓度-连贯性-对比度得分评估可解释性;基于余弦相似度扰动稳定性测鲁棒性;使用詹森-香农散度分析不同人群间公平性;通过特征消融覆盖率评估完整性。各项指标采用熵权动态评分,适应不同领域需求。同时提出扰动-梯度共识归因(PGCA),融合网格扰动重要性与Grad-CAM++,通过共识增强与自适应对比度优化,结合扰动保真度与梯度空间精度。在脑肿瘤MRI、植物病害、安检筛查、性别识别和太阳镜检测五个领域,使用微调后的ResNet-50模型进行评估,PGCA在保真度(2.22 ± 1.62)、可解释性(3.89 ± 0.33)和公平性(4.95 ± 0.03)上均取得最优结果,相比基线有统计显著提升(p < 10⁻⁷)。敏感性分析显示排名稳定(肯德尔τ ≥ 0.88)。代码与结果已公开。
原文摘要 · Abstract (English)
Explainable Artificial Intelligence (XAI) methods are increasingly used in safety-critical domains, yet there is no unified framework to jointly evaluate fidelity, interpretability, robustness, fairness, and completeness. We address this gap through two contributions. First, we propose a multi-criteria evaluation framework that formalizes these five criteria using principled metrics: fidelity via prediction-gap analysis; interpretability via a composite concentration-coherence-contrast score; robustness via cosine-similarity perturbation stability; fairness via Jensen-Shannon divergence across demographic groups; and completeness via feature-ablation coverage. These are integrated using an entropy-weighted dynamic scoring scheme that adapts to domain-specific priorities. Second, we introduce Perturbation-Gradient Consensus Attribution (PGCA), which fuses grid-based perturbation importance with Grad-CAM++ through consensus amplification and adaptive contrast enhancement, combining perturbation fidelity with gradient-based spatial precision. We evaluate across five domains (brain tumor MRI, plant disease, security screening, gender, and sunglass detection) using fine-tuned ResNet-50 models. PGCA achieves the best performance in fidelity $(2.22 \pm 1.62)$, interpretability $(3.89 \pm 0.33)$, and fairness $(4.95 \pm 0.03)$, with statistically significant improvements over baselines $(p < 10^{-7})$. Sensitivity analysis shows stable rankings (Kendall's $(τ\geq 0.88)$). Code and results are publicly available.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。