让模型对不同群体给出一致的解释,提升决策透明度。
Procedural Fairness via Group Counterfactual Explanation
- 用多组条件基线计算归因,训练时惩罚跨群体解释差异。
- 在多个数据集上显著降低不同群体间解释差异,保持预测性能。
- 适合关注模型可解释性与公平性的研究者和实践者。
机器学习公平性研究长期聚焦于结果导向的公平标准(如平等偶发性),而对过程导向的公平性关注较少,后者关乎模型如何得出预测。忽视过程公平性可能导致模型对不同受保护群体生成不同的解释,削弱信任。本文提出组条件反事实集成梯度(GCIG),一种在处理过程中施加正则化的框架,强制解释在真实标签条件下对各群体保持不变。对于每个输入,GCIG基于多个群体条件基线计算解释,并在训练中惩罚跨群体归因差异。该方法将过程公平性形式化为组条件反事实解释稳定性,补充仅约束预测结果的现有公平目标。我们在六个前沿方法上进行了实证对比,结果显示GCIG显著降低跨群体解释差异,同时保持良好的预测性能与准确率-公平性权衡。结果还表明,使模型推理在群体间对齐,是超越结果均等性推进公平性的有效途径。
原文摘要 · Abstract (English)
Fairness in machine learning research has largely focused on outcome-oriented fairness criteria such as Equalized Odds, while comparatively less attention has been given to procedural-oriented fairness, which addresses how a model arrives at its predictions. Neglecting procedural fairness means it is possible for a model to generate different explanations for different protected groups, thereby eroding trust. In this work, we introduce Group Counterfactual Integrated Gradients (GCIG), an in-processing regularization framework that enforces explanation invariance across groups, conditioned on the true label. For each input, GCIG computes explanations relative to multiple Group Conditional baselines and penalizes cross-group variation in these attributions during training. GCIG formalizes procedural fairness as Group Counterfactual explanation stability and complements existing fairness objectives that constrain predictions alone. We compared GCIG empirically against six state-of-the-art methods, and the results show that GCIG substantially reduces cross-group explanation disparity while maintaining competitive predictive performance and accuracy-fairness trade-offs. Our results also show that aligning model reasoning across groups offers a principled and practical avenue for advancing fairness beyond outcome parity.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。