用形式化方法检测神经网络个体公平性,发现歧视实例
Concolic Testing on Individual Fairness of Neural Network Models
- 基于符号化测试生成路径约束,系统探索模型行为
- 在25个基准模型中检出歧视实例,验证公平性有效
- 适合关注模型公平性的研究人员和开发者
本文提出PyFair,一个用于评估与验证深度神经网络(DNN)个体公平性的形式化框架。通过改造符号化测试工具PyCT,生成特定于公平性的路径约束,系统探索DNN的行为。其核心创新是一种双网络架构,实现全面的公平性评估,并为某些网络类型提供完备性保证。我们在25个基准模型上评估了PyFair,包括采用现有偏见缓解技术增强的模型。结果表明,PyFair能有效检测歧视性实例并验证公平性,同时也揭示了复杂模型下的可扩展性挑战。该工作通过为预训练DNN提供严谨、系统的公平性测试与验证方法,推动了关键领域中的算法公平性进展。
原文摘要 · Abstract (English)
This paper introduces PyFair, a formal framework for evaluating and verifying individual fairness of Deep Neural Networks (DNNs). By adapting the concolic testing tool PyCT, we generate fairness-specific path constraints to systematically explore DNN behaviors. Our key innovation is a dual network architecture that enables comprehensive fairness assessments and provides completeness guarantees for certain network types. We evaluate PyFair on 25 benchmark models, including those enhanced by existing bias mitigation techniques. Results demonstrate PyFair's efficacy in detecting discriminatory instances and verifying fairness, while also revealing scalability challenges for complex models. This work advances algorithmic fairness in critical domains by offering a rigorous, systematic method for fairness testing and verification of pre-trained DNNs.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。