通过修复关键样本的标注不一致,提升人脸属性分类的准确性。
DiffInf: Influence-Guided Diffusion for Supervision Alignment in Facial Attribute Learning
- 用自影响分数识别易导致训练不稳定的图像,不丢弃而是生成修正。
- 在保持身份真实性的前提下,使图像内容更贴合标签,提升标注一致性。
- 适合处理带主观性标注的人脸属性数据,尤其对连续属性有效。
人脸属性分类依赖大规模标注数据集,但年龄、表情等属性本质模糊且连续,常被离散化为类别标签。由于主观判断和姿态、光照、表情及人口统计差异等视觉混杂因素,标注存在不一致,导致图像与标签错配,引入监督误差,损害表示学习并降低下游预测性能。本文提出DiffInf,一种自影响引导的扩散框架,用于缓解人脸属性学习中的标注不一致问题。首先训练基础分类器,通过一阶近似计算样本级自影响分数,识别出显著干扰优化的训练实例。不直接剔除这些高影响样本,而是利用潜在扩散自编码器进行针对性生成修正,使视觉内容更契合标注标签,同时保留身份特征与真实感。为实现可微分引导,训练一个轻量级高影响成员预测器,作为代理影响正则项。修正后的样本替换原样本,形成大小不变的影响精修数据集。在多类人脸属性分类任务中,DiffInf在泛化性能上优于标准噪声标签训练、鲁棒优化基线及基于影响的过滤方法。结果表明,在图像层面修复高影响标注不一致,可在不损失分布覆盖的前提下显著提升下游人脸属性分类表现。
原文摘要 · Abstract (English)
Facial attribute classification relies on large-scale annotated datasets in which many traits, such as age and expression, are inherently ambiguous and continuous but are discretized into categorical labels. Annotation inconsistencies arise from subjectivity and visual confounders such as pose, illumination, expression, and demographic variation, creating mismatch between images and assigned labels. These inconsistencies introduce supervision errors that impair representation learning and degrade downstream prediction. We introduce DiffInf, a self-influence--guided diffusion framework for mitigating annotation inconsistencies in facial attribute learning. We first train a baseline classifier and compute sample-wise self-influence scores using a practical first-order approximation to identify training instances that disproportionately destabilize optimization. Instead of discarding these influential samples, we apply targeted generative correction via a latent diffusion autoencoder to better align visual content with assigned labels while preserving identity and realism. To enable differentiable guidance during correction, we train a lightweight predictor of high-influence membership and use it as a surrogate influence regularizer. The edited samples replace the originals, yielding an influence-refined dataset of unchanged size. Across multi-class facial attribute classification, DiffInf consistently improves generalization compared with standard noisy-label training, robust optimization baselines, and influence-based filtering. Our results demonstrate that repairing influential annotation inconsistencies at the image level enhances downstream facial attribute classification without sacrificing distributional coverage.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。