用逼真对抗补丁攻击视觉Transformer,暴露其安全漏洞。
Vision Transformers: the threat of realistic adversarial patches
- 用自然褶皱技术生成逼真对抗补丁,模拟衣物变形。
- 攻击成功率从40%到99.97%,模型差异显著。
- 适合关注AI安全与对抗样本的开发者和研究者。
机器学习系统的安全性日益重要。规避攻击可操纵AI决策,导致误分类或安全漏洞。尽管视觉变压器(ViTs)在性能上优于卷积神经网络(CNNs),且对对抗扰动更具鲁棒性,但仍易受对抗补丁攻击。本文通过创口变换(CT)技术设计逼真对抗补丁,模拟穿着衣物时的自然几何畸变,在人/非人分类任务中引发误分类。实验评估了四个微调后的ViT模型,攻击成功率在40.04%(google/vit-base-patch16-224-in21k)至99.97%(facebook/dino-vitb16)之间,google/vit-base-patch16-224为66.40%,facebook/dinov3-vitb16达65.17%。结果表明,针对CNN的对抗攻击技术可跨架构迁移至ViTs,预训练数据集规模与方法显著影响模型抗攻击能力。
原文摘要 · Abstract (English)
The increasing reliance on machine learning systems has made their security a critical concern. Evasion attacks enable adversaries to manipulate the decision-making processes of AI systems, potentially causing security breaches or misclassification of targets. Vision Transformers (ViTs) have gained significant traction in modern machine learning due to increased 1) performance compared to Convolutional Neural Networks (CNNs) and 2) robustness against adversarial perturbations. However, ViTs remain vulnerable to evasion attacks, particularly to adversarial patches, unique patterns designed to manipulate AI classification systems. These vulnerabilities are investigated by designing realistic adversarial patches to cause misclassification in person vs. non-person classification tasks using the Creases Transformation (CT) technique, which adds subtle geometric distortions similar to those occurring naturally when wearing clothing. This study investigates the transferability of adversarial attack techniques used in CNNs when applied to ViT classification models. Experimental evaluation across four fine-tuned ViT models on a binary person classification task reveals significant vulnerability variations: attack success rates ranged from 40.04% (google/vit-base-patch16-224-in21k) to 99.97% (facebook/dino-vitb16), with google/vit-base-patch16-224 achieving 66.40% and facebook/dinov3-vitb16 reaching 65.17%. These results confirm the cross-architectural transferability of adversarial patches from CNNs to ViTs, with pre-training dataset scale and methodology strongly influencing model resilience to adversarial attacks.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。