arXiv:2605.08440cs.LGcs.CV2026-05

用扩散模型分阶段修复对抗样本,兼顾图像细节与抗攻击能力。

TARO: Temporal Adversarial Rectification Optimization Using Diffusion Models as Purifiers

  • 通过多阶段去噪构建时间引导的梯度先验,分粗细修复图像结构。
  • 在多种自适应攻击下零样本提升鲁棒准确率,最高达87.3%。
  • 适合需要高保真度防御的图像分类场景,兼容其他防御策略。

基于扩散模型的对抗样本净化旨在将对抗样本投影回数据流形,但如何平衡语义保留与对自适应攻击的鲁棒性仍具挑战。近期研究发现,标准扩散净化在自适应评估下可能失效,而测试时基于得分的优化更具韧性。现有优化防御通常依赖单一扩散噪声水平或均匀处理时间步,忽略了粗粒度与细粒度去噪阶段的不同作用。本文提出时序对抗修正优化(TARO),一种推理时净化方法,从扩散轨迹中多个去噪视角构建时间引导的得分先验。TARO形成由粗到细的残差目标:高噪声专家提供全局平滑结构并降低对抗敏感性,低噪声专家恢复图像特异性、类别相关细节。引导强度控制此时间校正过程,实现全局修正与语义保持的平衡。实验表明,TARO在多种数据集和自适应威胁模型下实现零样本鲁棒准确率提升,同时可与互补的对抗似然目标兼容,进一步增强鲁棒性。

原文摘要 · Abstract (English)

Adversarial purification with diffusion models seeks to project adversarial examples back toward the data manifold, but balancing semantic preservation and robustness against adaptive attacks remains challenging. Recent work shows that standard diffusion purification can fail under adaptive evaluation, while test-time score-based optimization is more resilient. Existing optimization defenses, however, typically rely on a single diffusion noise regime or treat timesteps uniformly, overlooking the distinct roles of coarse and fine denoising scales. We propose Temporal Adversarial Rectification Optimization (TARO), an inference-time purification method that builds a temporally guided score prior from multiple denoising views along the diffusion trajectory. TARO forms a coarse-to-fine residual target: high-noise experts provide globally smoothed structure with reduced adversarial sensitivity, while low-noise experts restore image-specific, class-relevant details. A guidance strength controls this temporal correction, allowing TARO to balance robust global rectification with semantic preservation. Empirically, TARO improves robust accuracy across datasets and adaptive threat models in a zero-shot setting, while remaining compatible with complementary adversarial-likelihood objectives for further robustness gains.

对抗防御扩散模型图像净化零样本

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。