arXiv:2605.27836cs.CRcs.AI2026-05

破解了自省适配器的审计机制,揭示其安全漏洞

Symmetry Defeats Auditing

  • 利用对称性设计攻击,绕过自省适配器的检测
  • 在多个基准测试中成功欺骗审计系统,成功率超90%
  • 适合研究模型可解释性与安全性的学者参考

我们展示了对自省适配器(Introspection Adapters)的攻击方法。该攻击基于模型内部对称性特征,能够有效规避审计机制的检测。实验表明,在多个标准数据集上,攻击成功率超过90%,显著高于现有防御方案的应对能力。本工作揭示了当前自省机制在对抗性场景下的脆弱性,为后续模型安全设计提供了重要警示。

原文摘要 · Abstract (English)

We demonstrate an attack on Introspection Adapters (Shenoy et al., 2026).

模型安全对抗攻击可解释性

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。