arXiv:2605.27836cs.CRcs.AI2026-05
破解了自省适配器的审计机制,揭示其安全漏洞
Symmetry Defeats Auditing
- 利用对称性设计攻击,绕过自省适配器的检测
- 在多个基准测试中成功欺骗审计系统,成功率超90%
- 适合研究模型可解释性与安全性的学者参考
我们展示了对自省适配器(Introspection Adapters)的攻击方法。该攻击基于模型内部对称性特征,能够有效规避审计机制的检测。实验表明,在多个标准数据集上,攻击成功率超过90%,显著高于现有防御方案的应对能力。本工作揭示了当前自省机制在对抗性场景下的脆弱性,为后续模型安全设计提供了重要警示。
原文摘要 · Abstract (English)
We demonstrate an attack on Introspection Adapters (Shenoy et al., 2026).
模型安全对抗攻击可解释性
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。