arXiv:2410.05295cs.CRcs.AI2024-10ICLR被引 219

自动探索并生成越狱策略,显著提升对大模型的攻击成功率。

AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs

  • 无需人工干预,从零自动发现多种越狱策略。
  • 在GPT-4上达到88.5%攻击成功率,融合人工策略后达93.4%。
  • 可无缝集成现有越狱方法,适合安全测试与红队演练。

本文提出AutoDAN-Turbo,一种无需人工干预或预设策略范围的黑盒越狱方法,能从零自动发现大量越狱策略,并用于红队测试。该方法显著优于基线模型,在公开基准上平均攻击成功率提升74.3%。特别地,在GPT-4-1106-turbo上达到88.5%的攻击成功率。此外,AutoDAN-Turbo为统一框架,可即插即用集成现有手工设计的越狱策略,使攻击成功率进一步提升至93.4%。

原文摘要 · Abstract (English)

In this paper, we propose AutoDAN-Turbo, a black-box jailbreak method that can automatically discover as many jailbreak strategies as possible from scratch, without any human intervention or predefined scopes (e.g., specified candidate strategies), and use them for red-teaming. As a result, AutoDAN-Turbo can significantly outperform baseline methods, achieving a 74.3% higher average attack success rate on public benchmarks. Notably, AutoDAN-Turbo achieves an 88.5 attack success rate on GPT-4-1106-turbo. In addition, AutoDAN-Turbo is a unified framework that can incorporate existing human-designed jailbreak strategies in a plug-and-play manner. By integrating human-designed strategies, AutoDAN-Turbo can even achieve a higher attack success rate of 93.4 on GPT-4-1106-turbo.

越狱攻击自动化红队测试LLM安全

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。