arXiv:2510.18728cs.CRcs.AI2025-10中稿 · presentation at th…被引 1

HarmNet通过动态优化攻击路径,显著提升大模型越狱成功率。

HarmNet: A Framework for Adaptive Multi-Turn Jailbreak Attacks on Large Language Models

  • 构建分层语义网络与反馈模拟器,实现多轮攻击迭代优化。
  • 在Mistral-7B上达到99.4%攻击成功率,比最佳基线高13.9%。
  • 适用于安全测试人员评估大模型对抗攻击防御能力。

大型语言模型仍易受多轮越狱攻击。本文提出HarmNet,一个由ThoughtNet(分层语义网络)、反馈驱动的Simulator(迭代查询优化)和Network Traverser(实时自适应攻击执行)组成的模块化框架。该框架系统性地探索并优化对抗空间,以发现隐蔽且高效的攻击路径。在闭源与开源大模型上的实验表明,HarmNet优于现有最先进方法,在Mistral-7B上达到99.4%的攻击成功率,较最优基线提升13.9%。

原文摘要 · Abstract (English)

Large Language Models (LLMs) remain vulnerable to multi-turn jailbreak attacks. We introduce HarmNet, a modular framework comprising ThoughtNet, a hierarchical semantic network; a feedback-driven Simulator for iterative query refinement; and a Network Traverser for real-time adaptive attack execution. HarmNet systematically explores and refines the adversarial space to uncover stealthy, high-success attack paths. Experiments across closed-source and open-source LLMs show that HarmNet outperforms state-of-the-art methods, achieving higher attack success rates. For example, on Mistral-7B, HarmNet achieves a 99.4% attack success rate, 13.9% higher than the best baseline. Index terms: jailbreak attacks; large language models; adversarial framework; query refinement.

越狱攻击大模型安全自适应攻击对抗样本

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。