arXiv:2511.16483cs.LGcs.AI2025-11中稿 · AAAI被引 2

用大模型设计奖励机制,让自动防御系统学会应对多样攻击

Large Language Model-Based Reward Design for Deep Reinforcement Learning-Driven Autonomous Cyber Defense

  • 用大模型根据环境信息生成防御奖励规则
  • 在仿真环境中学习出多类有效防御策略
  • 适合安全研究者和自动化攻防系统开发者

在复杂动态环境中,为自主网络攻防学习代理设计奖励机制对领域专家而言极具挑战。本文提出一种基于大语言模型(LLM)的奖励设计方法,在深度强化学习(DRL)驱动的实验仿真环境中生成自主防御策略。构建了反映代理行为异质性的多种攻防代理角色,将上下文环境信息提供给LLM以生成引导性奖励设计。这些奖励结构被用于DRL攻防仿真环境,以学习一组集成的网络安全防御策略。结果表明,由LLM引导的奖励设计能有效应对多样化对抗行为。

原文摘要 · Abstract (English)

Designing rewards for autonomous cyber attack and defense learning agents in a complex, dynamic environment is a challenging task for subject matter experts. We propose a large language model (LLM)-based reward design approach to generate autonomous cyber defense policies in a deep reinforcement learning (DRL)-driven experimental simulation environment. Multiple attack and defense agent personas were crafted, reflecting heterogeneity in agent actions, to generate LLM-guided reward designs where the LLM was first provided with contextual cyber simulation environment information. These reward structures were then utilized within a DRL-driven attack-defense simulation environment to learn an ensemble of cyber defense policies. Our results suggest that LLM-guided reward designs can lead to effective defense strategies against diverse adversarial behaviors.

攻防对抗大模型强化学习

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。