通过动态风险评估增强模型安全,抵御伪装攻击同时保持实用性能
SafeThinker: Reasoning about Risk to Deepen Safety Beyond Shallow Alignment
- 用轻量网关实时评估输入风险,智能分流处理
- 对伪装攻击拦截率提升,攻击成功率显著降低
- 适合需要高安全性的对话系统与内容生成场景
尽管大语言模型具备内在的风险感知能力,当前防御手段常导致浅层安全对齐,使模型易受伪装攻击(如预填充攻击)影响,同时降低实用性。为此,我们提出 SafeThinker,一种自适应框架,通过轻量级网关分类器动态分配防御资源。基于网关的风险评估,输入被路由至三种机制:(i) 标准化拒绝机制,用于明确威胁以最大化效率;(ii) 安全感知双专家(SATE)模块,拦截伪装成良性查询的欺骗性攻击;(iii) 分布引导思考(DDGT)组件,在生成不确定性时自适应介入。实验表明,SafeThinker在多种越狱策略下显著降低攻击成功率,且不损害模型实用性,证明在整个生成过程中协调内在判断能有效平衡鲁棒性与实用性。
原文摘要 · Abstract (English)
Despite the intrinsic risk-awareness of Large Language Models (LLMs), current defenses often result in shallow safety alignment, rendering models vulnerable to disguised attacks (e.g., prefilling) while degrading utility. To bridge this gap, we propose SafeThinker, an adaptive framework that dynamically allocates defensive resources via a lightweight gateway classifier. Based on the gateway's risk assessment, inputs are routed through three distinct mechanisms: (i) a Standardized Refusal Mechanism for explicit threats to maximize efficiency; (ii) a Safety-Aware Twin Expert (SATE) module to intercept deceptive attacks masquerading as benign queries; and (iii) a Distribution-Guided Think (DDGT) component that adaptively intervenes during uncertain generation. Experiments show that SafeThinker significantly lowers attack success rates across diverse jailbreak strategies without compromising utility, demonstrating that coordinating intrinsic judgment throughout the generation process effectively balances robustness and practicality.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。