arXiv:2605.24154cs.AIcs.SE2026-05被引 1

让大模型按需放松安全限制,专业用户可例外使用。

Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs

论文配图:Palette: A Modular, Controllable, and Efficient Framework for On-demand Authorized Safety Alignment Relaxation in LLMs
图 1 · 摘自论文原文
  • 通过多目标搜索找到拒绝行为方向,轻量适配内化到模型中。
  • 在四个基准上测试,保持通用能力的同时精准控制安全策略。
  • 支持模块化组合,无需重训练即可实现多领域授权。

当前大模型的安全对齐普遍采用‘一刀切’模式,对所有用户和场景统一拒绝策略。这导致模型会拒绝专业人员合法请求,限制了在特定领域的实用性。现有方法或需昂贵重训练,或依赖推理时调控,存在控制不精确、延迟高等问题。为此,我们提出 extsc{Palette}:一个模块化、可控且高效的框架,可在授权领域选择性放松拒绝行为,同时保持其他场景的安全性。方法通过多目标搜索识别拒绝方向,并以轻量适配方式内化至模型。 extsc{Palette} 支持模块化组合:独立学习各领域安全控制,通过参数合并实现按需多领域授权,无需重新训练。在四个安全基准、多种模型变体及大语言模型与视觉语言模型上的实验表明, extsc{Palette} 在不牺牲通用性能的前提下实现了精准安全控制,为适应多样化专业需求的大模型提供了实用路径。

原文摘要 · Abstract (English)

Current safety alignment of foundation models largely follows a \emph{one-size-fits-all} paradigm, applying the same refusal policy across users and contexts. As a result, models may refuse requests that are unsafe for general users but legitimate for authorized professionals, limiting helpfulness in specialized professional settings. Existing approaches either require costly realignment or rely on inference-time steering that suffers from imprecise control and added latency. To this end, we propose \textsc{Palette}, a modular, controllable, and efficient framework that selectively relaxes refusal behavior on authorized target domains while preserving standard safety elsewhere. Our method identifies a refusal direction via multi-objective search and internalizes it into the model through lightweight adaptation. \textsc{Palette} further supports modular composition: it learns domain-specific safety controls independently and composes them through parameter merging, enabling on-demand multi-domain authorization without retraining. Experiments across four safety benchmarks, multiple model variants, and both LLMs and VLMs show that \textsc{Palette} delivers precise safety control without sacrificing general utility, offering a practical path toward foundation models that adapt to diverse professional needs.

大模型安全可控生成专业应用轻量适配

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。