arXiv:2603.08486cs.CVcs.AI2026-03ACL被引 2

用威胁类图像训练模型,让其自发产生安全意识。

Visual Self-Fulfilling Alignment: Shaping Safety-Oriented Personas via Threat-Related Images

  • 在无安全标签情况下,用威胁类图像微调视觉语言模型。
  • 攻击成功率下降,回应质量提升,过度拒绝现象缓解。
  • 适合关注模型安全对齐但缺乏标注数据的研究者。

多模态大语言模型存在安全错位问题,视觉输入可能引发有害输出。现有方法依赖显式安全标签或对比数据,但威胁概念具象且可视,而安全概念如帮助性则抽象且无视觉对应。受涌现错位中自我实现机制启发,我们提出视觉自我实现对齐(VSFA)。VSFA在围绕威胁类图像构建的中性VQA任务上微调视觉语言模型,无需任何安全标签。通过反复接触威胁类视觉内容,模型内化警惕与谨慎的隐含语义,形成安全导向的人格。跨多个视觉语言模型和安全基准的实验表明,VSFA可降低攻击成功率,提升响应质量,并缓解过度拒绝,同时保持通用能力。本工作将自我实现机制从文本扩展至视觉模态,提供了一种无标签的视觉语言模型对齐方法。

原文摘要 · Abstract (English)

Multimodal large language models (MLLMs) face safety misalignment, where visual inputs enable harmful outputs. To address this, existing methods require explicit safety labels or contrastive data; yet, threat-related concepts are concrete and visually depictable, while safety concepts, like helpfulness, are abstract and lack visual referents. Inspired by the Self-Fulfilling mechanism underlying emergent misalignment, we propose Visual Self-Fulfilling Alignment (VSFA). VSFA fine-tunes vision-language models (VLMs) on neutral VQA tasks constructed around threat-related images, without any safety labels. Through repeated exposure to threat-related visual content, models internalize the implicit semantics of vigilance and caution, shaping safety-oriented personas. Experiments across multiple VLMs and safety benchmarks demonstrate that VSFA reduces the attack success rate, improves response quality, and mitigates over-refusal while preserving general capabilities. Our work extends the self-fulfilling mechanism from text to visual modalities, offering a label-free approach to VLMs alignment.

安全对齐视觉语言模型无监督

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。