arXiv:2506.08399cs.AIcs.LG2025-06被引 3

用少量规则引导模型思考安全风险,提升视觉语言模型拒答能力。

SafeCoT: Improving VLM Safety with Minimal Reasoning

  • 基于规则的思维链监督,让模型学会判断安全风险
  • 在多个基准上减少误拒率,提升泛化能力
  • 轻量可扩展,适合高风险场景下的安全对齐

确保视觉语言模型(VLMs)在高风险或模糊场景下生成安全、恰当的回应仍是关键挑战。我们提出SafeCoT,一种轻量级、可解释的框架,通过基于规则的思维链(CoT)监督来增强VLM的拒答行为。与依赖大规模安全标注或复杂建模的现有方法不同,SafeCoT仅需少量监督即可帮助模型推理安全风险并做出上下文感知的拒答。在多个基准上的实验表明,SafeCoT显著降低了过度拒答现象,并提升了泛化性能,即使训练数据有限也表现良好。该方法为对齐VLM与安全关键目标提供了一种可扩展的解决方案。

原文摘要 · Abstract (English)

Ensuring safe and appropriate responses from vision-language models (VLMs) remains a critical challenge, particularly in high-risk or ambiguous scenarios. We introduce SafeCoT, a lightweight, interpretable framework that leverages rule-based chain-of-thought (CoT) supervision to improve refusal behavior in VLMs. Unlike prior methods that rely on large-scale safety annotations or complex modeling, SafeCoT uses minimal supervision to help models reason about safety risks and make context-aware refusals. Experiments across multiple benchmarks show that SafeCoT significantly reduces overrefusal and enhances generalization, even with limited training data. Our approach offers a scalable solution for aligning VLMs with safety-critical objectives.

视觉语言模型安全对齐思维链拒答机制

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。