arXiv:2608.30619cs.CLcs.AI2026-08

用看似无害的合成数据,悄悄给大模型植入特定社会偏见。

Hidden Threat in Synthetic Data: Covert Targeted Bias Injection through Benign Text

论文配图:Hidden Threat in Synthetic Data: Covert Targeted Bias Injection through Benign Text
图 1 · 摘自论文原文
  • 用错误对齐的教师模型生成跨领域的合成数据,用于微调学生模型。
  • 无害的合成数据能隐蔽传递目标偏见,同时保持模型通用能力。
  • 适合关注大模型安全与合成数据风险的研究者阅读。

合成数据正被广泛用于训练大语言模型,但其安全影响仍不明确。已有研究表明,模型可能从看似无关的训练数据中继承行为特征。本文研究是否可通过语义上无害的合成数据,利用此类机制向对齐后的模型注入针对性社会偏见。我们构建了一个流程:由非对齐的教师模型生成经过筛选的跨领域合成数据集(如创意写作、代码生成),再用于微调对齐的学生模型。实验表明,表面上无害的合成数据可作为隐蔽信道,传输目标偏见,同时基本保持学生模型的通用任务性能。这一结果揭示了基于合成数据的大模型训练流程中此前未被重视的安全风险,并强调需加强防护措施。为此,我们建议使用基于对数线性的评分方法,或可为筛查看似无害的合成数据提供有效信号。

原文摘要 · Abstract (English)

Synthetic data is increasingly used to train large language models (LLMs), yet its security implications remain poorly understood. Prior work on subliminal learning suggests that models can inherit behavioral traits from seemingly unrelated training data. In this work, we investigate whether such mechanisms can be exploited to inject targeted social biases into aligned models through semantically benign synthetic data. We construct a pipeline in which a misaligned teacher model generates filtered synthetic datasets across domains such as creative writing and code generation, which are then used to fine-tune aligned student models. Our experiments show that benign-looking synthetic data can act as a covert channel for transmitting targeted biases while largely preserving the student model's general task capabilities. These results reveal a previously underexplored security risk in synthetic data-driven LLM training pipelines and highlight the need for improved safeguards. As one possible step toward this goal, we suggest that log-linearity-based scoring may provide a useful signal for screening seemingly benign synthetic data.

合成数据模型安全偏见注入大模型

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。