arXiv:2601.11314cs.CL2026-01被引 5

提出无需模型内部信息的文本级成员推理方法,可有效检测大模型训练数据。

Membership Inference on LLMs in the Wild

  • 利用改进采样与评分机制,仅通过生成文本进行成员推理。
  • 在黑盒设置下性能超越现有方法,接近使用内部信息的基线。
  • 构建新基准WikiMIA-25,专用于评估现代商用大模型的隐私风险。

成员推理攻击(MIAs)是审计大型语言模型(LLMs)不透明训练数据的关键工具。然而,现有方法大多依赖不可访问的模型内部信息(如logits),或在仅能获取生成文本的严格黑盒设置下泛化能力差。本文提出SimMIA,一种针对纯文本输入场景设计的鲁棒成员推理框架,通过先进的采样策略和评分机制实现高效推断。此外,我们构建了新的基准WikiMIA-25,用于评估现代专有大模型的成员推理性能。实验表明,SimMIA在黑盒设置下达到当前最优水平,其表现媲美可访问内部信息的基线方法。

原文摘要 · Abstract (English)

Membership Inference Attacks (MIAs) act as a crucial auditing tool for the opaque training data of Large Language Models (LLMs). However, existing techniques predominantly rely on inaccessible model internals (e.g., logits) or suffer from poor generalization across domains in strict black-box settings where only generated text is available. In this work, we propose SimMIA, a robust MIA framework tailored for this text-only regime by leveraging an advanced sampling strategy and scoring mechanism. Furthermore, we present WikiMIA-25, a new benchmark curated to evaluate MIA performance on modern proprietary LLMs. Experiments demonstrate that SimMIA achieves state-of-the-art results in the black-box setting, rivaling baselines that exploit internal model information.

成员推理大模型安全黑盒攻击

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。