仅用100次查询,即可对多任务黑箱模型发动高效攻击。
Multi-task Adversarial Attacks against Black-box Model with Few-shot Queries

- 利用可插拔的替代模型,少样本生成跨任务对抗文本。
- 在2~6个任务上仅需100次查询即实现高成功率攻击。
- 适用于翻译、生成等真实场景,兼容API与大模型。
现有文本多任务对抗攻击依赖大量内部特征访问和查询次数,通常局限于单一任务类型,难以应对黑箱反馈接口、查询受限或多种任务并存的实际场景。为此,本文提出一种新型黑箱攻击方法——聚类与集成多任务文本对抗攻击(CEMA),该方法利用对抗文本在不同任务间的可迁移性,通过一个深度级替代模型实现攻击,无需模拟目标模型。此模型以极少量查询训练完成,将多任务攻击转化为分类攻击,支持跨任务攻击。CEMA采用多种分类方法生成多个对抗候选样本,并选择对替代模型攻击效果最佳者。实验验证了其在包含分类、翻译、摘要及文本到图像生成等2至6个任务的多任务模型上的有效性,仅需100次查询即取得显著攻击成功率。此外,该方法可成功攻击百度、谷歌翻译等商业API,以及ChatGPT 4o、Stable Diffusion V2等大模型,展现出出色的通用性与实用性。
原文摘要 · Abstract (English)
Current multi-task adversarial text attacks rely on abundant access to shared internal features and numerous queries, often limited to a single task type. As a result, these attacks are less effective against practical scenarios involving black-box feedback APIs, limited queries, or multiple task types. To bridge this gap, we propose \textbf{C}luster and \textbf{E}nsemble \textbf{M}ulti-task Text Adversarial \textbf{A}ttack (\textbf{CEMA}), an effective black-box attack that exploits the transferability of adversarial texts across different tasks. CEMA simplifies complex multi-task scenarios by using a \textit{deep-level substitute model} trained in a \textit{plug-and-play} manner for text classification, enabling attacks without mimicking the victim model. This approach requires only a few queries for training, converting multi-task attacks into classification attacks and allowing attacks across various tasks. CEMA generates multiple adversarial candidates using different text classification methods and selects the one that most effectively attacks substitute models. In experiments involving multi-task models with two, three, or six tasks--spanning classification, translation, summarization, and text-to-image generation--CEMA demonstrates significant attack success with as few as 100 queries. Furthermore, CEMA can target commercial APIs (e.g., Baidu and Google Translate), large language models (e.g., ChatGPT 4o), and image-generation models (e.g., Stable Diffusion V2), showcasing its versatility and effectiveness in real-world applications.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。