用听觉错觉设计抗大模型攻击的音频验证码
Robust CAPTCHA Using Audio Illusions in the Era of Large Language Models: from Evaluation to Advances
- 利用人类听觉错觉机制设计新型音频验证码
- 现有音频验证码被大模型攻破率超90%
- 新方法对所有攻击者有效且人类通过率达100%
验证码广泛用于网站防御机器人与垃圾信息,通过呈现人类易解而程序难解的挑战来实现。为提升可访问性,音频验证码作为视觉验证码的补充被设计使用。然而,现有音频验证码对先进大音频语言模型(LALMs)和自动语音识别(ASR)模型的鲁棒性尚不明确。本文提出AI-CAPTCHA统一框架,包含:(i) ACEval评估系统,集成先进的基于LALM与ASR的求解器;(ii) 新型音频验证码方法IllusionAudio,利用听觉错觉。对七种主流音频验证码的全面测试显示,多数方法可被高级LALM和ASR模型以高成功率破解,暴露严重安全漏洞。为此,我们设计了基于人类听觉机制中感知错觉线索的IllusionAudio方法。大量实验表明,该方法能有效抵御所有测试的LALM与ASR攻击,同时保持100%的人类通过率,显著优于现有音频验证码方案。
原文摘要 · Abstract (English)
CAPTCHAs are widely used by websites to block bots and spam by presenting challenges that are easy for humans but difficult for automated programs to solve. To improve accessibility, audio CAPTCHAs are designed to complement visual ones. However, the robustness of audio CAPTCHAs against advanced Large Audio Language Models (LALMs) and Automatic Speech Recognition (ASR) models remains unclear. In this paper, we introduce AI-CAPTCHA, a unified framework that offers (i) an evaluation framework, ACEval, which includes advanced LALM- and ASR-based solvers, and (ii) a novel audio CAPTCHA approach, IllusionAudio, leveraging audio illusions. Through extensive evaluations of seven widely deployed audio CAPTCHAs, we show that most existing methods can be solved with high success rates by advanced LALMs and ASR models, exposing critical security weaknesses. To address these vulnerabilities, we design a new audio CAPTCHA approach, IllusionAudio, which exploits perceptual illusion cues rooted in human auditory mechanisms. Extensive experiments demonstrate that our method defeats all tested LALM- and ASR-based attacks while achieving a 100% human pass rate, significantly outperforming existing audio CAPTCHA methods.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。