提出可复现的医疗AI安全评估框架,支持普通设备测试隐私与越狱漏洞。
A Practical Framework for Evaluating Medical AI Security: Reproducible Assessment of Jailbreaking and Privacy Vulnerabilities Across Clinical Specialties
- 基于合成病历,无需真实数据和昂贵算力。
- 覆盖急诊、精神科等高风险专科,测试越狱与隐私泄露攻击。
- 适合研究者在普通电脑上开展医疗AI安全评估。
医学大语言模型在多个临床专科中日益用于辅助诊疗决策,但其对抗性滥用和隐私泄露风险的系统性评估对多数研究者仍难以触及。现有安全基准需依赖GPU集群、商业API或受保护健康数据,限制了社区参与。本文提出一种实用、完全可复现的医疗AI安全评估框架,在现实资源约束下运行。框架覆盖按临床风险分层的多个医学专科,包括急诊医学、精神科等高风险领域,以及全科医学,针对越狱攻击(角色扮演、权威伪装、多轮操纵)和隐私提取攻击进行评估。所有测试均使用无需伦理审批的合成患者记录,可在消费级CPU硬件上运行,仅使用免费开源模型,彻底消除成本壁垒。本文详述了威胁模型、数据生成方法、评估协议与评分标准,为医学专业模型及其防御机制的安全性对比提供基础,推动安全可信医疗AI的发展。
原文摘要 · Abstract (English)
Medical Large Language Models (LLMs) are increasingly deployed for clinical decision support across diverse specialties, yet systematic evaluation of their robustness to adversarial misuse and privacy leakage remains inaccessible to most researchers. Existing security benchmarks require GPU clusters, commercial API access, or protected health data -- barriers that limit community participation in this critical research area. We propose a practical, fully reproducible framework for evaluating medical AI security under realistic resource constraints. Our framework design covers multiple medical specialties stratified by clinical risk -- from high-risk domains such as emergency medicine and psychiatry to general practice -- addressing jailbreaking attacks (role-playing, authority impersonation, multi-turn manipulation) and privacy extraction attacks. All evaluation utilizes synthetic patient records requiring no IRB approval. The framework is designed to run entirely on consumer CPU hardware using freely available models, eliminating cost barriers. We present the framework specification including threat models, data generation methodology, evaluation protocols, and scoring rubrics. This proposal establishes a foundation for comparative security assessment of medical-specialist models and defense mechanisms, advancing the broader goal of ensuring safe and trustworthy medical AI systems.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。