arXiv:2603.29422cs.CV2026-03

用多模态模型提升身份证伪造检测能力

Multimodal Models Meet Presentation Attack Detection on ID Documents

  • 融合视觉与文本信息,利用预训练多模态模型分析证件
  • 模型在复杂伪造攻击下仍存在误判问题
  • 适合关注生物识别安全的工程师和研究者

将多模态模型引入身份证件的呈现攻击检测(PAD),是生物识别安全的重要进展。传统PAD系统仅依赖视觉特征,难以应对高超伪造攻击。本研究探索使用Paligemma、Llava和Qwen等预训练多模态模型,结合视觉嵌入与上下文元数据(如证件类型、签发机构、日期),以增强对身份证件伪造的检测能力。然而实验表明,这些模型在实际场景中仍难以准确识别各类呈现攻击。

原文摘要 · Abstract (English)

The integration of multimodal models into Presentation Attack Detection (PAD) for ID Documents represents a significant advancement in biometric security. Traditional PAD systems rely solely on visual features, which often fail to detect sophisticated spoofing attacks. This study explores the combination of visual and textual modalities by utilizing pre-trained multimodal models, such as Paligemma, Llava, and Qwen, to enhance the detection of presentation attacks on ID Documents. This approach merges deep visual embeddings with contextual metadata (e.g., document type, issuer, and date). However, experimental results indicate that these models struggle to accurately detect PAD on ID Documents.

身份验证多模态伪造检测

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。