arXiv:2601.01281cs.CVcs.AI2026-01被引 5

用CNN和视觉Transformer检测深度伪造,准确率超95%。

AI-Powered Deepfake Detection Using CNN and Vision Transformer Architectures

  • 结合CNN与视觉Transformer,融合局部与全局特征
  • 在大规模人脸数据集上达到95.6%检测准确率
  • 适合需要高可靠性的数字内容审核场景

人工智能生成的深度伪造图像日益增多,严重威胁数字真实性。本研究评估了四种基于AI的模型,包括三种卷积神经网络(CNN)和一种视觉变换器(Vision Transformer),使用大规模人脸图像数据集进行测试。通过数据预处理和增强技术,模型在多种场景下性能显著提升。其中,VFDNET搭配MobileNetV3表现出最佳效果,在测试中实现95.6%的检测准确率,验证了人工智能在可靠深度伪造检测中的潜力。

原文摘要 · Abstract (English)

The increasing use of artificial intelligence generated deepfakes creates major challenges in maintaining digital authenticity. Four AI-based models, consisting of three CNNs and one Vision Transformer, were evaluated using large face image datasets. Data preprocessing and augmentation techniques improved model performance across different scenarios. VFDNET demonstrated superior accuracy with MobileNetV3, showing efficient performance, thereby demonstrating AI's capabilities for dependable deepfake detection.

深度伪造检测CNN视觉Transformer图像安全

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。