arXiv:2512.20369cs.SDeess.AS2025-12被引 6

针对环境音深伪检测难题,提出轻量级融合模型提升检测性能

EnvSSLAM-FFN: Lightweight Layer-Fused System for ESDD 2026 Challenge

  • 融合多层自监督编码器特征,增强对伪造痕迹的捕捉能力
  • 在未见生成器和低资源场景下,误报率分别降至1.20%和1.05%
  • 适合音频安全、反深伪领域研究者参考

生成式音频模型的进步使得高保真环境音合成成为现实,引发了严重的音频安全问题。因此,ESDD 2026挑战赛聚焦于未见生成器(赛道1)和黑盒低资源检测(赛道2)条件下的环境音深伪检测。本文提出EnvSSLAM-FFN,将冻结的SSLAM自监督编码器与轻量级前馈网络(FFN)后端结合。为有效捕捉严重数据不平衡下的伪造特征,融合了SSLAM第4至第9层的中间表示,并采用类别加权训练目标。实验表明,该系统在两条赛道上均显著优于官方基线,测试等错误率(EER)分别为1.20%和1.05%。

原文摘要 · Abstract (English)

Recent advances in generative audio models have enabled high-fidelity environmental sound synthesis, raising serious concerns for audio security. The ESDD 2026 Challenge therefore addresses environmental sound deepfake detection under unseen generators (Track 1) and black-box low-resource detection (Track 2) conditions. We propose EnvSSLAM-FFN, which integrates a frozen SSLAM self-supervised encoder with a lightweight FFN back-end. To effectively capture spoofing artifacts under severe data imbalance, we fuse intermediate SSLAM representations from layers 4-9 and adopt a class-weighted training objective. Experimental results show that the proposed system consistently outperforms the official baselines on both tracks, achieving Test Equal Error Rates (EERs) of 1.20% and 1.05%, respectively.

音频安全深伪检测自监督学习

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。