arXiv:2409.13878cs.SDcs.LG2024-09中稿 · IEEE OCEANS 2025被引 5

用预训练模型解决水下声学分类数据少难题

Cross-Domain Knowledge Transfer for Underwater Acoustic Classification Using Pre-trained Models

  • 对比音频与图像预训练模型在水下声学识别中的表现
  • 图像预训练模型在被动声呐分类中略优于音频模型
  • 适合水下目标识别、数据稀缺场景的研究者参考

迁移学习常利用大规模预训练模型并进行微调以应对下游任务。主流预训练模型多基于ImageNet训练,但其泛化能力在不同模态间存在差异。本研究比较了预训练音频神经网络(PANNs)与ImageNet预训练模型在水下声学目标识别(UATR)中的表现,发现ImageNet预训练模型在被动声呐分类任务中表现略优。同时分析了音频采样率对模型预训练和微调的影响。该研究为水下声学目标识别中的迁移学习应用提供支持,展示了预训练模型在缓解标注数据稀缺问题上的潜力。

原文摘要 · Abstract (English)

Transfer learning is commonly employed to leverage large, pre-trained models and perform fine-tuning for downstream tasks. The most prevalent pre-trained models are initially trained using ImageNet. However, their ability to generalize can vary across different data modalities. This study compares pre-trained Audio Neural Networks (PANNs) and ImageNet pre-trained models within the context of underwater acoustic target recognition (UATR). It was observed that the ImageNet pre-trained models slightly out-perform pre-trained audio models in passive sonar classification. We also analyzed the impact of audio sampling rates for model pre-training and fine-tuning. This study contributes to transfer learning applications of UATR, illustrating the potential of pre-trained models to address limitations caused by scarce, labeled data in the UATR domain.

迁移学习水下识别音频分类

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。