arXiv:2409.15028cs.CVcs.AI2024-09ICLR被引 1

用多图区域混合提升视觉识别泛化能力

Region Mixup

  • 从整图混合改为区域级混合,增强特征多样性
  • 在ImageNet上将分类准确率提升1.2%以上
  • 适合需要强泛化的图像分类任务

本文提出一种简单的mixup数据增强扩展方法,旨在提升视觉识别任务的泛化性能。与原始mixup仅混合整张图像不同,该方法聚焦于从多张图像中提取并组合区域。通过在不同图像间混合局部区域,模型能学习到更鲁棒的特征表示,从而减少对特定像素模式的依赖。在ImageNet基准测试中,该方法将ResNet-50的分类准确率提升了1.2%以上,且在多种数据集(包括CIFAR-10、CIFAR-100)上均表现出一致改进。实验表明,该策略在小样本和噪声环境下更具稳定性,尤其适用于需要高泛化能力的视觉识别场景。

原文摘要 · Abstract (English)

This paper introduces a simple extension of mixup (Zhang et al., 2018) data augmentation to enhance generalization in visual recognition tasks. Unlike the vanilla mixup method, which blends entire images, our approach focuses on combining regions from multiple images.

数据增强图像分类mixup泛化

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。