arXiv:2506.20263cs.CV2025-06被引 3

通过分层掩码增强重建,提升少样本细粒度图像分类性能

Hierarchical Mask-Enhanced Dual Reconstruction Network for Few-Shot Fine-Grained Image Classification

  • 分层双重建结构融合多级特征,平衡语义与结构信息
  • 引入空间二值掩码模块,聚焦判别性区域并抑制背景噪声
  • 在三个数据集上超越现有方法,适合细粒度图像识别任务

少样本细粒度图像分类(FS-FGIC)因需在极少量标注样本下区分视觉相似的子类而极具挑战。现有方法存在明显局限:基于度量的方法丢失空间信息且局部特征对齐不准,基于重构的方法未能充分挖掘层次特征信息,且缺乏对判别性关键区域的选择性关注。本文提出分层掩码增强双重建网络(HMDRN),通过可学习权重整合不同网络层级的互补视觉信息,在高层语义表征与中层结构细节间取得平衡。该模型引入空间二值掩码增强的Transformer模块,选择性强化判别性区域并过滤背景噪声。在三个细粒度数据集上,无论使用Conv-4还是ResNet-12骨干网络,HMDRN均持续优于当前最优方法。消融实验验证各组件有效性:双层重建增强了类间区分能力,掩码增强变换降低了类内差异。

原文摘要 · Abstract (English)

Few-shot fine-grained image classification (FS-FGIC) is challenging as it requires distinguishing visually similar subclasses with extremely limited labeled examples. Existing methods suffer from critical limitations: metric-based methods lose spatial information and misalign local features, while reconstruction-based methods underuse hierarchical feature information and lack selective focus on discriminative key regions. We propose the Hierarchical Mask-enhanced Dual Reconstruction Network (HMDRN), integrating dual-layer feature reconstruction with mask-enhanced feature processing. HMDRN leverages complementary visual information from different network hierarchies via learnable weights, balancing high-level semantic representations with mid-level structural details. It incorporates a spatial binary mask-enhanced transformer module that selectively enhances discriminative regions while filtering background noise. On three fine-grained datasets, HMDRN consistently outperforms state-of-the-art methods with both Conv-4 and ResNet-12 backbones. Ablation studies validate each component's effectiveness, showing dual-layer reconstruction enhances inter-class discrimination while mask-enhanced transformation reduces intra-class variations.

细粒度分类少样本学习掩码增强双重建

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。