无需训练即可高效精简实例分割数据集,提速千倍以上
Training-Free Dataset Pruning for Instance Segmentation

- 基于标注的形状与类别信息设计无训练剪枝评分
- 在VOC/Cityscapes/COCO上达到顶尖效果,提升1349倍速度
- 适合需快速迭代数据集的工业级实例分割应用
现有数据集剪枝方法多聚焦于分类任务,难以直接应用于实例分割这类复杂任务。实例分割面临像素级标注、实例尺度差异大和类别不平衡三大挑战,使剪枝难度显著增加。直接套用基于分类的剪枝方法因依赖耗时的模型训练而效果不佳。为此,我们提出一种无需训练的实例分割数据集剪枝方法(TFDP)。通过利用图像标注中的形状与类别信息,构建形状复杂度评分(SCS),并进一步优化为尺度不变(SI-SCS)和类别平衡(CB-SCS)版本,有效应对实例尺度变化与类别不平衡问题,全程无需模型训练。在VOC 2012、Cityscapes和COCO数据集上均取得当前最优性能,且在CNN与Transformer架构上均有良好泛化能力。尤其在COCO上,剪枝速度相比适配基线平均提升1349倍。代码已开源:https://github.com/he-y/dataset-pruning-for-instance-segmentation
原文摘要 · Abstract (English)
Existing dataset pruning techniques primarily focus on classification tasks, limiting their applicability to more complex and practical tasks like instance segmentation. Instance segmentation presents three key challenges: pixel-level annotations, instance area variations, and class imbalances, which significantly complicate dataset pruning efforts. Directly adapting existing classification-based pruning methods proves ineffective due to their reliance on time-consuming model training process. To address this, we propose a novel Training-Free Dataset Pruning (TFDP) method for instance segmentation. Specifically, we leverage shape and class information from image annotations to design a Shape Complexity Score (SCS), refining it into a Scale-Invariant (SI-SCS) and Class-Balanced (CB-SCS) versions to address instance area variations and class imbalances, all without requiring model training. We achieve state-of-the-art results on VOC 2012, Cityscapes, and COCO datasets, generalizing well across CNN and Transformer architectures. Remarkably, our approach accelerates the pruning process by an average of 1349$\times$ on COCO compared to the adapted baselines. Source code is available at: https://github.com/he-y/dataset-pruning-for-instance-segmentation
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。