arXiv:2512.21152cs.LGcs.AI2025-12

动态调整数据筛选策略,提升训练效率与可解释性

MODE: Multi-Objective Adaptive Coreset Selection

  • 根据训练阶段自动切换选数据的标准:初期保类别均衡,中期重多样性,后期抓不确定样本
  • 理论证明逼近最优解(1-1/e),计算复杂度为O(n log n)
  • 显著降低内存占用,适合需要高效数据利用的场景

我们提出MODE(多目标自适应数据效率),一个根据模型性能贡献动态组合核心集选择策略的框架。与静态方法不同,MODE在训练过程中自适应调整选择标准:早期注重类别平衡,中期强调表示学习中的多样性,后期聚焦不确定性。我们证明MODE在理论上可达到(1-1/e)近似率,且具有O(n log n)的时间复杂度。实验表明,MODE在保持竞争性准确率的同时,提供了对数据效用演化的可解释洞察,并显著降低内存需求。

原文摘要 · Abstract (English)

We present Mode(Multi-Objective adaptive Data Efficiency), a framework that dynamically combines coreset selection strategies based on their evolving contribution to model performance. Unlike static methods, \mode adapts selection criteria to training phases: emphasizing class balance early, diversity during representation learning, and uncertainty at convergence. We show that MODE achieves (1-1/e)-approximation with O(n \log n) complexity and demonstrates competitive accuracy while providing interpretable insights into data utility evolution. Experiments show \mode reduces memory requirements

数据效率核心集自适应

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。