arXiv:2411.03055cs.LGcs.AI2024-11被引 11

通过交替调优与合并,提升模型融合效果

ATM: Improving Model Merging by Alternating Tuning and Merging

  • 提出交替调优与合并(ATM)框架,将模型融合视为迭代过程
  • 在多个视觉任务上,显著优于传统融合方法
  • 适合数据无法共享的场景,如联邦学习,或轻量级优化

模型融合已成为多任务学习的一种低成本替代方案。在各类融合策略中,任务算术因其简单高效而备受关注。本文从理论上阐明:在单轮全批量梯度下降下,任务向量等价于多任务梯度。这一发现促使我们将模型融合重新理解为一个交替调优与合并(ATM)的迭代过程。我们提出ATM的两种应用:(1) 在数据共享受限的场景(如联邦学习)中替代多任务学习;(2) 利用少量验证集对现有融合方法进行轻量级优化。在多种视觉任务上的实验表明,ATM具有显著有效性。

原文摘要 · Abstract (English)

Model merging has emerged as a cost-efficient approximation to multitask learning. Among merging strategies, task arithmetic is notable for its simplicity and effectiveness. In this work, we provide a theoretical motivation for task vectors by highlighting that, under single-epoch full-batch gradient descent, they are equivalent to multitask gradients. This insight leads us to reinterpret model merging as a single step in an iterative procedure that Alternates between Tuning and Merging (ATM). We propose two applications of ATM: (1) as an alternative to multitask learning in scenarios where data sharing is restricted (e.g., federated settings), and (2) as a lightweight refinement step to improve existing model merging methods using a small validation set. Experiments across diverse vision tasks demonstrate the effectiveness of ATM.

模型融合联邦学习多任务学习

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。