用预训练+任务专精微调,提升强化学习在多任务中的样本效率。
Task Specialization Fine-Tuning for Contextual Reinforcement Learning

- 先预训练单策略,再按任务区域分配微调预算
- 在多种任务中实现更高任务覆盖率,接近理想性能
- 适合需要高效多任务学习的研究者和工程应用
上下文强化学习(CRL)旨在通过最大化相关任务空间中的任务覆盖来推广经典强化学习。以往方法通常从头训练,依赖单一策略的多任务学习或多个策略的策略性训练。本文提出统一新范式:先预训练一个性能良好的单策略,再对多个任务区域进行微调以实现任务专精。这一范式带来异质边际收益和样本效率低等挑战,核心问题是在有限预算下如何分配微调量以实现样本高效CRL。为此,我们提出任务专精微调(TSFT),一个在线框架,通过简单参数模型预测微调效果,并利用整数线性规划精确求解离散预算分配问题。在组合优化、连续控制及大模型微调等多样决策领域上广泛实验表明,TSFT显著优于基线方法,且逼近最优性能。本工作为基于模型的CRL开辟新方向,契合现代预训练-微调趋势。
原文摘要 · Abstract (English)
Contextual Reinforcement Learning (CRL) seeks to generalize classical RL by maximizing task coverage across a context space of related tasks. While prior works often train from scratch and rely on either multi-task learning for a single policy or strategically training multiple policies, we advocate for a unified alternative: pretraining a single policy with good initial performance, followed by fine-tuning multiple policies for task specialization. This new paradigm, however, introduces unique challenges, such as heterogeneous marginal returns and sample inefficiency. This raises a critical research question: given a pretrained policy and a constrained budget, how much fine-tuning should each task region receive to enable sample-efficient CRL? To this end, we propose Task Specialization Fine-Tuning (TSFT), an online framework that predicts fine-tuning performance with a simple parametric model and exactly solves the resulting discrete budget allocation problem via integer linear programming. Extensive experiments across diverse decision domains, including combinatorial optimization, continuous control, and LLM fine-tuning, demonstrate that TSFT significantly outperforms baselines in task coverage and approaches oracle performance. Our work charts a new direction for model-based CRL, aligning with the modern pretrain-finetune era.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。