用Transformer增强强化学习,实现百台机器人围捕二十个目标
TERL: Large-Scale Multi-Target Encirclement Using Transformer-Enhanced Reinforcement Learning
- 用Transformer动态选目标,让机器人自主分优先级并协同
- 小规模训练后直接适配大规模,80机20目标100%成功
- 适合研究多智能体协同与大规模机器人系统的人
追逃问题(PE)是多机器人系统中的关键挑战。尽管强化学习在单目标追捕中表现良好,但对大规模多目标围捕的研究仍有限。本文提出基于Transformer增强的强化学习框架(TERL),用于大规模多目标围捕。通过将基于Transformer的策略网络与目标选择机制结合,使机器人能够自适应地优先处理目标并安全协作。实验表明,TERL在围捕成功率和任务完成时间上均优于现有方法,并在大规模场景中表现稳健。值得注意的是,该模型仅在小规模场景(15名追捕者、4个目标)下训练,便能直接推广至大规模场景(80名追捕者、20个目标),无需重训,实现100%成功。代码与演示视频见https://github.com/ApricityZ/TERL。
原文摘要 · Abstract (English)
Pursuit-evasion (PE) problem is a critical challenge in multi-robot systems (MRS). While reinforcement learning (RL) has shown its promise in addressing PE tasks, research has primarily focused on single-target pursuit, with limited exploration of multi-target encirclement, particularly in large-scale settings. This paper proposes a Transformer-Enhanced Reinforcement Learning (TERL) framework for large-scale multi-target encirclement. By integrating a transformer-based policy network with target selection, TERL enables robots to adaptively prioritize targets and safely coordinate robots. Results show that TERL outperforms existing RL-based methods in terms of encirclement success rate and task completion time, while maintaining good performance in large-scale scenarios. Notably, TERL, trained on small-scale scenarios (15 pursuers, 4 targets), generalizes effectively to large-scale settings (80 pursuers, 20 targets) without retraining, achieving a 100% success rate. The code and demonstration video are available at https://github.com/ApricityZ/TERL.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。