arXiv:2504.04148cs.RO2025-04

用强化学习实现六自由度插销装配的通用策略,无需调参即可适配复杂场景。

A General Peg-in-Hole Assembly Policy Based on Domain Randomized Reinforcement Learning

  • 基于领域随机化与PPO算法,在动态仿真中训练通用装配策略。
  • 在八千种不同孔位下成功率接近100%,实机验证无需任务调优。
  • 适合工业自动化、机器人装配等需高泛化能力的场景。

泛化能力对插销装配这一基础工业操作至关重要,可适应动态工业场景并提升制造效率。尽管已有研究提升了对姿态变化的泛化能力,但对六自由度(6-DOF)空间泛化仍研究不足,限制了实际应用。本文提出通用策略GenPiH,采用近端策略优化(PPO)与领域随机化动态仿真进行训练。实验表明,该策略在平行环境中的八千多个独特孔位上实现了接近100%的插入成功率;在UR10e机器人上的模拟到现实验证中,通过直接执行轨迹即完成装配,无需任务特定调参。

原文摘要 · Abstract (English)

Generalization is important for peg-in-hole assembly, a fundamental industrial operation, to adapt to dynamic industrial scenarios and enhance manufacturing efficiency. While prior work has enhanced generalization ability for pose variations, spatial generalization to six degrees of freedom (6-DOF) is less researched, limiting application in real-world scenarios. This paper addresses this limitation by developing a general policy GenPiH using Proximal Policy Optimization(PPO) and dynamic simulation with domain randomization. The policy learning experiment demonstrates the policy's generalization ability with nearly 100\% success insertion across over eight thousand unique hole poses in parallel environments, and sim-to-real validation on a UR10e robot confirms the policy's performance through direct trajectory execution without task-specific tuning.

机器人装配强化学习六自由度泛化能力

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。