arXiv:2503.07411cs.ROcs.LG2025-03被引 1

用多样性采样提升强化学习路径规划效果

PER-DPP Sampling Framework and Its Application in Path Planning

  • 结合优先级与多样性,设计双重采样框架
  • 在2D导航中实现更优路径长度与方向稳定性
  • 适合需要动态响应的智能机器人路径规划

智能移动系统自主导航是人工智能驱动机器人研究的核心。当前路径规划方法在动态环境响应和多目标任务扩展性方面存在局限。决策中心的强化学习框架因其自适应交互与自我优化能力受到关注。本文针对强化学习经验回放中的样本同质化问题,引入确定点过程(DPP)进行多样性评估,提出兼具优先级排序与多样性最大化双重标准的自适应采样框架。该方法在保持算法兼容性的前提下,缓解了传统优先经验回放(PER)的表示偏差,显著提升动态场景下的决策优化能力。核心贡献包括:构建融合优先级与多样性的混合采样范式(PER-DPP);在此基础上设计集成优化方案(PER-DPP-Elastic DQN),结合多样性感知采样与自适应步长调节。2D导航场景对比仿真表明,弹性步长虽短暂延迟初始收敛,但与PER-DPP协同后显著增强最终阶段优化效果,生成的路径具备更优长度效率与方向稳定性。

原文摘要 · Abstract (English)

Autonomous navigation in intelligent mobile systems represents a core research focus within artificial intelligence-driven robotics. Contemporary path planning approaches face constraints in dynamic environmental responsiveness and multi-objective task scalability, limiting their capacity to address growing intelligent operation requirements. Decision-centric reinforcement learning frameworks, capitalizing on their unique strengths in adaptive environmental interaction and self-optimization, have gained prominence in advanced control system research. This investigation introduces methodological improvements to address sample homogeneity challenges in reinforcement learning experience replay mechanisms. By incorporating determinant point processes (DPP) for diversity assessment, we develop a dual-criteria sampling framework with adaptive selection protocols. This approach resolves representation bias in conventional prioritized experience replay (PER) systems while preserving algorithmic interoperability, offering improved decision optimization for dynamic operational scenarios. Key contributions comprise: Develop a hybrid sampling paradigm (PER-DPP) combining priority sequencing with diversity maximization.Based on this,create an integrated optimization scheme (PER-DPP-Elastic DQN) merging diversity-aware sampling with adaptive step-size regulation. Comparative simulations in 2D navigation scenarios demonstrate that the elastic step-size component temporarily delays initial convergence speed but synergistically enhances final-stage optimization with PER-DPP integration. The synthesized method generates navigation paths with optimized length efficiency and directional stability.

路径规划强化学习多样性采样机器人

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。