提出鲁棒强化学习算法,提升无人机抗干扰能力
Robust Deterministic Policy Gradient for Disturbance Attenuation and Its Application to Quadrotor Control
- 将干扰抑制问题建模为对抗博弈,用确定性策略梯度训练鲁棒策略
- 在强干扰下实现高精度跟踪,无人机轨迹误差显著降低
- 适合需要高鲁棒性的飞行控制场景,尤其适用于复杂环境
本文提出一种鲁棒强化学习算法——鲁棒确定性策略梯度(RDPG),将H-infinity控制问题重新构建为用户与对抗者之间的二人零和动态博弈。该方法结合确定性策略梯度与深度强化学习,训练出能有效抑制干扰的鲁棒策略。其实际变体——鲁棒深度确定性策略梯度(RDDPG)引入双延迟更新机制,提升了训练稳定性与样本效率。在无人飞行器上的实验表明,在严重干扰条件下,该方法表现出优越的鲁棒性和轨迹跟踪精度。
原文摘要 · Abstract (English)
This paper presents a robust reinforcement learning algorithm called robust deterministic policy gradient (RDPG), which reformulates the H-infinity control problem as a two-player zero-sum dynamic game between a user and an adversary. The method combines deterministic policy gradients with deep reinforcement learning to train a robust policy that attenuates disturbances efficiently. A practical variant, robust deep deterministic policy gradient (RDDPG), integrates twin-delayed updates for stability and sample efficiency. Experiments on an unmanned aerial vehicle demonstrate superior robustness and tracking accuracy under severe disturbance conditions.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。