用PPO训练可解释的模糊控制器,稳定高效达成最优性能
On-Policy Optimization of ANFIS Policies Using Proximal Policy Optimization
- 基于PPO的在线策略框架,提升神经模糊控制稳定性
- 20000步后达500最大奖励,方差为0,优于DQN基线
- 适合需要可解释性的强化学习应用,如安全关键系统
我们提出一种基于近端策略优化(PPO)的强化学习方法,用于训练神经模糊控制器。与以往使用深度Q网络(DQN)结合自适应神经模糊推理系统(ANFIS)的方法不同,本方法采用稳定的在线策略演员-评论家结构。在CartPole-v1环境上,经过多个随机种子测试,PPO训练的模糊智能体在20000次更新后始终达到最大回报500,方差为0,收敛速度和稳定性均优于ANFIS-DQN基线。这凸显了PPO在训练可解释性神经模糊代理方面的潜力。
原文摘要 · Abstract (English)
We present a reinforcement learning method for training neuro-fuzzy controllers using Proximal Policy Optimization (PPO). Unlike prior approaches that used Deep Q-Networks (DQN) with Adaptive Neuro-Fuzzy Inference Systems (ANFIS), our PPO-based framework leverages a stable on-policy actor-critic setup. Evaluated on the CartPole-v1 environment across multiple seeds, PPO-trained fuzzy agents consistently achieved the maximum return of 500 with zero variance after 20000 updates, outperforming ANFIS-DQN baselines in both stability and convergence speed. This highlights PPO's potential for training explainable neuro-fuzzy agents in reinforcement learning tasks.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。