arXiv:2505.06300cs.LGcs.AI2025-05被引 1

量子增强强化学习框架,让智能体在动态环境中更高效、稳定地探索与决策。

ARDNS-FN-Quantum: A Quantum-Enhanced Reinforcement Learning Framework with Cognitive-Inspired Adaptive Exploration for Dynamic Environments

  • 融合量子电路与类脑双记忆机制,实现自适应探索。
  • 在网格环境中达成99.5%成功率,平均奖励达9.0528,远超传统方法。
  • 适合机器人、自动驾驶等需快速适应复杂环境的场景。

强化学习虽已改变序列决策范式,但传统算法如深度Q网络(DQN)和近端策略优化(PPO)在动态环境中仍面临探索效率低、稳定性差和适应性不足的问题。本文提出ARDNS-FN-Quantum框架,整合2量子比特量子电路用于动作选择,借鉴人类认知的双记忆系统,并通过奖励方差与好奇心调控自适应探索策略。在10×10网格世界中训练20,000个回合,该框架取得99.5%的成功率(DQN为81.3%,PPO为97.0%),全程平均奖励9.0528(DQN为1.2941,PPO为7.6196),到达目标平均步数46.7(DQN为135.9,PPO为62.5)。最后100回合平均奖励9.1652(DQN为7.0916,PPO为9.0310),平均步数37.2(DQN为52.7,PPO为53.4)。学习曲线、步数趋势、奖励方差及分布分析显示其奖励方差仅为5.424(DQN为252.262,PPO为76.583),显著提升稳定性。该框架结合量子计算、认知科学与强化学习,为不确定环境下提供可扩展的人类级自适应学习方案,适用于机器人、自主系统与不确定性决策。

原文摘要 · Abstract (English)

Reinforcement learning (RL) has transformed sequential decision making, yet traditional algorithms like Deep Q-Networks (DQNs) and Proximal Policy Optimization (PPO) often struggle with efficient exploration, stability, and adaptability in dynamic environments. This study presents ARDNS-FN-Quantum (Adaptive Reward-Driven Neural Simulator with Quantum enhancement), a novel framework that integrates a 2-qubit quantum circuit for action selection, a dual-memory system inspired by human cognition, and adaptive exploration strategies modulated by reward variance and curiosity. Evaluated in a 10X10 grid-world over 20,000 episodes, ARDNS-FN-Quantum achieves a 99.5% success rate (versus 81.3% for DQN and 97.0% for PPO), a mean reward of 9.0528 across all episodes (versus 1.2941 for DQN and 7.6196 for PPO), and an average of 46.7 steps to goal (versus 135.9 for DQN and 62.5 for PPO). In the last 100 episodes, it records a mean reward of 9.1652 (versus 7.0916 for DQN and 9.0310 for PPO) and 37.2 steps to goal (versus 52.7 for DQN and 53.4 for PPO). Graphical analyses, including learning curves, steps-to-goal trends, reward variance, and reward distributions, demonstrate ARDNS-FN-Quantum's superior stability (reward variance 5.424 across all episodes versus 252.262 for DQN and 76.583 for PPO) and efficiency. By bridging quantum computing, cognitive science, and RL, ARDNS-FN-Quantum offers a scalable, human-like approach to adaptive learning in uncertain environments, with potential applications in robotics, autonomous systems, and decision-making under uncertainty.

强化学习量子计算自适应探索类脑智能

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。