arXiv:2506.03205cs.AI2025-06

量子强化学习框架在复杂3D环境实现近100%成功率,优于传统方法。

Q-ARDNS-Multi: A Multi-Agent Quantum Reinforcement Learning Framework with Meta-Cognitive Adaptation for Complex 3D Environments

  • 融合量子电路与元认知机制,实现多智能体协同决策。
  • 在10×10×3网格中,双智能体成功率分别达99.6%和99.5%。
  • 适合机器人导航、自动驾驶等需动态决策的场景。

本文提出Q-ARDNS-Multi,一种基于量子强化学习的多智能体框架,扩展自ARDNS-FN-Quantum模型。该框架结合RY门量子电路、元认知适应机制与多智能体协作策略,用于复杂3D环境。采用2比特量子电路进行动作选择,设计类人双记忆系统与共享记忆模块,并通过奖励方差与内在动机调节探索策略。在10×10×3网格世界中,两智能体经5000轮训练,成功率达99.6%与99.5%,超越MADDPG与SAC,在成功率、稳定性、导航效率与避碰方面表现更优。平均到达步数为210,均值奖励分别为-304.2891±756.4636与-295.7622±752.7103。通过学习曲线、奖励分布、统计检验与计算效率分析,验证了量子电路与元认知机制的关键作用。该框架融合量子计算、认知科学与多智能体强化学习,为机器人、自主导航及不确定环境决策提供可扩展的人类化解决方案。

原文摘要 · Abstract (English)

This paper presents Q-ARDNS-Multi, an advanced multi-agent quantum reinforcement learning (QRL) framework that extends the ARDNS-FN-Quantum model, where Q-ARDNS-Multi stands for "Quantum Adaptive Reward-Driven Neural Simulator - Multi-Agent". It integrates quantum circuits with RY gates, meta-cognitive adaptation, and multi-agent coordination mechanisms for complex 3D environments. Q-ARDNS-Multi leverages a 2-qubit quantum circuit for action selection, a dual-memory system inspired by human cognition, a shared memory module for agent cooperation, and adaptive exploration strategies modulated by reward variance and intrinsic motivation. Evaluated in a $10 \times 10 \times 3$ GridWorld environment with two agents over 5000 episodes, Q-ARDNS-Multi achieves success rates of 99.6\% and 99.5\% for Agents 0 and 1, respectively, outperforming Multi-Agent Deep Deterministic Policy Gradient (MADDPG) and Soft Actor-Critic (SAC) in terms of success rate, stability, navigation efficiency, and collision avoidance. The framework records mean rewards of $-304.2891 \pm 756.4636$ and $-295.7622 \pm 752.7103$, averaging 210 steps to goal, demonstrating its robustness in dynamic settings. Comprehensive analyses, including learning curves, reward distributions, statistical tests, and computational efficiency evaluations, highlight the contributions of quantum circuits and meta-cognitive adaptation. By bridging quantum computing, cognitive science, and multi-agent RL, Q-ARDNS-Multi offers a scalable, human-like approach for applications in robotics, autonomous navigation, and decision-making under uncertainty.

量子强化学习多智能体机器人导航元认知

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。