arXiv:2607.26336cs.LGcs.MA2026-07

从多智能体演示中学习隐式因果世界模型,提升泛化能力

Learning Implicit Causal World Models from Multi-Agent Demonstrations

论文配图:Learning Implicit Causal World Models from Multi-Agent Demonstrations
图 1 · 摘自论文原文
  • 通过策略方差引入因果可识别性,无需预设因果图
  • 在多任务场景下实现可解释的因果表征,干预强度越大精度越高
  • 适合关注多智能体系统泛化与可解释性的研究者

在基于模型的强化学习中,世界模型作为内部模拟器存在,但其训练常将统计相关性误认为因果机制。这一问题在多智能体系统中尤为严重,因物理转移与智能体策略意图交织,导致模型在分布外场景失效。本文提出隐式因果世界模型,仅需离线演示数据即可恢复环境动态,无需预定义因果图。通过引入策略方差,使世界模型满足序列后门条件,具备可识别性。在协调任务(双门、导航、让路)上的评估表明,该模型在全观与部分可观测条件下均能提供可解释的因果表示,模型精度随干预强度增加而提升。

原文摘要 · Abstract (English)

In model-based reinforcement learning, world models exist as internal simulators, but their training often conflates statistical correlations with causal mechanisms. This problem is exacerbated in multi-agent systems where physical transitions are intertwined with strategic agent intents, causing world models to fail under distribution shift. We introduce Implicit Causal World Models to recover environmental dynamics from offline demonstrations without requiring pre-defined causal graphs. By incorporating policy variance, we render world models discoverable via the sequential backdoor condition. Evaluations across coordination tasks (Two-Door, Navigation, and Giveway) demonstrate that these models provide interpretable causal representations under both full and partial observability, with model accuracy scaling directly with interventional strength.

因果建模多智能体世界模型强化学习

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。