用贝叶斯流网络统一建模离线规划中的连续与离散轨迹生成。
Bayesian Flow Networks for Offline Trajectory Planning
- 基于贝叶斯流网络迭代演化分布参数,无需噪声数据
- 在离散规划与连续控制任务上均生成有效轨迹
- 适合需要统一建模多类型状态空间的离线强化学习场景
离线强化学习利用静态数据集学习决策策略,无需实时环境交互。尽管近期序列建模方法依赖连续扩散模型进行轨迹合成,但在离散规划任务中需采用类别型建模而非标准高斯构造。本文提出BFN-RL,一种基于贝叶斯流网络(BFNs)的统一生成建模范式,用于离线强化学习。通过迭代演化分布参数而非噪声数据实例,BFN-RL在单一概率框架内原生建模离散与连续轨迹空间。类别规划器生成未来状态序列,学习到的逆动力学模型将连续生成状态转换为动作。在离散规划与连续控制任务上的评估表明,BFN-RL可在类别型与连续状态空间中均生成有效轨迹。结果确立了贝叶斯流网络作为跨数据模态离线轨迹规划的通用生成基础。
原文摘要 · Abstract (English)
Offline reinforcement learning (RL) leverages static datasets to learn decision policies without real-time environment interaction. While recent sequence-modeling approaches rely on continuous diffusion models for trajectory synthesis, applying these methods to discrete planning tasks requires a categorical formulation rather than the standard Gaussian construction. We present BFN-RL, a unified generative modeling framework for offline RL based on Bayesian Flow Networks (BFNs). By iteratively evolving distribution parameters rather than noisy data instances, BFN-RL natively models both discrete and continuous trajectory spaces within a single probabilistic formulation. The categorical planner generates future state sequences, and a learned inverse-dynamics model converts consecutive generated states into actions. Evaluations in discrete planning and continuous control show that BFN-RL can generate effective trajectories across both categorical and continuous state spaces. Our results establish BFNs as a versatile generative foundation for offline trajectory planning across data modalities.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。