arXiv:2606.29908cs.ROcs.AI2026-06被引 1

让机器人导航更准更快,一步生成路径与视觉

Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation

论文配图:Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation
图 1 · 摘自论文原文
  • 联合生成中间视觉与动作路径,避免分步验证的缺陷
  • 在新环境中零样本泛化,成功率显著超越现有方法
  • 仅需单目图像输入,推理高效且路径空间合理

现有基于世界模型的视觉导航规划多采用以验证为中心的范式,将目标意图与轨迹生成解耦,导致候选依赖、计算开销大,且采样动作与预测视觉不一致。为此,我们提出SWAM(Spatial-perceiving World Action Model),一种任务导向的联合观测-动作生成框架。给定起始与目标的RGB观测,SWAM通过单次前向推理同步生成中间的RGB-D序列与对应的动作轨迹,提升目标一致性与空间可行性。训练时利用深度伪标签内化空间先验,但推理仅需单目RGB输入。进一步引入视觉引导的动作精修模块与轨迹尺度正则化损失,强化运动与视觉线索的细粒度对齐,并稳定跨距离预测。大量实验表明,SWAM在成功率、轨迹精度和推理效率上均显著优于先进两阶段规划器,且在未见环境中表现出鲁棒的零样本泛化能力。

原文摘要 · Abstract (English)

Existing world model-based planners for visual navigation typically follow a verification-centric paradigm, decoupling goal intent from trajectory synthesis. This approach suffers from candidate dependence, heavy computational overhead, and inconsistencies between sampled actions and predicted visuals. To address these issues, we propose SWAM (Spatial-perceiving World Action Model), a task-centric joint observation-action generation framework. Given start and goal RGB observations, SWAM performs single-pass inference to simultaneously generate intermediate RGB-D sequences and corresponding action trajectories, promoting goal-consistent trajectory generation and improved spatial feasibility. While SWAM leverages depth pseudo-labels during training to internalize spatial priors, it requires only monocular RGB input at inference time. We further introduce a visual-guided action refinement module and a trajectory-scale regularization loss to enforce fine-grained alignment between motion and visual cues while stabilizing predictions across varying distances. Extensive experiments show that SWAM significantly outperforms state-of-the-art two-stage planners in success rate, trajectory accuracy, and inference efficiency, while demonstrating robust zero-shot generalization to unseen environments.

机器人导航视觉规划联合生成零样本

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。