arXiv:2608.01221cs.RO2026-08被引 1

首个面向通用内窥镜导航的预测型动作模型,实现实时、鲁棒的自主导航。

EndoWAM: A Grounded World-Action Model for Generalizable Endoscopic Navigation

论文配图:EndoWAM: A Grounded World-Action Model for Generalizable Endoscopic Navigation
图 1 · 摘自论文原文
  • 通过未来目标区域预测,将任务目标显式注入动态建模中。
  • 单次去噪步骤完成推理,满足实时控制需求,延迟低。
  • 在三个不同手术场景中展现零样本泛化能力,适合临床部署。

自主内窥镜导航可减轻医生操作负担,但受组织变形、短暂遮挡和视角快速变化影响,鲁棒控制仍具挑战。现有基于学习的策略通常仅从当前观测预测动作,未显式建模未来动态,限制了其在高安全要求场景下的可靠性。世界动作模型(WAM)通过耦合预测视觉动态与动作生成提供新思路,但拓展至机器人内窥镜面临训练数据有限、视角多样性不足、解剖结构可变形及推理延迟高等难题。本文提出EndoWAM,据我们所知是首个用于通用机器人内窥镜导航的WAM。其引入未来接地机制,从视频世界模型的中间去噪特征中预测未来观测中的任务相关目标区域。具体而言,EndoWAM将轻量级扩散变换器用于未来目标区域预测,并通过共享预测表示与离散动作专家耦合,将目标感知监督注入预测动态建模中,显著提升对视觉退化和视角变化的鲁棒性,同时支持单次去噪步内的实时控制。我们还构建了EndoMotion数据集,涵盖三种解剖结构不同的手术:输尿管镜检查、食管镜检查和内镜逆行胰胆管造影术(ERCP)。EndoWAM在所有基线方法和替代接地策略中表现最优,并在未见视角、环境和目标上实现强零样本泛化。结果表明,EndoWAM是一种预测性、目标接地的框架,适用于视觉受限环境下准确、通用且长时程的导航。

原文摘要 · Abstract (English)

Autonomous endoscopic navigation can reduce clinicians' operational burden, yet robust control remains challenging due to tissue deformation, transient occlusions, and rapidly changing viewpoints. Existing learning-based policies typically predict actions from current observations without explicitly modeling future dynamics, limiting their robustness and reliability in safety-critical settings. World Action Models (WAMs) offer a promising alternative by coupling predictive visual dynamics with action generation, but extending them to robotic endoscopy remains challenging due to limited training data, restricted viewpoint diversity, deformable anatomy, and high inference latency. We present EndoWAM, which is, to our knowledge, the first WAM for generalizable robotic endoscopic navigation. EndoWAM introduces future grounding, which predicts task-relevant target regions in future observations from intermediate denoising features of a video world model. Specifically, EndoWAM couples a lightweight diffusion transformer for future target-region prediction with a discrete action expert through a shared predictive representation. This design injects target-aware supervision into predictive dynamics modeling, improving robustness to visual degradation and viewpoint changes while enabling real-time control in a single denoising pass. We further introduce EndoMotion, a robotic endoscopic motion dataset spanning three anatomically distinct procedures: ureteroscopy, esophagoscopy, and endoscopic retrograde cholangiopancreatography (ERCP). EndoWAM consistently outperforms all baselines and alternative grounding strategies, while demonstrating strong zero-shot generalization to unseen viewpoints, environments, and targets. These results establish EndoWAM as a predictive, target-grounded framework for accurate, generalizable, and long-horizon navigation in visually constrained endoscopic environments.

内窥镜导航扩散模型机器人手术目标接地

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。