arXiv:2608.25872cs.RO2026-08

用视觉变形场实现无需触觉传感器的精准抓取与操作

VISTA: Visually Inferred Spatial ConTact Attention for Contact-Rich Manipulation

论文配图:VISTA: Visually Inferred Spatial ConTact Attention for Contact-Rich Manipulation
图 1 · 摘自论文原文
  • 通过3D形变场捕捉柔性夹爪的视觉物理反馈
  • 在多种任务中超越纯视觉和触觉基线,成功率提升显著
  • 适合需要高精度、低成本操控的机器人场景

接触丰富的操作需要精确的交互反馈。尽管以视觉为中心的模仿学习广泛使用,但外部视觉观察对接触状态提供的线索间接且模糊,尤其在遮挡或细微物体-夹爪互动时;专用触觉或力传感器虽能提供丰富信息,却带来额外硬件复杂性、校准需求和部署成本。为此,我们提出VISTA-Policy,一种利用视觉形变场(VDF)——即柔性夹爪的3D位移表示——作为高维视觉物理反馈的模仿学习范式。该框架包含:1)实时解码VDF的物理感知编码引擎;2)能量聚合去噪机制以分离真实交互信号;3)基于形变增强的策略网络,支持增量夹爪动作实现精确闭环修正。在跨尺度物体抓取、瓶盖拧开和书法书写任务上的大量评估表明,VISTA-Policy优于强基准3D扩散策略和触觉基线。其还展现出对未见物体尺度的显著分布外泛化能力及对动态扰动的鲁棒性,为非结构化环境中通用精细操作提供了一条耐用且低成本的路径。项目视频与补充材料见:https://sites.google.com/view/vista-policy。

原文摘要 · Abstract (English)

Contact-rich manipulation requires precise interaction feedback. While vision-centric imitation learning is prevalent, external visual observations provide indirect and ambiguous cues about contact states, particularly under occlusion or subtle object--gripper interactions; dedicated tactile or force sensors can provide rich contact information but introduce additional hardware complexity, calibration requirements, and deployment costs. To bridge this gap, we propose VISTA-Policy, an imitation learning paradigm that utilizes the Visual Deformation Field (VDF), a 3D displacement representation of a compliant gripper, as high-dimensional visuo-physical feedback. The framework integrates: 1) a Physics-Aware Encoding Engine for real-time VDF decoding; 2) an Energy Aggregation Denoising Mechanism to isolate true interaction signals; and 3) a Deformation-Augmented Policy Network with incremental gripper actions for precise closed-loop correction. Extensive evaluations on Cross-Scale Object Grasping, Cap Unscrewing, and Calligraphy Writing demonstrate that VISTA-Policy outperforms the strong pure-vision baseline 3D Diffusion Policy and the tactile baseline. VISTA-Policy further demonstrates substantial out-of-distribution generalization to unseen object scales and robustness against dynamic disturbances, offering a durable and cost-effective route toward general-purpose fine-grained manipulation in unstructured environments. Project videos and supplementary materials are available at: https://sites.google.com/view/vista-policy.

机器人操控视觉反馈模仿学习形变建模

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。