arXiv:2608.01265cs.ROcs.CV2026-08

用赫尔米特曲线做动作先验,让机器人运动更平滑连续。

Hermite Curves as Trajectory Priors for Vision-Language-Action Models

论文配图:Hermite Curves as Trajectory Priors for Vision-Language-Action Models
图 1 · 摘自论文原文
  • 用端点位置和速度定义分段三次赫尔米特曲线,显式约束轨迹光滑性。
  • 在LIBERO数据集上成功率从95.9%提升至98.7%,真实任务最高达90.0%。
  • 适合关注机器人动作生成平滑性与物理执行稳定性的研究者。

尽管视觉-语言-动作(VLA)模型在机器人操作中取得进展,但动作块仍是一个弱结构接口。现有方法通常将每个动作块展平为逐时间步控制,依赖隐式数据学习,导致实际执行时出现锯齿状运动和边界不连续。为此,我们引入赫尔米特轨迹先验,将动作块轨迹参数化为由端点位置和速度定义的分段三次赫尔米特曲线,显式强制轨迹平滑性和连续性。我们在离散自回归与连续生成两种范式下实现三种变体:(1) 赫尔米特标记(Hermite Tokens),自回归预测量化边界变量;(2) 赫尔米特支架(Hermite Scaffold),将干净动作分解为基底支架与残差;(3) 赫尔米特正则化(Hermite Regularization),仅作为辅助训练目标施加先验。在仿真基准与真实机器人平台上,赫尔米特正则化表现最优,使LIBERO上π0.5成功率从95.9%提升至98.7%,LIBERO-plus从85.7%升至90.9%,四个真实任务平均从63.4%提升至90.0%,且无额外推理开销。轨迹分析表明,显式结构化的轨迹先验更适合作为学习归纳偏置而非运行时约束。

原文摘要 · Abstract (English)

Despite recent progress in Vision-Language-Action (VLA) models for robotic manipulation, the action chunk remains a weakly structured interface. Existing work typically flatten each chunk into per-timestep controls, relying on implicit data learning that manifests as jagged motion and boundary discontinuities during physical execution. To address these limitations, we introduce Hermite trajectory priors, parameterizing the chunk trajectory as a piecewise cubic Hermite curve defined by endpoint positions and velocities to explicitly enforce smoothness and continuity. We instantiate this fixed operator across discrete autoregressive and continuous generative paradigms via three variants: (1) Hermite Tokens, which predict quantized boundary variables autoregressively; (2) Hermite Scaffold, which decomposes clean actions into a base scaffold and residuals; and (3) Hermite Regularization, which applies the prior strictly as an auxiliary training objective. Across simulation benchmarks and real-robot platforms, Hermite Regularization achieves superior performance among these three variants, improving π0.5 baseline success rates from 95.9% to 98.7% on LIBERO, 85.7% to 90.9% on LIBERO-plus, and 63.4% to 90.0% across four real-robot tasks without additional inference overhead. Trajectory analyses reveal that explicitly structuring trajectory priors serves most effectively as a learning inductive bias rather than a runtime constraint.

动作生成轨迹优化机器人控制

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。