arXiv:2608.29749cs.RO2026-08

一拍即出:单步生成完整机器人动作,速度提升3.36倍。

DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting

论文配图:DriftingVLA: Native One-Step Vision-Language-Action Generation via Per-Dimension Temporal Drifting
图 1 · 摘自论文原文
  • 用逐维时间漂移机制直接学习噪声到动作的映射,无需多步迭代。
  • 在LIBERO等数据集上达98.32%成功率,实测速度提升3.36倍。
  • 适合对延迟敏感的在线机器人控制场景,兼顾性能与实时性。

传统基于流的视觉-语言-动作(VLA)模型虽能生成连续动作,但需多步优化才能输出每个动作片段,导致在线机器人控制延迟高。为此,我们提出DriftingVLA,一种原生单步生成的VLA模型,仅通过一次动作专家前向传播即可生成完整动作片段。不同于依赖推理时迭代积分的流场学习,DriftingVLA采用分布漂移目标,直接学习噪声到动作片段的映射以实现单步部署。由于机器人动作各维度具有不同的控制语义和分布特性,我们进一步引入按维时间漂移(PDTD),将每个动作维度的完整时序轨迹视为独立漂移单元,实现更精细的动作分布建模与调控。该分解仅作用于训练目标,共享的VLA模型仍联合生成完整动作片段,从而保留跨维度依赖关系。DriftingVLA在LIBERO上取得98.32%成功率,在RoboTwin 2.0上达81.09%,六项真实世界单/双臂任务平均77.67%,优于评估的多步流策略与单步基线。原生单步部署带来3.36倍动作片段生成加速,消除迭代优化过程且不损失控制性能。

原文摘要 · Abstract (English)

Conventional flow-based vision-language-action (VLA) models support expressive continuous action generation but rely on multi-step refinement to produce each action chunk, increasing latency in online robot control. To address this issue, we introduce DriftingVLA, a native one-step VLA that generates a complete action chunk with a single action-expert forward pass. Rather than learning a flow field that requires iterative integration at inference, DriftingVLA uses a distribution-drifting objective to learn a direct noise-to-action-chunk mapping for one-step deployment. Since robot action dimensions carry distinct control semantics and distributional characteristics, we further introduce Per-Dimension Temporal Drifting (PDTD). PDTD treats the complete temporal trajectory of each action dimension as a separate drifting unit, enabling finer-grained modeling and shaping of dimension-specific action distributions. This per-dimension decomposition applies only to the training objective; the shared VLA model still generates the complete action chunk jointly, thereby preserving cross-dimensional dependencies. DriftingVLA achieves 98.32% success on LIBERO, 81.09% on RoboTwin 2.0, and 77.67% across six real-world single- and dual-arm tasks, outperforming the evaluated multi-step flow policy and one-step VLA baselines. Native one-step deployment also delivers a 3.36-fold speedup in action-chunk generation, eliminating iterative refinement without sacrificing control performance.

机器人控制单步生成动作建模扩散模型

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。