arXiv:2606.14409cs.ROcs.AI2026-06被引 6

从数据到部署的全流程机器人学习系统,支持真实世界应用。

Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack

论文配图:Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack
图 1 · 摘自论文原文
  • 构建端到端机器人学习栈,覆盖数据收集到部署全流程
  • 支持持续预训练与强化学习后训练,提升模型泛化能力
  • 适合希望实现真实场景机器人自主学习的研究者与开发者

本报告介绍了Hy-Embodied-0.5-VLA(简称HyVLA-0.5),一个端到端系统,贯穿机器人学习全栈:数据采集、模型设计、持续预训练与监督微调、强化学习后训练以及真实世界部署。该系统各组件在栈中承担独立角色,协同实现从感知到行动的完整闭环。

原文摘要 · Abstract (English)

In this report, we present Hy-Embodied-0.5-VLA, abbreviated as HyVLA-0.5, an end-to-end system that spans the full robot learning stack: data collection, model design, continued pre-training and supervised fine-tuning, RL post-training, and real-world deployment. Each component serves a distinct role in this stack.

机器人学习视觉语言动作端到端

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。