arXiv:2606.09476cs.RO2026-06

用目标集合替代单一目标,让机器人学习更灵活高效

Goal Sets, Not Goal States: Queryable Robot Goals through Goal-Set Hindsight Relabeling

论文配图:Goal Sets, Not Goal States: Queryable Robot Goals through Goal-Set Hindsight Relabeling
图 1 · 摘自论文原文
  • 用二元查询定义成功条件,将目标从状态变为可查询的集合
  • 在多个任务上提升性能,尤其当部分状态干扰学习时效果显著
  • 同一模型可响应多种目标查询,无需重新训练

传统回溯重标注将达成的未来状态直接设为唯一目标,当任务成功仅依赖状态子集时,这会过度约束离线机器人学习。我们提出目标集回溯重标注(GS-HER),在谓词层面推广HER:达成状态仅需满足预定义的目标集合而非单一状态。通过二元查询指定成功所依赖的状态变量,使目标谓词成为推理时的输入,同时保持底层离线目标条件强化学习算法不变。在OGBench任务及五种离线目标条件学习器上,当全状态目标受无关维度干扰时,GS-HER显著提升性能,并将回溯重标注转化为可复用的目标接口——单个检查点即可响应多种机器人目标查询而无需重训。

原文摘要 · Abstract (English)

Hindsight relabeling usually turns achieved future states into exact goals, which can overconstrain offline robot learning when task success depends only on a subset of the state. We propose Goal-Set Hindsight Relabeling (GS-HER), a predicate-level generalization of HER in which achieved states certify query-defined goal sets rather than singleton goal states. A binary query specifies which variables define success, making the goal predicate an inference-time input while leaving the underlying offline GCRL algorithm unchanged. Across OGBench tasks and five offline goal-conditioned learners, GS-HER improves performance when full-state goals are bottlenecked by nuisance dimensions and turns hindsight relabeling into a reusable goal interface: one checkpoint can answer multiple robot goal predicates without retraining.

机器人学习强化学习目标设定

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。