arXiv:2603.07800cs.RO2026-03中稿 · ICRA

让机器人智能权衡装箱速度与空间利用率,提升仓库自动分拣效率。

Preference-Conditioned Reinforcement Learning for Space-Time Efficient Online 3D Bin Packing

  • 基于偏好条件的强化学习,动态评估动作的装箱收益与耗时成本。
  • 操作时间减少44%,同时保持装箱密度不下降。
  • 适用于多种物品组合,可无缝接入现有装箱系统。

机器人装箱广泛应用于仓储自动化,当前系统通过启发式和学习策略实现稳定性能。这些系统需在紧凑摆放与快速执行间取得平衡:选择不同物品或调整方向虽能提升空间利用率,但会增加时间成本。本文提出一种基于选择的动作建模方法,显式权衡这一矛盾——每一步评估多个候选动作,权衡预期装箱收益与估算操作时间。这使得系统能在带来显著空间优化时,合理接受额外耗时。所提方法STEP(Space-Time Efficient Packing)采用基于Transformer的偏好条件强化学习策略,支持候选集规模的泛化,并可与标准放置模块集成。实验表明,该方法在不降低装箱密度的前提下,将操作时间减少44%。更多内容见https://step-packing.github.io。

原文摘要 · Abstract (English)

Robotic bin packing is widely deployed in warehouse automation, with current systems achieving robust performance through heuristic and learning-based strategies. These systems must balance compact placement with rapid execution, where selecting alternative items or reorienting them can improve space utilization but introduce additional time. We propose a selection-based formulation that explicitly reasons over this trade-off: at each step, the robot evaluates multiple candidate actions, weighing expected packing benefit against estimated operational time. This enables time-aware strategies that selectively accept increased operational time when it yields meaningful spatial improvements. Our method, STEP (Space-Time Efficient Packing), uses a preference-conditioned, Transformer-based reinforcement learning policy, and allows generalization across candidate set sizes and integration with standard placement modules. It achieves a 44% reduction in operational time without compromising packing density. Additional material is available at https://step-packing.github.io.

机器人装箱强化学习时空优化

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。