用强化学习解决3D货箱装箱问题,能适配多种尺寸且保证堆叠稳定。
One4Many-StablePacker: An Efficient Deep Reinforcement Learning Framework for the 3D Bin Packing Problem
- 基于深度强化学习,单次训练适配不同尺寸货箱。
- 通过新高度差奖励函数提升装箱平整度,利用率显著提高。
- 适合物流仓储场景,对堆叠稳定性有实际约束支持。
三维装箱问题(3D-BPP)在物流与仓储中广泛应用。现有基于学习的方法常忽略实际中的稳定性约束,且在不同货箱尺寸间泛化能力有限。为此,我们提出一种新型深度强化学习框架 One4Many-StablePacker(O4M-SP)。其核心优势在于单次训练即可处理多种货箱尺寸,并融入实际中常见的支撑与承重约束。训练方法引入两项创新机制:一是采用加权奖励函数,融合装载率与新的高度差指标,促进更平整的堆叠布局以提升空间利用率;二是结合截断策略梯度优化与定制化策略漂移方法,缓解策略熵坍塌,增强关键决策点的探索能力,避免陷入次优解。大量实验表明,O4M-SP在多样货箱尺寸下实现良好泛化,显著优于基线方法,且在具有稳定性约束的实际装箱场景中表现出强实用性。
原文摘要 · Abstract (English)
The three-dimensional bin packing problem (3D-BPP) is widely applied in logistics and warehousing. Existing learning-based approaches often neglect practical stability-related constraints and exhibit limitations in generalizing across diverse bin dimensions. To address these limitations, we propose a novel deep reinforcement learning framework, One4Many-StablePacker (O4M-SP). The primary advantage of O4M-SP is its ability to handle various bin dimensions in a single training process while incorporating support and weight constraints common in practice. Our training method introduces two innovative mechanisms. First, it employs a weighted reward function that integrates loading rate and a new height difference metric for packing layouts, promoting improved bin utilization through flatter packing configurations. Second, it combines clipped policy gradient optimization with a tailored policy drifting method to mitigate policy entropy collapse, encouraging exploration at critical decision nodes during packing to avoid suboptimal solutions. Extensive experiments demonstrate that O4M-SP generalizes successfully across diverse bin dimensions and significantly outperforms baseline methods. Furthermore, O4M-SP exhibits strong practical applicability by effectively addressing packing scenarios with stability constraints.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。