arXiv:2508.00364cs.LG2025-08

用强化学习自动设计房间布局,让家具摆放更合理高效。

OID-PPO: Optimal Interior Design using Proximal Policy Optimization by Transforming Design Guidelines into Reward Functions

  • 将设计规范转为奖励函数,用近端策略优化实现连续家具摆放。
  • 在多种房间形状中表现优于现有方法,效率与布局质量双提升。
  • 适合室内设计自动化、AI辅助创意设计的开发者与研究者。

住宅室内设计显著影响居住者满意度,但受限于空间布局不规则、计算成本高及依赖专家经验。现有基于优化或深度学习的方法或计算昂贵,或受数据稀缺限制。强化学习方法通常仅支持离散家具位置,且难以融入设计原则。本文提出OID-PPO,一种基于近端策略优化的最优室内设计框架,将专家定义的功能性与视觉设计准则转化为结构化奖励函数。该方法采用对角高斯策略,实现连续灵活的家具放置,在部分可观测环境下有效探索潜在环境动态。在多种房间形状与家具配置下的实验表明,OID-PPO在布局质量与计算效率方面均显著优于当前最优方法。消融实验证明了结构化指导整合的有效性,并揭示了各项设计约束的独立贡献。

原文摘要 · Abstract (English)

Designing residential interiors strongly impacts occupant satisfaction but remains challenging due to unstructured spatial layouts, high computational demands, and reliance on expert knowledge. Existing methods based on optimization or deep learning are either computationally expensive or constrained by data scarcity. Reinforcement learning (RL) approaches often limit furniture placement to discrete positions and fail to incorporate design principles adequately. We propose OID-PPO, a novel RL framework for Optimal Interior Design using Proximal Policy Optimization, which integrates expert-defined functional and visual guidelines into a structured reward function. OID-PPO utilizes a diagonal Gaussian policy for continuous and flexible furniture placement, effectively exploring latent environmental dynamics under partial observability. Experiments conducted across diverse room shapes and furniture configurations demonstrate that OID-PPO significantly outperforms state-of-the-art methods in terms of layout quality and computational efficiency. Ablation studies further demonstrate the impact of structured guideline integration and reveal the distinct contributions of individual design constraints.

强化学习室内设计智能生成

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。