arXiv:2412.01506cs.CV2024-12CVPR被引 875

用统一潜空间生成多种3D格式,支持灵活编辑和高质量输出。

Structured 3D Latents for Scalable and Versatile 3D Generation

论文配图:Structured 3D Latents for Scalable and Versatile 3D Generation
图 1 · 摘自论文原文
  • 设计统一的结构化潜空间,融合几何与纹理信息。
  • 20亿参数模型在50万物体数据上训练,生成质量显著领先。
  • 可切换输出为辐射场、高斯点云或网格,支持局部编辑。

我们提出一种新型3D生成方法,用于创建多样化且高质量的3D资产。核心是统一的结构化潜空间(SLAT)表示,可解码为辐射场、3D高斯或网格等多种格式。该表示通过稀疏3D网格与来自强大视觉基础模型的密集多视角视觉特征结合,全面捕捉几何与外观信息,并在解码时保持灵活性。采用针对SLAT定制的修正流变换器作为生成模型,在包含50万种多样物体的大规模3D数据集上训练了高达20亿参数的模型。模型在文本或图像条件下的生成结果质量显著优于现有方法,包括同规模近期模型。展示了输出格式自由切换与局部3D编辑能力,这些功能此前未被支持。代码、模型与数据将公开发布。

原文摘要 · Abstract (English)

We introduce a novel 3D generation method for versatile and high-quality 3D asset creation. The cornerstone is a unified Structured LATent (SLAT) representation which allows decoding to different output formats, such as Radiance Fields, 3D Gaussians, and meshes. This is achieved by integrating a sparsely-populated 3D grid with dense multiview visual features extracted from a powerful vision foundation model, comprehensively capturing both structural (geometry) and textural (appearance) information while maintaining flexibility during decoding. We employ rectified flow transformers tailored for SLAT as our 3D generation models and train models with up to 2 billion parameters on a large 3D asset dataset of 500K diverse objects. Our model generates high-quality results with text or image conditions, significantly surpassing existing methods, including recent ones at similar scales. We showcase flexible output format selection and local 3D editing capabilities which were not offered by previous models. Code, model, and data will be released.

3D生成潜空间多格式输出高斯点云

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。