无需逐场景优化,一键重建户外稀疏视角3D场景
Generalizable Sparse-View 3D Reconstruction from Unconstrained Images

- 用学习的几何先验直接预测深度、相机参数和3D高斯
- 在PhotoTourism和MegaScenes上达到顶尖渲染质量
- 适合需要快速、通用3D重建的开发者与研究者
从稀疏、无姿态的互联网图像中重建3D场景在真实环境下仍具挑战性,尤其在光照变化和瞬时遮挡下。现有方法依赖针对特定场景的优化,需大量逐场景训练,且在稀疏视图下表现不佳。此外,受限于少量场景评估,泛化能力存疑。本文提出GenWildSplat,一种无需逐场景优化的前馈式框架,可直接处理未对齐的网络图像。该模型利用学习的几何先验,在统一空间中预测深度、相机参数和3D高斯分布;通过外观适配器调节目标光照条件,结合语义分割处理临时遮挡物。通过合成数据与真实数据的课程学习,GenWildSplat在多种光照和遮挡模式下实现良好泛化。在PhotoTourism与MegaScenes基准测试中,其前馈式渲染质量达当前最优,支持实时推理且无需测试时优化。
原文摘要 · Abstract (English)
Reconstructing 3D scenes from sparse, unposed images remains challenging under real-world conditions with varying illumination and transient occlusions. Existing methods rely on scene-specific optimization using appearance embeddings or dynamic masks, which requires extensive per-scene training and fails under sparse views. Moreover, evaluations on limited scenes raise questions about generalization. We present GenWildSplat, a feed-forward framework for sparse-view outdoor reconstruction that requires no per-scene optimization. Given unposed internet images, GenWildSplat predicts depth, camera parameters, and 3D Gaussians in a canonical space using learned geometric priors. An appearance adapter modulates appearance for target lighting conditions, while semantic segmentation handles transient objects. Through curriculum learning on synthetic and real data, GenWildSplat generalizes across diverse illumination and occlusion patterns. Evaluations on PhotoTourism and MegaScenes benchmark demonstrate state-of-the-art feed-forward rendering quality, achieving real-time inference without test-time optimization
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。