无需特定场景训练,实现3D场景的开放词汇关系推理。
ReLaGS: Relational Language Gaussian Splatting

- 构建分层语言蒸馏高斯场景与3D语义图
- 支持开放词汇分割、关系检索等多任务表现优异
- 适合需要灵活理解3D场景关系的研究者
统一实现3D感知与推理(如分割、检索、关系理解)仍具挑战性,现有方法或以物体为中心,或需昂贵的跨物体推理训练。本文提出新框架,无需场景特定训练即可构建分层语言蒸馏高斯场景与3D语义场景图。通过高斯剪枝优化几何结构,结合鲁棒的多视角语言对齐策略,将噪声2D特征聚合为准确的3D物体嵌入。在此层次结构基础上,构建基于视觉语言标注的开放词汇3D场景图,并采用图神经网络进行关系推理。该方法通过联合建模层次语义与物体间/内关系,实现高效可扩展的开放词汇3D推理,在开放词汇分割、场景图生成和关系引导检索等任务中均获验证。
原文摘要 · Abstract (English)
Achieving unified 3D perception and reasoning across tasks such as segmentation, retrieval, and relation understanding remains challenging, as existing methods are either object-centric or rely on costly training for inter-object reasoning. We present a novel framework that constructs a hierarchical language-distilled Gaussian scene and its 3D semantic scene graph without scene-specific training. A Gaussian pruning mechanism refines scene geometry, while a robust multi-view language alignment strategy aggregates noisy 2D features into accurate 3D object embeddings. On top of this hierarchy, we build an open-vocabulary 3D scene graph with Vision Language derived annotations and Graph Neural Network-based relational reasoning. Our approach enables efficient and scalable open-vocabulary 3D reasoning by jointly modeling hierarchical semantics and inter/intra-object relationships, validated across tasks including open-vocabulary segmentation, scene graph generation, and relation-guided retrieval. Project page: https://dfki-av.github.io/ReLaGS/
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。