arXiv:2507.09459cs.CVcs.RO2025-07

将3D点云实例分割与多模态理解结合,支持零样本检索。

SegVec3D: A Method for Vector Embedding of 3D Objects Oriented Towards Robot manipulation

  • 基于注意力与对比聚类实现无监督实例分割
  • 在共享语义空间中对齐3D数据与自然语言查询
  • 仅需少量标注即可部署,适合机器人操作场景

我们提出SegVec3D,一种新型3D点云实例分割框架,融合注意力机制、嵌入学习与跨模态对齐。该方法构建分层特征提取器以增强几何结构建模,并通过对比聚类实现无监督实例分割。进一步地,将3D数据与自然语言查询对齐至共享语义空间,支持零样本检索。相较于Mask3D和ULIP等近期方法,本方法在最小监督下统一实例分割与多模态理解,具备良好实用部署性。

原文摘要 · Abstract (English)

We propose SegVec3D, a novel framework for 3D point cloud instance segmentation that integrates attention mechanisms, embedding learning, and cross-modal alignment. The approach builds a hierarchical feature extractor to enhance geometric structure modeling and enables unsupervised instance segmentation via contrastive clustering. It further aligns 3D data with natural language queries in a shared semantic space, supporting zero-shot retrieval. Compared to recent methods like Mask3D and ULIP, our method uniquely unifies instance segmentation and multimodal understanding with minimal supervision and practical deployability.

3D分割多模态机器人

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。