arXiv:2607.17778cs.CVcs.AI2026-07

通过2D掩码跟踪实现跨维度3D实例分割,无需3D训练

CDIS: Cross-Dimensional Class-Agnostic 3D Instance Segmentation via 2D Mask Tracking and 3D-2D Projection Merging

论文配图:CDIS: Cross-Dimensional Class-Agnostic 3D Instance Segmentation via 2D Mask Tracking and 3D-2D Projection Merging
图 1 · 摘自论文原文
  • 用2D掩码跟踪与3D超点关联,形成2D-3D反馈循环
  • 在基准数据集上精度和一致性优于现有零样本方法
  • 适合机器人在未知环境中感知新物体,部署高效

无类别3D实例分割对机器人在未知环境中的操作与导航至关重要,可感知未见过的物体。现有方法通常将每帧2D实例掩码投影到3D并合并,易导致对象身份断裂和3D实例碎片化。本文提出跨维度无类别3D实例分割(CDIS),一种零样本框架,显式地跨帧跟踪2D实例掩码,并将其与3D超点关联,构建2D与3D之间的反馈机制。这种跨维度推理将时间稳定的2D轨迹与空间一致的3D区域连接,生成全局一致的3D实例标签,且无需任何3D特定训练。在基准数据集上的实验表明,CDIS在准确性和一致性方面均优于当前最先进的零样本方法,同时保持高效率与对多样化真实场景的可扩展性。

原文摘要 · Abstract (English)

Class-agnostic 3D instance segmentation is critical for robotic systems operating in unknown environments, enabling perception of previously unseen objects for reliable manipulation and navigation. Existing approaches typically project per-frame 2D instance masks into 3D and merge them, which often breaks object identities across time and yields fragmented 3D instances. We introduce Cross-Dimensional Class-Agnostic 3D Instance Segmentation (CDIS), a zero-shot framework that explicitly tracks 2D instance masks across frames and associates them with 3D superpoints, creating a feedback loop between 2D and 3D. This cross-dimensional reasoning links temporally stable 2D tracks with spatially coherent 3D regions, producing globally consistent 3D instance labels without any 3D-specific training. Experiments on benchmark datasets demonstrate that CDIS achieves higher accuracy and consistency than state-of-the-art zero-shot methods, while remaining efficient and scalable to diverse real-world environments.

3D分割零样本机器人感知

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。