arXiv:2512.10353cs.CV2025-12

用跨平面建模提升3D医学图像弱监督分割效果

Hybrid Transformer-Mamba for Weakly Supervised Volumetric Medical Segmentation

  • 结合Transformer与Mamba,通过跨平面块捕捉三维上下文
  • 在三个数据集上达到当前最优性能,显著优于2D方法
  • 适合需要高效处理3D医学影像的科研与临床应用

弱监督分割允许模型仅用平面级标签进行训练。现有方法多依赖2D编码器,忽略了医学数据的三维特性。我们提出TranSamba,一种融合Transformer与Mamba的混合架构,通过跨平面建模捕获3D上下文。TranSamba在视觉Transformer主干基础上引入跨平面Mamba模块,利用线性时间建模实现邻近平面间高效信息交换,从而增强平面内自注意力及后续注意力图,提升目标定位能力。该方法对输入体积深度保持线性时间复杂度和常数空间复杂度。在覆盖多种模态和病灶的三个数据集上的大量实验表明,TranSamba实现了最先进性能,验证了跨平面建模的泛化有效性。代码已公开于:https://github.com/YihengLyu/TranSamba。

原文摘要 · Abstract (English)

Weakly supervised segmentation enables model training from plane-level labels. Existing methods often rely on 2D encoders, neglecting the volumetric nature of medical data. We propose TranSamba, a hybrid Transformer-Mamba architecture designed to capture 3D context via cross-plane modeling. TranSamba augments a Vision Transformer backbone with Cross-Plane Mamba blocks, leveraging linear-time modeling for efficient information exchange across neighboring planes. This exchange improves in-plane self-attention and subsequent attention maps for object localization. TranSamba maintains linear time complexity and constant space complexity with respect to the input volume depth. Extensive experiments on three datasets covering diverse modalities and pathologies show that TranSamba achieves state-of-the-art performance, demonstrating the generalizable efficacy of cross-plane modeling. Code is available at: https://github.com/YihengLyu/TranSamba.

医学分割3D建模TransformerMamba

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。