融合空间与频域特征,提升眼底OCT图像分割精度
Attentional Triple-Encoder Network in Spatiospectral Domains for Medical Image Segmentation
- 设计三编码器结构,分别处理空间、频域和跨域关系
- 在OCT数据上实现0.864的平均Dice系数,较之前提升0.009
- 适合需要高精度医学图像分割的研究者与临床应用
视网膜光学相干断层扫描(OCT)分割对病理诊断至关重要。传统方法仅关注空间或频域特征,忽略了二者间的联合依赖。本文提出一种三编码器网络,结合卷积神经网络提取空间特征、快速傅里叶卷积(FFC)捕捉频域特征,并引入注意力机制建模跨域全局关系。注意力融合模块融合卷积与交叉注意力以增强特征表达。所提方法在基准测试中将平均Dice分数从0.855提升至0.864,优于现有方法。
原文摘要 · Abstract (English)
Retinal Optical Coherence Tomography (OCT) segmentation is essential for diagnosing pathology. Traditional methods focus on either spatial or spectral domains, overlooking their combined dependencies. We propose a triple-encoder network that integrates CNNs for spatial features, Fast Fourier Convolution (FFC) for spectral features, and attention mechanisms to capture global relationships across both domains. Attention fusion modules integrate convolution and cross-attention to further enhance features. Our method achieves an average Dice score improvement from 0.855 to 0.864, outperforming prior work.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。