arXiv:2505.04522eess.IVcs.CV2025-05被引 18

用扩散模型从自由文本生成3D CT影像,更贴近临床描述。

Text2CT: Towards 3D CT Volume Generation from Free-text Descriptions Using Diffusion Model

  • 通过新提示设计,直接解析自由文本生成3D CT体积。
  • 生成结果在解剖结构保真度上优于现有方法。
  • 适合医学影像生成、数据增强及临床辅助诊断场景。

从描述性自由文本生成3D CT体积在诊断与研究中具有变革性潜力。本文提出Text2CT,一种基于扩散模型的3D CT体积生成新方法。与依赖固定格式文本输入的先前方法不同,Text2CT采用新颖的提示构建方式,可处理多样化的自由文本描述。该框架将医学文本编码为潜在表示,并解码为高分辨率3D CT扫描,在统一的3D框架下实现语义文本与详细体素表示之间的有效衔接。大量评估表明,该方法在保持解剖结构准确性与捕捉复杂结构方面表现优异,达到当前最优水平,展现出在诊断与数据增强中的广阔应用前景。

原文摘要 · Abstract (English)

Generating 3D CT volumes from descriptive free-text inputs presents a transformative opportunity in diagnostics and research. In this paper, we introduce Text2CT, a novel approach for synthesizing 3D CT volumes from textual descriptions using the diffusion model. Unlike previous methods that rely on fixed-format text input, Text2CT employs a novel prompt formulation that enables generation from diverse, free-text descriptions. The proposed framework encodes medical text into latent representations and decodes them into high-resolution 3D CT scans, effectively bridging the gap between semantic text inputs and detailed volumetric representations in a unified 3D framework. Our method demonstrates superior performance in preserving anatomical fidelity and capturing intricate structures as described in the input text. Extensive evaluations show that our approach achieves state-of-the-art results, offering promising potential applications in diagnostics, and data augmentation.

3D生成扩散模型医学影像

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。