arXiv:2501.18237cs.CVcs.AI2025-01被引 4

将多模态医疗数据转为图像,用视觉模型统一处理

Arbitrary Data as Images: Fusion of Patient Data Across Modalities and Irregular Intervals with Vision Transformers

  • 把时序、药物、影像等数据转成图像输入,统一用视觉变压器处理
  • 在MIMIC-IV数据集上,对住院死亡率预测和分型准确率超现有方法
  • 降低建模复杂度,适合无代码医疗AI开发,推动多模态应用落地

患者在每次住院期间会接受多项检查,包括不同采样频率的时序数据、单点测量值、药物干预及影像。尽管医生能直观整合这些信息,但神经网络需为每种模态单独建模,增加训练复杂性。我们提出将所有信息(包括非结构化文本)可视化为图像,并使用标准视觉-文本变压器进行训练。该方法名为针对不规则采样多模态测量的视觉变压器(ViTiMM),不仅简化了数据预处理与建模流程,还在6,175名患者的MIMIC-IV数据集上,于住院死亡率预测和表型分类任务中超越当前最优模型。涉及的模态包括临床测量、用药记录、胸部X光片及心电图。我们希望该工作推动多模态医疗人工智能发展,将训练复杂性降至(视觉)提示工程级别,降低入门门槛,实现无需编码的模型训练。源代码将公开。

原文摘要 · Abstract (English)

A patient undergoes multiple examinations in each hospital stay, where each provides different facets of the health status. These assessments include temporal data with varying sampling rates, discrete single-point measurements, therapeutic interventions such as medication administration, and images. While physicians are able to process and integrate diverse modalities intuitively, neural networks need specific modeling for each modality complicating the training procedure. We demonstrate that this complexity can be significantly reduced by visualizing all information as images along with unstructured text and subsequently training a conventional vision-text transformer. Our approach, Vision Transformer for irregular sampled Multi-modal Measurements (ViTiMM), not only simplifies data preprocessing and modeling but also outperforms current state-of-the-art methods in predicting in-hospital mortality and phenotyping, as evaluated on 6,175 patients from the MIMIC-IV dataset. The modalities include patient's clinical measurements, medications, X-ray images, and electrocardiography scans. We hope our work inspires advancements in multi-modal medical AI by reducing the training complexity to (visual) prompt engineering, thus lowering entry barriers and enabling no-code solutions for training. The source code will be made publicly available.

多模态医疗AI视觉模型零代码

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。