解决多模态分类中任意模态缺失的协同学习方法
Co-Learning for Missing Arbitrary Modalities in Multi-modal Classification

- 通过特征与决策层信息协同,应对任意模态缺失问题
- 在单模态缺失时表现更优,极端缺失下也保持稳定
- 适合真实场景中模态不固定缺失的分类任务
多模态分类利用多元数据源间的互补信息提升预测性能。然而,实际应用中因传感器故障或隐私限制,训练与推理时模态可用性不一致。现有研究多聚焦双模态且依赖鲁棒融合机制。本文提出多模态协同学习框架,强调模态间协作而非融合。针对任意模态缺失(无预设缺失模式)的挑战,设计两种基于特征与决策层信息的方法。在两个多模态分类基准上验证,显著提升各类缺失条件下的鲁棒性:第一种方法在单模态缺失时表现更佳,第二种在全模态缺失仅剩一模态时优势明显。代码已开源。
原文摘要 · Abstract (English)
Multi-modal classification leverages complementary information across diverse data sources to enhance predictive performance. However, real-world scenarios subject to operational constraints, such as sensor failures or privacy restrictions, lead to inconsistent modality availability between training and inference times. To handle missing modalities, prior studies have mainly covered bimodal data setups and focused on designing robust fusion processes. Instead, we adopt a multi-modal co-learning framework that prioritizes inter-modal collaboration rather than multi-modal fusion. Specifically, we consider that any subset of modalities may be absent, without assuming predefined missing-modality patterns, an inference scenario we refer to as missing arbitrary modalities. To address this challenge, we introduce two alternative approaches that leverage information at both feature- and decision-level. Experiments on two multi-modal classification benchmarks demonstrate significant robustness gains in various missing modality conditions. The first method shows more robust behavior under minimal missing conditions, where a single modality is absent, whereas the second performs better under extreme missing conditions, where all-but-one modalities are missing. Our code is available at https://github.com/fmenat/Co4Miss.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。