用互信息平衡多模态数据,提升模型整体表现
Balanced Multimodal Learning via Mutual Information
- 通过跨模态知识蒸馏增强弱模态性能
- 基于模态表现与互信息动态调整梯度
- 适合生物数据等高质量差异大的场景
多模态学习因能融合不同模态的互补信息而备受关注,但模态不平衡问题(如数据获取不足、质量差异)常被忽视。尤其在生物数据分析中,数据受限且质量不一。传统方法难以同时利用模态协同与解决冲突。本文提出一种新框架,通过互信息量化模态间交互,采用两阶段平衡学习策略:先进行跨模态知识蒸馏,强化弱模态;再通过类似多任务学习机制,根据模态表现和互信息动态校准梯度贡献。该方法有效缓解模态不平衡,显著提升整体多模态模型性能。
原文摘要 · Abstract (English)
Multimodal learning has increasingly become a focal point in research, primarily due to its ability to integrate complementary information from diverse modalities. Nevertheless, modality imbalance, stemming from factors such as insufficient data acquisition and disparities in data quality, has often been inadequately addressed. This issue is particularly prominent in biological data analysis, where datasets are frequently limited, costly to acquire, and inherently heterogeneous in quality. Conventional multimodal methodologies typically fall short in concurrently harnessing intermodal synergies and effectively resolving modality conflicts. In this study, we propose a novel unified framework explicitly designed to address modality imbalance by utilizing mutual information to quantify interactions between modalities. Our approach adopts a balanced multimodal learning strategy comprising two key stages: cross-modal knowledge distillation (KD) and a multitask-like training paradigm. During the cross-modal KD pretraining phase, stronger modalities are leveraged to enhance the predictive capabilities of weaker modalities. Subsequently, our primary training phase employs a multitask-like learning mechanism, dynamically calibrating gradient contributions based on modality-specific performance metrics and intermodal mutual information. This approach effectively alleviates modality imbalance, thereby significantly improving overall multimodal model performance.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。