仅用文本数据构建跨模态分类模型,无需特定模态标注数据。
Text as Any-Modality for Zero-Shot Classification by Consistent Prompt Tuning
- 用统一文本框架和提示池实现多模态扩展,新模态只需加提示。
- 零样本下在视频、图像、音频任务上均达领先性能。
- 适合想快速适配新模态但缺乏标注数据的研究者。
将提示调优与多模态学习结合,已在多种下游任务中展现强大泛化能力。然而,现有方法严重依赖大量特定模态的标注数据(如视频、音频、图像),或仅针对单一模态定制。本文提出「文本作为任意模态的一致提示调优」(TaAM-CPT),一种仅使用文本数据即可构建通用表示模型的方法,可扩展至无限模态。TaAM-CPT 包含模态提示池、文本构造模块及来自预训练模型的模态对齐文本编码器,可通过添加提示池和对齐编码器轻松支持新模态。为实现跨模态一致性,设计了模态内与模态间学习目标,既捕捉模态内部类别细节,又保持跨模态语义一致。得益于其可扩展架构与预训练模型,该方法可无缝扩展至任意新模态。令人惊讶的是,即使不使用任何特定模态的标注数据,其在涵盖视频、图像、音频等多模态的多个数据集上仍取得领先表现。代码已公开于 https://github.com/Jinx630/TaAM-CPT。
原文摘要 · Abstract (English)
The integration of prompt tuning with multimodal learning has shown significant generalization abilities for various downstream tasks. Despite advancements, existing methods heavily depend on massive modality-specific labeled data (e.g., video, audio, and image), or are customized for a single modality. In this study, we present Text as Any-Modality by Consistent Prompt Tuning (TaAM-CPT), a scalable approach for constructing a general representation model toward unlimited modalities using solely text data. TaAM-CPT comprises modality prompt pools, text construction, and modality-aligned text encoders from pre-trained models, which allows for extending new modalities by simply adding prompt pools and modality-aligned text encoders. To harmonize the learning across different modalities, TaAM-CPT designs intra- and inter-modal learning objectives, which can capture category details within modalities while maintaining semantic consistency across different modalities. Benefiting from its scalable architecture and pre-trained models, TaAM-CPT can be seamlessly extended to accommodate unlimited modalities. Remarkably, without any modality-specific labeled data, TaAM-CPT achieves leading results on diverse datasets spanning various modalities, including video classification, image classification, and audio classification. The code is available at https://github.com/Jinx630/TaAM-CPT.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。