arXiv:2501.15368cs.CLcs.SD2025-01被引 120

百川全模态模型支持多模态理解与端到端语音生成,性能超越主流模型。

Baichuan-Omni-1.5 Technical Report

  • 构建5000亿高质量多模态数据集,优化跨模态对齐
  • 设计音频分词器,实现语义与声学信息融合
  • 多阶段训练策略提升全模态协同能力,适合医疗等专业场景

我们介绍 Baichuan-Omni-1.5,一个具备全模态理解能力并支持端到端音频生成的多模态模型。为在不损害任一模态能力的前提下实现跨模态流畅交互,我们重点优化三大方面:首先,建立覆盖文本、音频和视觉的多模态数据清洗与合成管道,获得约500B高质量数据;其次,设计了专用音频分词器(Baichuan-Audio-Tokenizer),有效捕捉音频的语义与声学特征,增强与多模态大模型(MLLM)的兼容性;最后,采用多阶段训练策略,逐步融合多模态对齐与多任务微调,确保各模态间高效协同。该模型在综合全模态能力上领先于当前主流模型(包括 GPT4o-mini 与 MiniCPM-o 2.6),并在多个医学多模态基准测试中达到与 Qwen2-VL-72B 等领先模型相当的水平。

原文摘要 · Abstract (English)

We introduce Baichuan-Omni-1.5, an omni-modal model that not only has omni-modal understanding capabilities but also provides end-to-end audio generation capabilities. To achieve fluent and high-quality interaction across modalities without compromising the capabilities of any modality, we prioritized optimizing three key aspects. First, we establish a comprehensive data cleaning and synthesis pipeline for multimodal data, obtaining about 500B high-quality data (text, audio, and vision). Second, an audio-tokenizer (Baichuan-Audio-Tokenizer) has been designed to capture both semantic and acoustic information from audio, enabling seamless integration and enhanced compatibility with MLLM. Lastly, we designed a multi-stage training strategy that progressively integrates multimodal alignment and multitask fine-tuning, ensuring effective synergy across all modalities. Baichuan-Omni-1.5 leads contemporary models (including GPT4o-mini and MiniCPM-o 2.6) in terms of comprehensive omni-modal capabilities. Notably, it achieves results comparable to leading models such as Qwen2-VL-72B across various multimodal medical benchmarks.

多模态语音生成医疗AI大模型

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。