arXiv:2604.12145eess.AScs.SD2026-04

让音频分词器融合视频信息,重建质量不降反升

Why Your Tokenizer Fails in Information Fusion: A Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization

  • 在量化前按时间轴融合视频特征,避免信息损失
  • 相比纯音频分词器,理解任务性能提升明显
  • 适合需要高质量语音生成的多模态系统

音频分词已成为端到端语音语言模型的关键组件,支持音频理解和生成任务的高效离散表示学习。然而,现有音频分词器因单模态限制,在音频信号含模糊或不完整信息时表现受限。引入额外模态可显著提升理解能力,但当前多模态融合方法会不可避免地降低重建质量,这对需要高保真语音生成的端到端系统不可接受。本文研究视频增强音频分词中重建质量下降的根本原因,提出三项关键发现:其一,融合位置对重建质量至关重要;其二,对比学习虽在连续表示融合中有效,但在离散分词器中无法提升下游任务性能;其三,沿时间轴融合(基于显著特征概念)优于特征维度融合。基于此,我们提出时序感知预量化融合方法(Timing-Aware Pre-Quantization Fusion),首次实现视觉信息融入音频分词器架构的同时保持重建保真度。该方法不仅维持高保真重建,还在下游理解任务上优于纯音频分词器及主流多模态融合基线。

原文摘要 · Abstract (English)

Audio tokenization has emerged as a critical component in end-to-end audio language models, enabling efficient discrete representation learning for both audio understanding and generation tasks. However, existing audio tokenizers face fundamental limitations in understanding tasks due to single-modality constraints, particularly when audio signals contain ambiguous or incomplete information. While incorporating additional modality information can significantly enhance audio understanding, current multimodal fusion approaches invariably degrade reconstruction quality. This degradation is unacceptable for end-to-end audio systems that require high-fidelity audio generation capabilities. In this work, we investigate the root causes of reconstruction quality degradation in video-enhanced audio tokenization and present three key findings. First, the location of fusion within the tokenizer architecture is crucial for preserving reconstruction quality. Second, we show that contrastive learning, though effective in continuous representation fusion, is unsuitable for discrete tokenizers as it fails to enhance downstream task performance. Third, while feature-dimension fusion approaches achieve moderate success, we discover that fusing along the temporal axis -- guided by the concept of distinctive features -- yields significantly better results. Building on these insights, we introduce the Timing-Aware Pre-Quantization Fusion for Video-Enhanced Audio Tokenization, the first approach to successfully integrate visual information into audio tokenizer architectures while preserving reconstruction fidelity. Our approach not only maintains high-fidelity reconstruction but also achieves superior performance on downstream understanding tasks compared with audio-only tokenizers and established multimodal fusion baselines.

音频分词多模态融合时序感知语音生成

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。