用多模态查询实现沉浸式音频中目标声源的高保真分离
Towards Multimodal Query-Based Spatial Audio Source Extraction
- 提出三轴注意力机制,同时建模时间、频域和空间通道依赖
- 在FOA混音上达到高分离质量,支持音频/文本双模态输入
- 无需标注数据,通过动态生成训练样本提升泛化能力
基于查询的音频源分离旨在根据查询恢复混合信号中的目标声源。现有方法主要局限于单通道音频,未充分利用多通道录音中的空间信息。本文提出一种基于查询的空间音频源分离框架,可从一阶全向声学(FOA)混合信号中恢复干声目标信号。该方法接受音频或文本查询作为条件输入,实现灵活的端到端提取。核心模型采用三轴Transformer,联合建模时间、频率与空间通道依赖关系;利用对比语言-音频预训练(CLAP)嵌入,通过特征逐元素线性调制(FiLM)实现统一的音视频条件控制。为避免昂贵标注并提升泛化能力,提出无标签数据流水线,动态生成空间混合信号及对应目标信号用于训练。实验表明,多模态条件与三轴建模显著提升分离质量,为沉浸式应用中的高保真空间音频分离建立了新范式。
原文摘要 · Abstract (English)
Query-based audio source extraction seeks to recover a target source from a mixture conditioned on a query. Existing approaches are largely confined to single-channel audio, leaving the spatial information in multi-channel recordings underexploited. We introduce a query-based spatial audio source extraction framework for recovering dry target signals from first-order ambisonics (FOA) mixtures. Our method accepts either an audio prompt or a text prompt as condition input, enabling flexible end-to-end extraction. The core of our proposed model lies in a tri-axial Transformer that jointly models temporal, frequency, and spatial channel dependencies. The model uses contrastive language-audio pretraining (CLAP) embeddings to enable unified audio-text conditioning via feature-wise linear modulation (FiLM). To eliminate costly annotations and improve generalization, we propose a label-free data pipeline that dynamically generates spatial mixtures and corresponding targets for training. The result of our experiment with high separation quality demonstrates the efficacy of multimodal conditioning and tri-axial modeling. This work establishes a new paradigm for high-fidelity spatial audio separation in immersive applications.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。