用神经音频编码器实现高保真音乐降噪,效果优于传统方法。
ADNAC: Audio Denoiser using Neural Audio Codec
- 基于DAC编码器构建生成式降噪模型,利用合成数据训练。
- 多目标损失函数融合时域、频域与信号级指标,提升还原质量。
- 适合对音频质量要求高的修复场景,如老唱片重建。
音频降噪在信号处理中至关重要,能显著提升语音可懂度和音质,广泛应用于音乐录音修复等领域。本文提出一种概念验证,将先进的神经音频编码器Descript Audio Codec(DAC)应用于音乐降噪任务。该方法克服了传统U-Net等架构的局限性,通过在大规模自定义合成数据集上训练模型实现性能突破。训练采用多目标损失函数,综合考虑时域、频域及信号层面的保真度指标。实验结果表明,该方法可实现高保真、生成式的音频恢复,为未来高质量音频修复提供新思路。
原文摘要 · Abstract (English)
Audio denoising is critical in signal processing, enhancing intelligibility and fidelity for applications like restoring musical recordings. This paper presents a proof-of-concept for adapting a state-of-the-art neural audio codec, the Descript Audio Codec (DAC), for music denoising. This work overcomes the limitations of traditional architectures like U-Nets by training the model on a large-scale, custom-synthesized dataset built from diverse sources. Training is guided by a multi objective loss function that combines time-domain, spectral, and signal-level fidelity metrics. Ultimately, this paper aims to present a PoC for high-fidelity, generative audio restoration.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。