用分频段的CQT提升音频生成的时频分辨率,效果更自然。
An Octave-based Multi-Resolution CQT Architecture for Diffusion-based Audio Generation
- 按八度调整时频分辨率,低频部分时间精度更高
- 在两个数据集上FAD得分优于现有模型,音质达顶尖水平
- 适合追求高保真音频生成的研究者与开发者
本文提出MR-CQTdiff,一种基于多分辨率常数-Q变换(CQT)的扩散模型音频生成架构。该架构采用高效可逆的CQT框架,按八度调节时间-频率分辨率,有效解决低频段时间分辨率不足的问题,实现更灵活、更具表现力的音频生成。通过在多个架构和两个数据集上使用弗雷歇音频距离(FAD)进行评估,实验结果表明MR-CQTdiff在音质上达到当前最优水平,显著优于现有方法。
原文摘要 · Abstract (English)
This paper introduces MR-CQTdiff, a novel neural-network architecture for diffusion-based audio generation that leverages a multi-resolution Constant-$Q$ Transform (C$Q$T). The proposed architecture employs an efficient, invertible CQT framework that adjusts the time-frequency resolution on an octave-by-octave basis. This design addresses the issue of low temporal resolution at lower frequencies, enabling more flexible and expressive audio generation. We conduct an evaluation using the Fréchet Audio Distance (FAD) metric across various architectures and two datasets. Experimental results demonstrate that MR-CQTdiff achieves state-of-the-art audio quality, outperforming competing architectures.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。