arXiv:2508.05207cs.SDcs.AI2025-08被引 9

SpectroStream实现48kHz立体声音乐的低码率高保真编码,性能超越前代。

SpectroStream: A Versatile Neural Codec for General Audio

  • 基于时频域表示的新神经架构,提升高采样率音频重建质量。
  • 在4-16kbps码率下实现48kHz立体声音乐的高质量还原。
  • 采用延迟融合策略,兼顾单通道音质与多通道相位一致性。

我们提出SpectroStream,一种全频段多通道神经音频编解码器。作为广受认可的SoundStream的升级版,SpectroStream将能力拓展至24 kHz以上的单声道音频,并实现了48 kHz立体声音乐在4–16 kbps码率下的高保真重建。该成果得益于一种新的神经架构,其利用时频域中的音频表示,显著提升了高采样率下的音频质量。模型还引入延迟融合策略以处理多通道音频,有效平衡了各通道的声学质量与跨通道的相位一致性。

原文摘要 · Abstract (English)

We propose SpectroStream, a full-band multi-channel neural audio codec. Successor to the well-established SoundStream, SpectroStream extends its capability beyond 24 kHz monophonic audio and enables high-quality reconstruction of 48 kHz stereo music at bit rates of 4--16 kbps. This is accomplished with a new neural architecture that leverages audio representation in the time-frequency domain, which leads to better audio quality especially at higher sample rate. The model also uses a delayed-fusion strategy to handle multi-channel audio, which is crucial in balancing per-channel acoustic quality and cross-channel phase consistency.

音频编码神经编解码时频域

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。