arXiv:2606.07356cs.SDcs.CL2026-06

无需反演的文本引导音频编辑,速度提升64.5%且失真更小

DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast

论文配图:DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast
图 1 · 摘自论文原文
  • 直接利用扩散模型去噪路径构建音效修改路径
  • 相比DDPM反演方法,FAD降低15.9%,KL降低15.8%
  • 适合追求高效、无训练音频编辑的研究与应用

文本引导音频编辑旨在修改指定语言内容的同时保留无关源成分。现有免训练方法通常依赖反演编辑,而免反演编辑虽计算开销更低、重建误差更小,但在音频领域仍几乎未被探索。核心挑战在于通过扩散去噪动态构建从源到目标的编辑路径。本文提出DirectAudioEdit,首个免训练、免反演的音频编辑方法。在音乐与事件级基准上,基于两种骨干网络的实验表明,该方法相较DDPM反演,宏平均FAD与KL分别降低15.9%和15.8%,同时实现最高达64.5%的编辑加速。

原文摘要 · Abstract (English)

Text-guided audio editing aims to modify the language-specified acoustic content while preserving edit-irrelevant source components. Existing training-free methods typically rely on inversion-based editing. While inversion-free editing is appealing as it decreases computational overhead and reconstruction errors, it remains largely unexplored for audio editing. The key challenge is to construct a source-to-target editing path through diffusion denoising dynamics. In this paper, we introduce DirectAudioEdit, the first attempt to develop a training-free and inversion-free method for audio editing. Experiments on music and event-level benchmarks across two backbones show that DirectAudioEdit reduces macro-averaged FAD and KL by 15.9% and 15.8% compared with DDPM inversion, while achieving up to 64.5% editing speedup.

音频编辑扩散模型免反演文本生成

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。