用测试时训练提升图像修复效率,速度提升45%。
Exploring Diffusion with Test-Time Training on Efficient Image Restoration
- 将测试时训练融入高效扩散模型,实现动态自适应修复。
- 仅需5-20步生成图像先验,训练推理快45%。
- 适合追求实时性与高画质的图像修复应用。
图像修复面临特征融合低效、计算瓶颈和扩散过程缓慢等问题。为此,我们提出DiffRWKVIR,一种将测试时训练(TTT)与高效扩散结合的新框架。其三大创新包括:(1) 全尺度二维状态演化将RWKV的位置依赖参数化扩展至分层多方向二维扫描,以线性复杂度O(L)实现全局上下文感知;(2) 分块优化闪存处理通过连续分块处理将块内并行加速3.2倍,复杂度降至O(LCd),减少串行依赖与计算开销;(3) 先验引导的高效扩散在仅5-20步内提取紧凑图像先验表示(IPR),相比DiffIR训练/推理提速45%,有效解决去噪中的计算低效问题。在超分辨率与修补任务基准(Set5、Set14、BSD100、Urban100、Places365)上,DiffRWKVIR在PSNR、SSIM、LPIPS及效率指标上均优于SwinIR、HAT和MambaIR/v2。该方法建立了自适应、高效率图像修复新范式,优化了硬件利用率。
原文摘要 · Abstract (English)
Image restoration faces challenges including ineffective feature fusion, computational bottlenecks and inefficient diffusion processes. To address these, we propose DiffRWKVIR, a novel framework unifying Test-Time Training (TTT) with efficient diffusion. Our approach introduces three key innovations: (1) Omni-Scale 2D State Evolution extends RWKV's location-dependent parameterization to hierarchical multi-directional 2D scanning, enabling global contextual awareness with linear complexity O(L); (2) Chunk-Optimized Flash Processing accelerates intra-chunk parallelism by 3.2x via contiguous chunk processing (O(LCd) complexity), reducing sequential dependencies and computational overhead; (3) Prior-Guided Efficient Diffusion extracts a compact Image Prior Representation (IPR) in only 5-20 steps, proving 45% faster training/inference than DiffIR while solving computational inefficiency in denoising. Evaluated across super-resolution and inpainting benchmarks (Set5, Set14, BSD100, Urban100, Places365), DiffRWKVIR outperforms SwinIR, HAT, and MambaIR/v2 in PSNR, SSIM, LPIPS, and efficiency metrics. Our method establishes a new paradigm for adaptive, high-efficiency image restoration with optimized hardware utilization.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。