arXiv:2604.06779cs.AI2026-04

解决扩散模型采样中粒子多样性快速消失的问题,提升生成质量与效率。

VASR: Variance-Aware Systematic Resampling for Reward-Guided Diffusion

论文配图:VASR: Variance-Aware Systematic Resampling for Reward-Guided Diffusion
图 1 · 摘自论文原文
  • 基于方差分解设计新重采样策略,分离控制不同来源的方差
  • 在MNIST/CIFAR-10上比现有方法FID提升26%,速度比MCTS快66倍
  • 无需训练、可并行,适合对生成质量与速度要求高的场景

奖励引导的扩散模型中,序列蒙特卡洛(SMC)采样常因快速谱系坍缩而丧失多样性:仅少数高奖励粒子在数步内主导种群,导致样本质量下降。本文提出方差分解框架,将延续方差 $V_t^{ ext{cont}}$ 与残差方差 $V_t^{ ext{res}}$ 分离,揭示常见多项式重采样下后代数量方差是坍缩主因。据此提出 extsc{VASR}(方差感知系统重采样),通过方差最优质量分配 $m_t /propto w_t e^{r_t}$ 最小化 $V_t^{ ext{cont}}$,并结合系统重采样控制 $V_t^{ ext{res}}$。针对潜变量扩散模型中因随机延续导致的中间奖励噪声问题,进一步提出 extsc{VASR-Max},一种故意偏置的高选择性变体,适用于方差敏感的奖励优化。两者均无需训练、完全可并行,仅增加线性开销。在MNIST和CIFAR-10上,VASR相比先前SMC方法最高提升26%的FID,同时比基于MCTS的价值方法快66倍(相同计算量)。在文本到图像生成任务中, extsc{VASR-Max} 在各种算力预算下持续优于最强的SMC基线,高算力下以2.5–3%差距匹配MCTS方法,且速度更快约数倍。

原文摘要 · Abstract (English)

Sequential Monte Carlo (SMC) samplers for reward-guided diffusion models often suffer from rapid lineage collapse: a few high-reward particles dominate the population within a handful of resampling steps, destroying diversity and degrading sample quality. We propose a variance-decomposition framework for reward-guided diffusion SMC that separates continuation variance $V_t^{\mathrm{cont}}$ from residual variance $V_t^{\mathrm{res}}$, revealing that high offspring-count variance under the commonly used multinomial resampling drives this collapse. This motivates \textsc{VASR} (Variance-Aware Systematic Resampling), which addresses both variance terms via variance-optimal mass allocation $m_t \propto w_t e^{r_t}$ (minimizing $V_t^{\mathrm{cont}}$) and systematic resampling (controlling $V_t^{\mathrm{res}}$). For latent diffusion models where intermediate rewards are noisy due to stochastic continuations, we propose \textsc{VASR-Max}, a deliberately biased high-selection variant for variance-sensitive reward optimization. Both methods are training-free, fully parallelizable, and add only linear overhead. On MNIST and CIFAR-10, VASR achieves as high as $26\%$ better FID than prior SMC methods while remaining 66 times faster than MCTS-based value methods at matched compute. On text-to-image generation, \textsc{VASR-Max} consistently outperforms the strongest SMC baseline across compute budgets and matches MCTS-based methods within 2.5--3% reward at high budgets while being approximately times faster.

扩散模型重采样生成质量加速采样

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。