arXiv:2602.02928cs.LG2026-02

用距离场思想改进无时间条件生成模型,提升图像质量。

Distance Marching for Generative Modeling

  • 基于距离场设计新推理方法,聚焦近处目标优化去噪方向。
  • 在CIFAR-10和ImageNet上FID提升13.5%,优于现有无时间模型。
  • 支持采样早停与异常检测,适合高效生成与鲁棒推断场景。

无时间条件生成模型学习与时间无关的去噪向量场。但由于缺乏时间条件,同一噪声输入可能对应多个噪声水平和不同去噪方向,干扰监督信号。受距离场建模启发,我们提出Distance Marching,一种新的无时间条件方法,包含两种原理性推理策略。关键在于设计聚焦于较近目标的损失函数,使去噪方向更准确指向数据流形。在多种架构下,Distance Marching在CIFAR-10和ImageNet上相较于近期无时间条件基线平均提升FID 13.5%。对于类别条件的ImageNet生成,尽管移除了时间输入,其性能仍超越流匹配(flow matching);使用60%采样步数即达到更低FID,且在所有主干网络规模下平均降低13.6%。此外,我们的距离预测还可用于采样过程中的早停与分布外检测。我们希望距离场建模能为生成建模提供一个更严谨的视角。

原文摘要 · Abstract (English)

Time-unconditional generative models learn time-independent denoising vector fields. But without time conditioning, the same noisy input may correspond to multiple noise levels and different denoising directions, which interferes with the supervision signal. Inspired by distance field modeling, we propose Distance Marching, a new time-unconditional approach with two principled inference methods. Crucially, we design losses that focus on closer targets. This yields denoising directions better directed toward the data manifold. Across architectures, Distance Marching consistently improves FID by 13.5% on CIFAR-10 and ImageNet over recent time-unconditional baselines. For class-conditional ImageNet generation, despite removing time input, Distance Marching surpasses flow matching using our losses and inference methods. It achieves lower FID than flow matching's final performance using 60% of the sampling steps and 13.6% lower FID on average across backbone sizes. Moreover, our distance prediction is also helpful for early stopping during sampling and for OOD detection. We hope distance field modeling can serve as a principled lens for generative modeling.

生成模型距离场无时间条件图像生成

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。