构建高质量大尺度视觉偏好数据集,提升生成模型优化效果。
ViPO: Visual Preference Optimization at Scale

- 提出Poly-DPO算法,动态调整模型置信度以适应不同数据分布。
- 构建含100万图像对的ViPO数据集,分辨率高达1024px且分布均衡。
- 在噪声数据上性能显著优于传统方法,验证算法与数据协同重要性。
尽管偏好优化对提升视觉生成模型至关重要,但如何有效扩展该范式仍鲜被探索。现有开源偏好数据集存在冲突的偏好模式,胜出样本在某些维度表现优但在其他维度表现差,直接优化此类噪声数据无法有效学习偏好。为此,我们提出Poly-DPO,通过在DPO目标中加入多项式项,动态根据数据集特性调整模型置信度,实现对多样数据分布的有效学习。此外,现有数据集还存在分辨率低、提示多样性不足、分布不平衡等问题。为突破数据瓶颈,我们构建了大规模视觉偏好数据集ViPO,包含100万张1024px图像对(五类)和30万条720p+视频对(三类),采用先进生成模型与多样化提示,确保偏好信号可靠且分布均衡。令人惊讶的是,将Poly-DPO应用于高质量数据集时,最优配置收敛至标准DPO,验证了数据质量与算法自适应性:高质量数据下复杂优化不再必要,但对不完美数据仍具价值。我们在多种视觉生成模型上验证该方法,在噪声数据集Pick-a-Pic V2上,Poly-DPO相较于Diffusion-DPO在GenEval上分别取得6.87和2.32的性能提升(针对SD1.5和SDXL)。在ViPO上训练的模型性能远超现有开源数据集训练结果。这些结果表明,算法适应性与数据质量并重,是实现视觉偏好优化规模化的关键。
原文摘要 · Abstract (English)
While preference optimization is crucial for improving visual generative models, how to effectively scale this paradigm remains largely unexplored. Current open-source preference datasets contain conflicting preference patterns, where winners excel in some dimensions but underperform in others. Naively optimizing on such noisy datasets fails to learn preferences, hindering effective scaling. To enhance robustness against noise, we propose Poly-DPO, which extends the DPO objective with an additional polynomial term that dynamically adjusts model confidence based on dataset characteristics, enabling effective learning across diverse data distributions. Beyond biased patterns, existing datasets suffer from low resolution, limited prompt diversity, and imbalanced distributions. To facilitate large-scale visual preference optimization by tackling data bottlenecks, we construct ViPO, a massive-scale preference dataset with 1M image pairs at 1024px across five categories and 300K video pairs at 720p+ across three categories. State-of-the-art generative models and diverse prompts ensure reliable preference signals with balanced distributions. Remarkably, when applying Poly-DPO to our high-quality dataset, the optimal configuration converges to standard DPO. This convergence validates dataset quality and Poly-DPO's adaptive nature: sophisticated optimization becomes unnecessary with sufficient data quality, yet remains valuable for imperfect datasets. We validate our approach across visual generation models. On noisy datasets like Pick-a-Pic V2, Poly-DPO achieves 6.87 and 2.32 gains over Diffusion-DPO on GenEval for SD1.5 and SDXL, respectively. For ViPO, models achieve performance far exceeding those trained on existing open-source preference datasets. These results confirm that addressing both algorithmic adaptability and data quality is essential for scaling visual preference optimization.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。