用多样本对比优化生成模型,提升多样性与鲁棒性
Preference Optimization with Multi-Sample Comparisons
- 引入多样本偏好优化,替代传统单样本比较
- 在生成多样性与偏见控制上优于单样本方法
- 适合处理带噪声数据集,对大模型对齐更有效
近年来,生成模型(尤其是大语言模型和扩散模型)的发展依赖于大规模预训练和后续微调。然而,当前的后训练方法如基于人类反馈的强化学习(RLHF)和直接偏好对齐(DAP)主要采用单样本比较,难以捕捉生成多样性与偏见等群体特性。为此,我们提出一种新方法,将后训练扩展至多样本比较。具体提出了多样本直接偏好优化(mDPO)和多样本身份偏好优化(mIPO),通过关注群体特征来改进传统DAP。实验表明,多样本比较在优化生成模型的集体特性(如多样性与偏见)方面显著优于单样本比较。此外,研究发现多样本比较在存在标签噪声的数据集上具有更强的鲁棒性。
原文摘要 · Abstract (English)
Recent advancements in generative models, particularly large language models (LLMs) and diffusion models, have been driven by extensive pretraining on large datasets followed by post-training. However, current post-training methods such as reinforcement learning from human feedback (RLHF) and direct alignment from preference methods (DAP) primarily utilize single-sample comparisons. These approaches often fail to capture critical characteristics such as generative diversity and bias, which are more accurately assessed through multiple samples. To address these limitations, we introduce a novel approach that extends post-training to include multi-sample comparisons. To achieve this, we propose Multi-sample Direct Preference Optimization (mDPO) and Multi-sample Identity Preference Optimization (mIPO). These methods improve traditional DAP methods by focusing on group-wise characteristics. Empirically, we demonstrate that multi-sample comparison is more effective in optimizing collective characteristics~(e.g., diversity and bias) for generative models than single-sample comparison. Additionally, our findings suggest that multi-sample comparisons provide a more robust optimization framework, particularly for dataset with label noise.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。