arXiv:2504.14194cs.CL2025-04ACL被引 23

用多维度评估提升大模型预训练数据质量,加速收敛并增强性能。

Meta-rater: A Multi-dimensional Data Selection Method for Pre-training Language Models

  • 从专业性、可读性、推理能力、清洁度四维度综合评估数据质量。
  • 在1.3B参数模型上使收敛速度翻倍,下游任务性能提升3.23点。
  • 适用于大模型预训练优化,适合关注数据质量与训练效率的研究者。

大型语言模型(LLM)的预训练数据构成仍不透明,影响透明度和数据质量优化。现有方法如自然语言质量评估、多样性过滤和分类器策略,受限于单一维度评价或冗余导向。为此,我们提出四个数据质量维度:专业性、可读性、推理能力与清洁度,并引入Meta-rater——一种通过学习最优权重整合这些维度与现有指标的多维度数据选择方法。Meta-rater利用代理模型训练回归模型预测验证损失,以识别最佳质量评分组合。实验表明,该方法在1.3B参数模型上使收敛速度提升一倍,下游任务性能提高3.23点,且优势随模型规模扩大至7.2B参数时持续显现。结果证明,综合性多维度质量整合显著优于传统单维度方法,为提升预训练效率与模型能力提供可扩展范式。相关代码、数据与模型已开源:https://github.com/opendatalab/Meta-rater。

原文摘要 · Abstract (English)

The composition of pre-training datasets for large language models (LLMs) remains largely undisclosed, hindering transparency and efforts to optimize data quality, a critical driver of model performance. Current data selection methods, such as natural language quality assessments, diversity-based filters, and classifier-based approaches, are limited by single-dimensional evaluation or redundancy-focused strategies. To address these gaps, we propose four dimensions to evaluate data quality: professionalism, readability, reasoning, and cleanliness. We further introduce Meta-rater,a multi-dimensional data selection method that integrates these dimensions with existing quality metrics through learned optimal weightings. Meta-rater employs proxy models to train a regression model that predicts validation loss, enabling the identification of optimal combinations of quality scores. Experiments demonstrate that Meta-rater doubles convergence speed for 1.3B parameter models and improves downstream task performance by 3.23, with advantages that scale to models as large as 7.2B parameters. Our work establishes that holistic, multi-dimensional quality integration significantly outperforms conventional single-dimension approaches, offering a scalable paradigm for enhancing pre-training efficiency and model capability. To advance future research, we release scripts, data, and models at https://github.com/opendatalab/Meta-rater.

预训练数据多维度评估模型性能数据选择

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。