arXiv:2509.15549cs.CL2025-09中稿 · SIGIR 2026 Short

构建多语言高质量指令数据集,提升大模型跨语言能力

M-DaQ: Retrieving Samples with Multilingual Diversity and Quality for Instruction Fine-Tuning Datasets

  • 用质量评分+语义多样性策略筛选数据,兼顾准确与多元
  • 18种语言测试中,模型胜率超60%,显著优于基线
  • 适合想提升多语言模型表现的研究者和开发者

多语言指令微调(IFT)使大语言模型能在不同语言和文化背景下有效泛化,但高质量、系统性构建的多语言IFT数据集仍十分稀缺。为此,我们提出M-DaQ(多语言多样性与质量),一种兼顾多样性与质量的采样框架,通过微调的质量评分模型结合最大边际相关性启发的选样策略,构建平衡且高保真的训练数据。此外,我们首次系统研究了多语言场景下的表面对齐假说。在18种语言上的广泛评估表明,使用M-DaQ数据训练的模型在Alpaca-Eval和MT-Bench上平均胜率超过60%,显著优于强基线。人工评估进一步验证了其在文化相关性、语境适切性和指令遵循能力上的显著提升。代码已公开,支持可复现性与未来研究。

原文摘要 · Abstract (English)

Multilingual instruction fine-tuning (IFT) empowers large language models to generalize across diverse linguistic and cultural contexts; however, high-quality, systematically curated multilingual IFT datasets remain scarce. To address this gap, we propose M-DaQ (Multilingual Diversity and Quality), a diversity-aware sampling framework that jointly optimizes instruction-response quality and cross-lingual semantic diversity. M-DaQ leverages a fine-tuned Quality Scoring Model alongside a maximal marginal relevance-inspired selection strategy to construct balanced, high-fidelity training data. Furthermore, we present the first systematic investigation of the Superficial Alignment Hypothesis in multilingual settings. Extensive evaluations across 18 languages demonstrate that models trained on M-DaQ-curated data achieve average win rates exceeding 60% against strong baselines on Alpaca-Eval and MT-Bench. Complementary human evaluations corroborate these gains, highlighting significant improvements in cultural relevance, contextual appropriateness, and instruction-following capability. The code are publicly released to facilitate reproducibility and future research.

多语言指令微调数据构建多样性

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。