arXiv:2508.21589cs.CLcs.AI2025-08EMNLP被引 7

Middo通过闭环学习动态优化数据,提升大模型微调效果

Middo: Model-Informed Dynamic Data Optimization for Enhanced LLM Fine-Tuning via Closed-Loop Learning

  • 基于模型反馈自动识别低质量数据,三重信号评估复杂度、多样性与质量
  • 动态重构数据点,在不增加数据量的情况下平均提升模型准确率7.15%
  • 适合追求高质量微调数据的AI研究者与工业应用开发者

监督微调(SFT)大语言模型依赖高质量训练数据。尽管数据选择与合成是提升数据质量的常见策略,现有方法常因静态数据集构建难以适应模型能力的动态演进。本文提出Middo,一种自演化、模型感知的动态数据优化框架,结合模型驱动的数据筛选与上下文保真的数据精炼。该框架建立闭环优化系统:(1) 自参照诊断模块通过损失模式(复杂度)、嵌入聚类动态(多样性)和自对齐分数(质量)三轴信号主动识别低效样本;(2) 自适应优化引擎将低效样本转化为具有教学价值的训练样本,同时保持语义完整性;(3) 优化过程随模型能力动态演进。在多个基准测试中,Middo持续提升初始数据质量,平均使模型准确率提升7.15%,且维持原始数据规模。本工作为可持续的大模型训练建立了新范式,实现数据与模型的动态人机共进化。数据集、模型与代码已公开于https://github.com/Word2VecT/Middo。

原文摘要 · Abstract (English)

Supervised Fine-Tuning (SFT) Large Language Models (LLM) fundamentally rely on high-quality training data. While data selection and data synthesis are two common strategies to improve data quality, existing approaches often face limitations in static dataset curation that fail to adapt to evolving model capabilities. In this paper, we introduce Middo, a self-evolving Model-informed dynamic data optimization framework that uses model-aware data selection and context-preserving data refinement. Unlike conventional one-off filtering/synthesis methods, our framework establishes a closed-loop optimization system: (1) A self-referential diagnostic module proactively identifies suboptimal samples through tri-axial model signals - loss patterns (complexity), embedding cluster dynamics (diversity), and self-alignment scores (quality); (2) An adaptive optimization engine then transforms suboptimal samples into pedagogically valuable training points while preserving semantic integrity; (3) This optimization process continuously evolves with model capability through dynamic learning principles. Experiments on multiple benchmarks demonstrate that our Middo consistently enhances the quality of seed data and boosts LLM's performance with improving accuracy by 7.15% on average while maintaining the original dataset scale. This work establishes a new paradigm for sustainable LLM training through dynamic human-AI co-evolution of data and models. Our datasets, models, and code are publicly available at https://github.com/Word2VecT/Middo.

大模型微调数据优化闭环学习

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。