arXiv:2605.25731cs.CL2026-05被引 1

让写作评分模型更懂每个评分维度,提升多维度打分准确率。

Trait-Aware Policy Optimization for Autoregressive Multi-Trait Essay Scoring

论文配图:Trait-Aware Policy Optimization for Autoregressive Multi-Trait Essay Scoring
图 1 · 摘自论文原文
  • 按评分项分解奖励信号,兼顾整体一致性和各维度准确性。
  • 在多个模型上优于监督微调和标量奖励优化,提升稳定性和精度。
  • 适合需要精细写作评估的教育评测与AI助教系统使用。

多维度作文评分旨在对写作质量进行多维度细致评估。然而,如何有效对自回归评分模型进行后训练仍缺乏研究。本文提出针对自回归多维度评分的特质感知策略优化(TAPO)框架。该方法沿样本和特质两个维度分解奖励,融合全局评分一致性、各特质准确性、格式有效性以及特质间依赖关系保持。同时,在训练中通过引入原始提示文本和特质描述,增强提示信息以支持特定维度得分生成。在多个骨干模型上的实验表明,本方法在多维度评分性能上持续优于监督微调和标量奖励优化基线,验证了特质感知后训练在作文评分中的有效性和可迁移性。

原文摘要 · Abstract (English)

Multi-trait essay scoring aims to provide fine-grained evaluation of writing quality across multiple dimensions. However, how to effectively post-train autoregressive scoring models remains underexplored. In this paper, we propose Trait-Aware Policy Optimization (TAPO), a post-training framework tailored to autoregressive multi-trait scoring. Our method decomposes rewards along both the sample and trait dimensions, combining global scoring consistency, trait-level accuracy, format validity, and inter-trait dependency preservation. In addition, we use enhanced prompts throughout training by incorporating original prompt texts and trait descriptions, providing richer semantic information for trait-specific score generation. Experiments across multiple backbone models show that our method consistently improves multi-trait scoring performance over supervised fine-tuning and scalar-reward optimization baselines, demonstrating the effectiveness and transferability of trait-aware post-training for essay scoring.

作文评分自回归模型多维度评估强化学习

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。