让大模型摆脱表面套路,真正学会推理。
Mitigating Shortcut Reasoning in Language Models: A Gradient-Aware Training Approach
- 通过梯度分析识别导致模型走捷径的训练样本。
- 在基准测试中准确率提升16.5%,抗分布偏移能力增强40.2%。
- 适合希望提升模型逻辑推理能力的研究者与开发者。
大型语言模型具备强大的推理能力,但常常依赖表面模式匹配和答案记忆等捷径,而非真正的逻辑推断。本文提出一种梯度感知的训练框架SART(Shortcut-Aware Reasoning Training),通过ShortcutScore与梯度手术检测并缓解促进捷径的样本。该方法利用梯度与验证目标之间的不一致性以及答案标记集中度来识别捷径信号,并相应调整训练动态。在受控推理基准上的实验表明,SART相比最强基线,准确率提升16.5%,鲁棒性提高40.2%,显著改善了分布变化下的泛化性能。代码已公开于:https://github.com/fuyanjie/short-cut-aware-data-centric-reasoning。
原文摘要 · Abstract (English)
Large language models exhibit strong reasoning capabilities, yet often rely on shortcuts such as surface pattern matching and answer memorization rather than genuine logical inference. We propose Shortcut-Aware Reasoning Training (SART), a gradient-aware framework that detects and mitigates shortcut-promoting samples via ShortcutScore and gradient surgery. Our method identifies shortcut signals through gradient misalignment with validation objectives and answer-token concentration, and modifies training dynamics accordingly. Experiments on controlled reasoning benchmarks show that SART achieves +16.5% accuracy and +40.2% robustness over the strongest baseline, significantly improving generalization under distribution shifts. Code is available at: https://github.com/fuyanjie/short-cut-aware-data-centric-reasoning.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。