让SQL生成更准:按每条语句细调奖励,提升模型纠错能力
EXPO-SQL: Execution-based Clause-level Policy Optimization for Text-to-SQL

- 按语句块分配奖励,而非整句统一评分
- 在Spider和WikiSQL上准确率显著超越现有方法
- 适合想提升自然语言转SQL精度的研究者
Text-to-SQL 能让用户通过自然语言查询数据库,生成可执行的 SQL 查询。近年来的方法越来越多地采用基于大语言模型的强化学习(RL),利用执行反馈进行训练。然而,现有的 RL 方法对所有语句块给予相同的查询级奖励,无论正确与否,导致学习信号不足。为此,我们提出 EXPO-SQL(基于执行的语句块级策略优化),通过语句块级奖励提供细粒度监督。该方法通过分析执行结果(包括错误信息和逐块增量执行)识别出错误的语句块,从而实现精准奖励分配。在多个主流 Text-to-SQL 基准测试上,EXPO-SQL 显著优于现有的监督微调、提示工程及基于 RL 的方法,展现出细粒度学习的优势。代码已开源:https://github.com/jhn25/EXPO-SQL。
原文摘要 · Abstract (English)
Text-to-SQL enables users to query databases using natural language by generating executable SQL queries. Recent methods have increasingly adopted Large Language Models based reinforcement learning (RL) to leverage execution feedback for training. However, existing RL methods assign uniform query-level rewards to all clauses in a SQL query, treating correct and incorrect clauses equally. This coarse-grained reward design leads to insufficient learning signals for correct SQL generation. To address this issue, we propose EXPO-SQL (EXecution-based clause-level Policy Optimization for Text-to-SQL) which provides fine-grained supervision through clause-level rewards. To assign clause-level rewards, our method identifies erroneous clauses by analyzing execution results, including error messages and clause-wise incremental execution. Experiments on widely-used Text-to-SQL benchmarks demonstrate that EXPO-SQL significantly outperforms existing supervised fine-tuning, prompting, and RL-based methods through fine-grained clause-level learning. Our code is available at https://github. com/jhn25/EXPO-SQL.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。