arXiv:2608.09588cs.CL2026-08

解决跨多个数据库的自然语言转SQL难题,精准定位目标库并提取关键字段。

MDB-Link: Hierarchical Schema Linking for Multi-Database Text-to-SQL

论文配图:MDB-Link: Hierarchical Schema Linking for Multi-Database Text-to-SQL
图 1 · 摘自论文原文
  • 分层检索:先从全局索引找相关列,再聚合证据缩小数据库范围。
  • 用大模型在预算内重排库表,列选择准确率提升超3倍,金标匹配达51.41%。
  • 适合处理海量异构数据库场景,尤其适用于复杂多库查询任务。

传统文本转SQL研究假设目标数据库已知,忽略了需在大规模异构数据库集合中定位查询的情形。本文研究多数据库环境下的模式链接问题,提出MDB-Link框架:首先从全局索引检索与问题相关的列,聚合检索证据以筛选候选数据库,再使用预算感知的大语言模型进行数据库重排序、表选择和列定位。采用Qwen2.5-14B模型,MDB-Link在MMQA、Spider2-Snow和BIRD-dev上的数据库定位与列选择性能均优于LinkAlign,生成的模式子集大小接近黄金标准。精确匹配率在MMQA上从16.88%提升至51.41%,Spider2-Snow从2.50%升至9.17%,BIRD-dev从12.52%增至38.01%。同时运行速度优于LinkAlign和AutoLink,验证了分层模式压缩对下游SQL生成的有效性。

原文摘要 · Abstract (English)

Traditional Text-to-SQL research and benchmarks assume a known target database, overlooking settings in which a query must be routed within a large, heterogeneous database collection. We therefore study schema linking in a multi-database setting, where the system must first locate the target database and then construct a compact, SQL-relevant schema for generation. We propose MDB-Link, a hierarchical schema-linking framework that retrieves question-relevant columns from a global index, aggregates retrieval evidence to shortlist databases, and uses a budget-aware large language model (LLM) for database reranking, table selection, and column grounding. With Qwen2.5-14B, MDB-Link outperforms LinkAlign on MMQA, Spider2-Snow, and BIRD-dev in database localization and column selection while producing schema subsets close in size to the gold schemas. Exact match improves from 16.88 to 51.41 on MMQA, 2.50 to 9.17 on Spider2-Snow, and 12.52 to 38.01 on BIRD-dev. MDB-Link also runs faster than LinkAlign and AutoLink, demonstrating the effectiveness of hierarchical schema reduction for downstream SQL generation.

文本转SQL多库查询大模型应用模式链接

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。