用大模型从文本自动生成关系型数据库,让无序数据变结构化。
SQUiD: Synthesizing Relational Databases from Unstructured Text
- 分四阶段处理:先析结构再填内容,结合神经与符号方法。
- 在多个数据集上表现优于现有方法,生成的表结构准确率高。
- 适合需要快速构建数据库的研究者和数据工程师。
关系型数据库是现代数据管理的核心,但大多数数据以文本等非结构化形式存在。为弥合这一差距,我们利用大语言模型(LLMs)从原始文本自动合成关系型数据库,包括生成其模式并填充表数据。本文提出SQUiD,一种新型神经符号框架,将该任务分解为四个阶段,每个阶段采用专用技术。实验表明,SQUiD在多个数据集上均持续优于基线方法。代码与数据集已公开:https://github.com/Mushtari-Sadia/SQUiD。
原文摘要 · Abstract (English)
Relational databases are central to modern data management, yet most data exists in unstructured forms like text documents. To bridge this gap, we leverage large language models (LLMs) to automatically synthesize a relational database by generating its schema and populating its tables from raw text. We introduce SQUiD, a novel neurosymbolic framework that decomposes this task into four stages, each with specialized techniques. Our experiments show that SQUiD consistently outperforms baselines across diverse datasets. Our code and datasets are publicly available at: https://github.com/Mushtari-Sadia/SQUiD.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。