arXiv:2409.07088cs.CLcs.AI2024-09被引 2

用大模型自动生成585万对无本体的图文本数据,提升通用领域文本生成效果。

Ontology-Free General-Domain Knowledge Graph-to-Text Generation Dataset Synthesis using Large Language Model

  • 利用大模型与数据评估工具自动构建无本体图文本对
  • 生成585万对高质量数据,图文一致性高
  • 适合研究通用领域知识图谱文本生成的学者

知识图谱到文本(G2T)生成旨在将结构化知识图谱转化为自然语言文本。尽管预训练语言模型(PLM)提升了G2T性能,但其效果依赖于精确对齐的高质量数据集。然而,通用领域高质量G2T数据集稀缺,制约了该方向的发展。为此,我们提出Wikipedia Ontology-Free Graph-text dataset(WikiOFGraph),一个基于大语言模型(LLM)与Data-QuestEval的新方法生成的大规模通用领域图文本数据集。该数据集包含585万对通用领域图文本对,无需外部本体即可实现高图文一致性。实验表明,基于WikiOFGraph微调的PLM在多个评估指标上均优于其他数据集训练的模型。该方法可扩展且高效,显著推动了通用领域G2T生成的研究进展。

原文摘要 · Abstract (English)

Knowledge Graph-to-Text (G2T) generation involves verbalizing structured knowledge graphs into natural language text. Recent advancements in Pretrained Language Models (PLMs) have improved G2T performance, but their effectiveness depends on datasets with precise graph-text alignment. However, the scarcity of high-quality, general-domain G2T generation datasets restricts progress in the general-domain G2T generation research. To address this issue, we introduce Wikipedia Ontology-Free Graph-text dataset (WikiOFGraph), a new large-scale G2T dataset generated using a novel method that leverages Large Language Model (LLM) and Data-QuestEval. Our new dataset, which contains 5.85M general-domain graph-text pairs, offers high graph-text consistency without relying on external ontologies. Experimental results demonstrate that PLM fine-tuned on WikiOFGraph outperforms those trained on other datasets across various evaluation metrics. Our method proves to be a scalable and effective solution for generating high-quality G2T data, significantly advancing the field of G2T generation.

知识图谱文本生成大模型数据合成

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。