arXiv:2605.28308cs.CL2026-05

构建硬负样本数据集,提升知识图谱实体对齐的鲁棒性

HELEA: Hard-Negative Benchmark and LLM-based Reranking for Robust Entity Alignment

论文配图:HELEA: Hard-Negative Benchmark and LLM-based Reranking for Robust Entity Alignment
图 1 · 摘自论文原文
  • 通过同名异义实体对增强训练与评测数据
  • 在硬负样本上达F1 0.967,标准测试集上Hit@1 0.993
  • 无需额外训练,用大模型重排序提升准确性

实体对齐(EA)对知识图谱融合至关重要,但现有基准常被名称重叠所误导,难以评估模型区分同名异义实体的能力。本文提出同名硬负样本增强策略,从名称冲突组中挖掘同名但不同实体对,构建质量可控的评测集(DW-HN29K、DY-HN27K)和增强训练集(DW-Train、DY-Train)。进一步提出HELEA框架:第一阶段在硬负样本增强训练集上训练带1跳知识图谱上下文的实体编码器;第二阶段使用大语言模型进行无须额外训练的重排序。实验表明,依赖名称的基线模型在硬负样本上性能接近随机,而HELEA在DW-HN29K上取得F1 0.967,同时在标准测试集DW-15K上保持Hit@1 0.993。

原文摘要 · Abstract (English)

Entity Alignment (EA) is essential for knowledge graph (KG) fusion, but existing benchmarks often allow models to exploit name overlap rather than relational structure. This makes it difficult to evaluate whether models can reject same-name entities that refer to different real-world objects. Our primary contribution is a same-name hard-negative augmentation strategy that simultaneously yields quality-controlled evaluation benchmarks (DW-HN29K, DY-HN27K) and augmented training corpora (DW-Train, DY-Train), by mining same-name but distinct entity pairs from KG name-collision groups. We further introduce HELEA, a two-stage framework integrating (i) entity encoder retrieval trained on hard-negative-augmented training corpora with 1-hop KG context, and (ii) LLM-based reranking without additional training. Experiments show that name-dependent baselines collapse to near-random performance on our hard-negative benchmarks, while HELEA achieves F1 0.967 on DW-HN29K while maintaining Hit@1 0.993 on standard DW-15K.

知识图谱实体对齐大模型应用硬负样本

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。