arXiv:2505.16814cs.CL2025-05中稿 · AACL 2025被引 7

合成数据能提升低资源语言的命名实体识别效果。

Does Synthetic Data Help Named Entity Recognition for Low-Resource Languages?

  • 用合成数据扩充低资源语言标注样本
  • 11种语言中多数表现提升,但效果差异大
  • 适合研究低资源NLP与数据增强的学者

低资源语言的命名实体识别旨在为标注数据稀缺的语言构建稳健系统,是自然语言处理领域的研究热点。数据增强常用于增加低资源标注数据量。本文探讨了在多语言、低资源命名实体识别场景下合成数据的作用,覆盖11种来自不同语系的语言。实验结果表明,合成数据确实在低资源语言命名实体识别中具有潜力,但不同语言间表现差异显著。

原文摘要 · Abstract (English)

Named Entity Recognition(NER) for low-resource languages aims to produce robust systems for languages where there is limited labeled training data available, and has been an area of increasing interest within NLP. Data augmentation for increasing the amount of low-resource labeled data is a common practice. In this paper, we explore the role of synthetic data in the context of multilingual, low-resource NER, considering 11 languages from diverse language families. Our results suggest that synthetic data does in fact hold promise for low-resource language NER, though we see significant variation between languages.

命名实体识别低资源语言数据增强合成数据

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。