用跨语言数据增强提升巴基斯坦低资源语言的命名实体识别效果
Enhancing NER Performance in Low-Resource Pakistani Languages using Cross-Lingual Data Augmentation
- 通过生成符合文化语境的句子扩充数据,提升低资源语言表现
- 在信德语和普什图语上实现显著性能提升,尤其在少样本场景下
- 适合关注低资源语言NLP、数据增强与少样本学习的研究者
命名实体识别(NER)是自然语言处理中的基础任务,已在高资源语言中取得显著进展。然而,由于缺乏标注数据集以及预训练语言模型中的代表性不足,低资源语言的NER研究仍处于薄弱状态。为应对这一挑战,本文提出一种数据增强技术,可生成符合文化背景的句子,并在四种巴基斯坦低资源语言——乌尔都语、沙赫穆基语、信德语和普什图语上进行实验。通过微调多语言掩码大语言模型,该方法在沙赫穆基语和普什图语上展现出显著的性能提升。此外,我们还探索了生成式大语言模型在少样本学习条件下的NER与数据增强能力。
原文摘要 · Abstract (English)
Named Entity Recognition (NER), a fundamental task in Natural Language Processing (NLP), has shown significant advancements for high-resource languages. However, due to a lack of annotated datasets and limited representation in Pre-trained Language Models (PLMs), it remains understudied and challenging for low-resource languages. To address these challenges, we propose a data augmentation technique that generates culturally plausible sentences and experiments on four low-resource Pakistani languages; Urdu, Shahmukhi, Sindhi, and Pashto. By fine-tuning multilingual masked Large Language Models (LLMs), our approach demonstrates significant improvements in NER performance for Shahmukhi and Pashto. We further explore the capability of generative LLMs for NER and data augmentation using few-shot learning.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。