arXiv:2510.02336cs.CLcs.AI2025-10被引 1

首个库尔德语语义相似度数据集,助力低资源语言NLP研究

KurdSTS: The Kurdish Semantic Textual Similarity

  • 构建1万组库尔德语句子对,涵盖正式与非正式语体
  • 多语言BERT等模型在该数据集上表现良好但受形态变化挑战
  • 适合关注低资源语言、语义匹配与跨语言模型的研究者

语义文本相似度(STS)衡量两段文本的语义重叠程度,是众多自然语言处理任务的基础。尽管高资源语言已有丰富资源,但低资源语言如库尔德语仍严重缺乏支持。本文首次构建了库尔德语语义文本相似度数据集,包含10,000个句子对,覆盖正式与非正式语体,并进行了语义相似度标注。我们对Sentence-BERT、多语言BERT等强基线模型进行评测,获得具有竞争力的结果,同时揭示了库尔德语形态复杂性、拼写变异和代码混用带来的挑战。该数据集与基线模型共同构成可复现的评估体系,为未来库尔德语语义研究及低资源NLP提供坚实起点。

原文摘要 · Abstract (English)

Semantic Textual Similarity (STS) measures the degree of meaning overlap between two texts and underpins many NLP tasks. While extensive resources exist for high-resource languages, low-resource languages such as Kurdish remain underserved. We present, to our knowledge, the first Kurdish STS dataset: 10,000 sentence pairs spanning formal and informal registers, each annotated for similarity. We benchmark Sentence-BERT, multilingual BERT, and other strong baselines, obtaining competitive results while highlighting challenges arising from Kurdish morphology, orthographic variation, and code-mixing. The dataset and baselines establish a reproducible evaluation suite and provide a strong starting point for future research on Kurdish semantics and low-resource NLP.

语义相似度低资源语言库尔德语NLP

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。