arXiv:2503.09011cs.CL2025-03ACL被引 3

跨语言事实核查检索模型在多语种数据上表现优异

Word2winners at SemEval-2025 Task 7: Multilingual and Crosslingual Fact-Checked Claim Retrieval

论文配图:Word2winners at SemEval-2025 Task 7: Multilingual and Crosslingual Fact-Checked Claim Retrieval
图 1 · 摘自论文原文
  • 用机器翻译增强多语言检索,优化零样本模型
  • 跨语言数据准确率达85%,单语数据达92%
  • 适合需要多语种信息验证的研究与应用

本文介绍我们参与的 SemEval 2025 Task 7:先前已核查声明检索。该任务要求从包含多种语言社交媒体内容和事实核查条目的大型多语言 MultiClaim 数据集中,为给定声明检索相关事实核查。为应对挑战,我们首先评估了先进英文及多语言检索模型的零样本性能,随后对表现最佳的系统进行微调,并利用机器翻译提升跨语言检索效果。最终模型在跨语言数据上达到85%准确率,在单语数据上达到92%。

原文摘要 · Abstract (English)

This paper describes our system for SemEval 2025 Task 7: Previously Fact-Checked Claim Retrieval. The task requires retrieving relevant fact-checks for a given input claim from the extensive, multilingual MultiClaim dataset, which comprises social media posts and fact-checks in several languages. To address this challenge, we first evaluated zero-shot performance using state-of-the-art English and multilingual retrieval models and then fine-tuned the most promising systems, leveraging machine translation to enhance crosslingual retrieval. Our best model achieved an accuracy of 85% on crosslingual data and 92% on monolingual data.

跨语言检索事实核查多语言

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。