用轻量模型实现多语言与跨语言事实核查候选句检索,效果优于多数参赛者。
fact check AI at SemEval-2025 Task 7: Multilingual and Crosslingual Fact-checked Claim Retrieval
- 采用双编码器架构,基于句子相似度微调预训练模型。
- 多语言任务成功率达92%(Success@10),跨语言任务排名第五。
- 仅用500万参数以下模型,在普通显卡上即可训练,适合实际部署。
SemEval-2025 Task 7:多语言与跨语言事实核查声明检索被建模为学习排序任务,采用从预训练变换器微调的双编码器模型,优化句子相似度。多语言检索使用源语言及其英文翻译进行训练,跨语言检索仅使用英文翻译。在仅使用少于500M参数的轻量模型、并在Kaggle T4 GPU上训练的情况下,该方法在多语言任务中取得92% Success@10,在跨语言任务中位列第5,多语言赛道排名第10。
原文摘要 · Abstract (English)
SemEval-2025 Task 7: Multilingual and Crosslingual Fact-Checked Claim Retrieval is approached as a Learning-to-Rank task using a bi-encoder model fine-tuned from a pre-trained transformer optimized for sentence similarity. Training used both the source languages and their English translations for multilingual retrieval and only English translations for cross-lingual retrieval. Using lightweight models with fewer than 500M parameters and training on Kaggle T4 GPUs, the method achieved 92% Success@10 in multilingual and 80% Success@10 in 5th in crosslingual and 10th in multilingual tracks.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。