为芬兰语训练了多种规模的ModernBERT模型,效果优于现有单语和多语模型。
Pretraining Finnish ModernBERTs
- 基于芬兰相关语言数据,预训练6种规模的ModernBERT编码器。
- 在超过512词元的长上下文任务中表现超越单语模型。
- 适合需要芬兰语长文本理解的研究与应用开发者。
本文报告了在六种不同规模(参数量从5100万到4.75亿)下预训练ModernBERT编码器模型的结果,重点聚焦于有限的多语言性,并强调对芬兰相关的语言。我们的模型在性能上与现有多语言模型相当或更优,在需要超过512个词元上下文的任务中优于单语模型。我们还提供了在训练最后阶段使用不同数据集的实证结果。代码与模型已公开发布。
原文摘要 · Abstract (English)
This paper reports on pretraining ModernBERT encoder models in six different sizes, ranging from 51M to 475M parameters, with a focus on limited multilingualism, emphasizing languages relevant to Finland. Our models are competitive with, or superior to, existing multilingual models. They outperform monolingual models on tasks that require a context longer than 512 tokens. We present empirical results on using different data in the final stage of training. The code and models are publicly released.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。