arXiv:2510.10159cs.CL2025-10Conference of the …被引 5

构建45种语言儿童习得语言的数据集,助力多语言预训练与认知建模。

BabyBabelLM: A Multilingual Benchmark of Developmentally Plausible Training Data

  • 模拟从出生到掌握母语的语言学习过程,构建发育合理数据集。
  • 覆盖每种语言约1亿英文词量的文本内容,总计45种语言。
  • 提供评估工具和基线模型,适合多语言与认知研究者使用。

我们提出 BabyBabelLM,一个模拟人类从出生到掌握母语过程中所接触语言的多语言数据集。该数据集旨在构建发育合理、可复现的预训练数据,覆盖相当于1亿英文词量的内容,涵盖45种语言。我们还建立了评估套件,并在每种语言上训练了基线模型。BabyBabelLM 旨在推动多语言预训练与语言习得的认知建模研究。

原文摘要 · Abstract (English)

We present BabyBabelLM, a multilingual collection of datasets modeling the language a person observes from birth until they acquire a native language. We curate developmentally plausible pretraining data aiming to cover the equivalent of 100M English words of content in each of 45 languages. We compile evaluation suites and train baseline models in each language. BabyBabelLM aims to facilitate multilingual pretraining and cognitive modeling.

多语言语言习得数据集认知建模

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。