arXiv:2601.00366cs.CLcs.AI2026-01被引 1

让BERT的[CLS]向量摆脱语言依赖,实现跨语言语义统一

BERT-JEPA: Reorganizing CLS Embeddings for Language-Invariant Semantics

  • 在BERT基础上引入JEPA自监督目标,重构[CLS]向量
  • 多语言评测性能显著提升,克服了原有嵌入空间的坍缩问题
  • 适合需要跨语言语义对齐的研究者和开发者

联合嵌入预测架构(JEPA)是一种新兴的自监督训练方法,在多个领域展现出潜力。本文提出BERT-JEPA(BEPA),在类BERT模型中引入JEPA训练目标,旨在解决[CLS]嵌入空间坍缩问题,并将其转化为语言无关的语义空间。该结构使模型在多语言基准测试中表现显著提升,实现了更稳健的跨语言表征学习。

原文摘要 · Abstract (English)

Joint Embedding Predictive Architectures (JEPA) are a novel self supervised training technique that have shown recent promise across domains. We introduce BERT-JEPA (BEPA), a training paradigm that adds a JEPA training objective to BERT-style models, working to combat a collapsed [CLS] embedding space and turning it into a language-agnostic space. This new structure leads to increased performance across multilingual benchmarks.

自监督多语言嵌入优化

Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。