基于Gemini的通用嵌入模型,支持多语言与代码文本的高精度表示。
Gemini Embedding: Generalizable Embeddings from Gemini
- 利用Gemini的多语言和代码理解能力生成通用嵌入
- 在250+语言、100+任务的MMTEB上超越现有最优模型
- 统一模型优于专用领域模型,适用于分类、检索等场景
本文介绍Gemini Embedding,一种基于Google最强大语言模型Gemini的先进嵌入模型。凭借Gemini固有的多语言和代码理解能力,Gemini Embedding可为多种语言及文本模态生成高度通用的嵌入表示。这些嵌入可预先计算并应用于分类、相似性、聚类、排序和检索等多种下游任务。在包含250+语言、超过100项任务的Massive Multilingual Text Embedding Benchmark(MMTEB)上评估,Gemini Embedding显著优于先前的顶尖模型,在多语言、英语和代码基准上均达到最先进性能,展现了跨任务和领域的强大能力,超越了专门设计的领域特定模型。
原文摘要 · Abstract (English)
In this report, we introduce Gemini Embedding, a state-of-the-art embedding model leveraging the power of Gemini, Google's most capable large language model. Capitalizing on Gemini's inherent multilingual and code understanding capabilities, Gemini Embedding produces highly generalizable embeddings for text spanning numerous languages and textual modalities. The representations generated by Gemini Embedding can be precomputed and applied to a variety of downstream tasks including classification, similarity, clustering, ranking, and retrieval. Evaluated on the Massive Multilingual Text Embedding Benchmark (MMTEB), which includes over one hundred tasks across 250+ languages, Gemini Embedding substantially outperforms prior state-of-the-art models, demonstrating considerable improvements in embedding quality. Achieving state-of-the-art performance across MMTEB's multilingual, English, and code benchmarks, our unified model demonstrates strong capabilities across a broad selection of tasks and surpasses specialized domain-specific models.
Thank you to arXiv for use of its open access interoperability. PaperDance 不是 arXiv 官方产品;中文卡片由大模型生成,请以原文为准。