Google正式发布EmbeddingGemma 2,采用Apache 2.0许可证,支持多模态嵌入,专为RAG和相似度检索场景优化。
EmbeddingGemma 2 是目前能力最强的设备端多模态Embedding模型,能够将文本、图片、音频和视频的组合原生映射到统一的Embedding空间。
Research Engineer, Google DeepMind
Henrique Schechter Vera
Research Engineer, Google DeepMind
Your browser does not support the audio element.
去年我们推出了 EmbeddingGemma,旨在为高质量文本Embedding提供轻量级选项,帮助你的应用直接在消费级硬件上组织、搜索和连接信息。开发者社区的反响远超预期。下载量超过 2000 万次,建设者们用它来驱动更智能的设备端搜索工具和隐私优先的 RAG(检索增强生成)管道。
今天,我们发布 EmbeddingGemma 2,将能力从文本扩展到代码、图片、视频和音频,在共享的Embedding空间中实现统一。EmbeddingGemma 2 基于 Gemma 4 架构构建,采用商业友好的 Apache 2.0 许可证发布,拥有 7.4 亿参数,专为设备端推理优化。它可以帮助从语音备忘录中找到特定的视频片段,或基于文本查询在数小时的音频记录中进行搜索——所有这些都由一个原生多模态模型完成处理。
EmbeddingGemma 2 基于与 Gemini Embedding 模型相同的技术构建,具有以下特性:
同尺寸中的最佳性能: 在 MTEB(大规模文本Embedding基准)Code 和 MAEB(大规模音频Embedding基准)等基准测试中,在亚 1B 多模态Embedding模型中实现领先分数,同时在文本、视觉和音频任务上匹配或超越许多更大的模型。
模块化设计: 纯文本工作负载仅需 2.7 亿参数即可运行,可选配视觉编码器(1.7 亿)和音频编码器(3 亿)以支持完整的多模态能力。
存储高效: 采用 Matryoshka 表示学习(MRL),开发者可以将输出向量从 768 维动态截断至 512、256 或 128 维。本地向量数据库和内存使用可实现最高 6 倍的存储缩减。
设备端性能优化: 在紧张的资源约束下高效运行。使用量化时,在 Google Pixel 11 Pro 上,EmbeddingGemma 2 纯文本权重仅需约 191MB 活跃内存,完整多模态模型仅需约 567MB。
扩展上下文支持: 具备 8K token 的上下文窗口(是 EmbeddingGemma 1 的 4 倍),可本地硬件上直接处理最多 5.5 分钟的音频、29 张图片、58 帧视频或其交错组合。
EmbeddingGemma 2 在保持 EmbeddingGemma 强大多语言文本性能的同时,在代码性能上实现了 9.92 点的显著提升(MTEB Code 从 68.76 提升至 78.68),非常适合本地代码库索引、语义代码搜索和编码 Agent 检索。在图片、视频、文档和音频方面,它为亚 1B 模型设立了质量与参数比的新标准,甚至超越了一些参数规模是其两倍多的专业模型。
完整的评估指标和模型信息请参阅 EmbeddingGemma 2 模型卡片。
EmbeddingGemma 2 将强大能力直接带到边缘硬件。本地生成Embedding有助于保障数据隐私、减少管道延迟,并使开发者能够构建完全离线运行的多模态搜索和检索系统。
与 Gemma 4 等生成模型搭配使用时,EmbeddingGemma 2 能够构建理解复杂多模态数据的设备端 RAG 管道。由于 EmbeddingGemma 2 基于 Gemma 4 构建并共享其文本分词器和音频编码器,开发者可以在统一管道中以更低的总内存占用同时运行这两个模型。
了解如何使用 LiteRT构建设备端搜索和 RAG 系统,请阅读 Google AI Edge 博客文章。
我们与以下合作伙伴紧密协作,确保 EmbeddingGemma 2 在你构建的地方立即可用:
下载模型: 在 Hugging Face 和 Kaggle 上获取模型权重,Gemini Enterprise Agent Platform Model Garden 即将上线。访问 Hugging Face 上的 LiteRT Community 获取针对设备端优化的模型。
设备端部署:
使用你喜欢的开发工具:
微调: 遵循 Unsloth 的指导,了解如何针对你的使用场景微调 EmbeddingGemma 2。
探索我们的开发者指南、文档以及推理和微调指南。