谷歌官方介绍 Gemini Embedding 在检索增强生成(RAG)中的用法和最佳实践。对构建 LLM 应用的开发者有直接参考价值。
自 Gemini Embedding 文本模型正式发布以来,我们看到开发者迅速采用它来构建先进的 AI 应用。除了分类、语义搜索和检索增强生成(RAG)等传统用例,许多开发者如今还在运用一种名为上下文工程(context engineering)的技术,为 AI Agent 提供完整的运行上下文。Embedding 在其中至关重要,因为它能够高效识别文档、对话历史和工具定义等关键信息,并将其直接整合到模型的工作记忆中。
下面这些案例展示了各行各业的组织如何利用 Gemini Embedding 模型,为复杂的系统提供支持。
智能内容管理平台 Box 正在集成 Gemini Embedding,以实现一个关键用例:回答有关复杂文档的问题,并从中提取洞察。在评估过程中,gemini-embedding-001 找到正确答案的比例超过 81%,与其他 Embedding 模型相比,召回率提高了 3.6%。除了性能上的提升,该模型内置的多语言支持对 Box 的全球用户而言也是一项极具潜力的进展,使 Box AI 能够从不同语言和地区的内容中发掘洞察。
金融科技公司 re:cap 使用 Embedding 对大量 B2B 银行交易进行分类。他们在包含 21,500 笔交易的数据集上,将 gemini-embedding-001 与 Google 之前的模型(text-embedding-004 和 text-embedding-005)进行了基准测试,以衡量其影响。结果发现,gemini-embedding-001 的 F1 分数分别提高了 1.9% 和 1.45%。F1 分数兼顾模型的精确率和召回率,对于分类任务至关重要。这表明,Gemini Embedding 这样能力出色的模型能够直接带来显著的性能提升,帮助 re:cap 为客户提供更精准的流动性洞察。
Everlaw 是一个提供可验证 RAG 的平台,帮助法律专业人士分析大量证据开示文档。该平台需要在数百万份专业文本中进行精确的语义匹配。通过内部基准测试,Everlaw 发现 gemini-embedding-001 表现最佳:它能从 140 万份包含行业专用术语和复杂法律术语的文档中找出相关答案,准确率达到 87%,超过 Voyage(84%)和 OpenAI(73%)的模型。
此外,Gemini Embedding 的 Matryoshka 特性使 Everlaw 能够使用紧凑的表示形式,将关键信息集中在更少的维度中。这样不仅能将性能损失降至最低,还可以降低存储成本,并提高检索和搜索效率。
开源 AI 编程助手 Roo Code 使用 Gemini Embedding 模型支持代码库索引和语义搜索。由于 Roo Code 会像人类队友一样跨多个文件进行交互,开发者需要的搜索功能不仅要理解语法,还要能够理解意图。
通过将 gemini-embedding-001 与 Tree-sitter 结合,对代码进行符合逻辑的拆分,Roo Code 即使面对不够精确的查询,也能返回高度相关的结果。经过初步测试,他们发现 Gemini Embedding 显著改善了由 LLM 驱动的代码搜索,使其更加灵活、准确,也更符合开发者的工作流程。
Mindlid 的 AI 健康伙伴利用 gemini-embedding-001 理解对话历史,从而提供能够实时适应用户需求、感知上下文且富有意义的洞察。他们记录了令人印象深刻的性能表现:延迟稳定保持在一秒以内,中位数为 420ms;top-3 召回率达到可量化的 82%,比 OpenAI 的 text-embedding-3-small 高出 4%。
这表明,Gemini Embedding 可以通过提供最相关的信息,提高其 AI 支持服务的相关性和响应速度。
Interaction Co. 正在开发 Poke,这是一款能够自动执行任务并从 Gmail 中提取信息的 AI 邮件助手。Poke 使用 Gemini Embedding 实现两项关键功能:检索用户的“记忆”,以及识别相关邮件来丰富上下文。
集成 gemini-embedding-001 后,Poke 的语言模型能够以更快的速度和更高的精确度检索数据。他们报告称,与 Voyage-2 相比,为 100 封邮件生成 Embedding 的平均耗时大幅减少了 90.4%,仅需 21.45 秒即可完成。
随着 AI 系统变得更加自主,其有效性将取决于我们为它们提供的上下文质量。gemini-embedding-001 这类高性能 Embedding 模型,是构建下一代 Agent 的基础组件。这些 Agent 将能够进行推理、检索信息,并代表我们采取行动。
要开始使用 Embedding,请参阅 Gemini API 文档。
性能指标由开发者提供,未经 Google 独立验证。