Embed 5分Pro和Fast两档,均支持文本/图像/图文融合输入,Pro主打检索质量、Fast主打低延迟低成本,附与竞品量化对比。
Cohere 发布了 Embed 5,这是一个新的 embedding 模型系列,面向企业搜索、RAG 和 Agent 检索场景。该系列分两个层级:Embed 5 Pro 追求最高检索质量,Embed 5 Fast 面向在线查询路径的延迟和成本优化。两款模型都支持文本、图片以及文本+图片融合输入,覆盖 100+ 语言,单次输入最多 128K tokens。核心设计理念:Pro 和 Fast 共用同一个 embedding 空间,可以用一款建索引、用另一款查询。
目前已全面可用,通过 Cohere API、Model Vault、Microsoft Foundry 和 Amazon SageMaker 均可调用。私有 VPC 或本地部署通过 vLLM 实现。
API 模型 ID 分别为 embed-v5.0-pro 和 embed-v5.0-fast。两款模型均可输出 2048、1536、1024、768、512 或 256 维向量,默认维度为 2048。向量格式支持 float、int8 或 binary。Pro 价格 $0.12/1M 文本 tokens,Fast 价格 $0.08/1M 文本 tokens。图片输入两款均为 $0.40/1M tokens。
Embed 5 能直接对页面图片进行 embedding,也可以将图片与其元数据融合为单一向量。这对于扫描件、幻灯片、原理图和图表尤为重要——纯文本提取会在这些场景下丢失信息。
Cohere 在 40 个开发数据集上对所有语料库和查询配对进行了测试。以 Pro + Pro 组合为基准 100,Pro 建索引 + Fast 查询的组合得分为 98.4。全程使用 Fast 的组合得分为 96.6。Cohere 推荐的做法是:用 Pro 建索引、用 Fast 查询。有一个约束条件:建索引和查询两侧必须使用相同的输出维度。
这一分层设计针对的是 Agent 工作负载。Agent 在单个任务中可能发出数十次搜索,查询延迟会叠加。团队报告显示,Fast 的处理速度为每秒 377.3 个文档,而 Pro 为 159.7 个文档。
在 ViDoRe V3 基准上,Embed 5 Pro 平均得分 85.8,较 Embed 4 提升 8.8 分。Fast 平均得分 84.5。Voyage 4 Large 得分 83.7,Gemini Embedding 2 得分 83.2,OpenAI text-embedding-3-large 得分 75.5。在 Cohere 自建的解析后 PDF 套件上,Pro 以 84.8 领先于 Voyage 4 Large 的 83.6。
金融领域表现最为突出。Pro 在 FinanceBench(80.1)、FinQA(90.0)和 ViDoRe V3 Finance(85.0)三个金融基准上均排名第一。Fast 在这三项上均排名第二。
多语言结果参差不齐。Pro 在欧洲语言平均分上领先,达到 77。然而在 Cohere 自家结果表中,Gemma Embedding 2 在另外 10 种语言中的 9 种上超越了 Pro,包括日语、阿拉伯语、印地语和泰卢固语。
一个值得注意的重要事项:大多数分数采用 RCP-nDCG@10,这是 Cohere 新推出的指标。它对一个固定候选集进行重排序,因此更多反映的是重排序质量而非第一阶段召回率。Cohere 已公布评估代码,但独立复现仍在等待中。
Embed 5 采用 Matryoshka 表示学习配合低精度输出。一个 2048 维 float32 向量需要 8 KB。一个 1024 维 int8 向量需要 1 KB。一个 256 维 binary 向量仅需 32 bytes。在 1 亿个 chunk 的规模下,原始存储从约 819 GB 降至 3.2 GB。Cohere 推荐 1024 维 int8 作为默认配置,理由是质量接近全精度。
文本输入,向量输出。搜索时按文档向量与查询向量的接近程度对文档进行排序。按下按钮查看运行过程。
文档按余弦相似度排序
文档来自 Cohere 的发布示例代码。向量条形图和相似度分数仅作说明之用,非真实模型输出。
Pro 和 Fast 将向量写入同一空间。选择哪款模型对语料库建索引,哪款对查询进行 embedding。质量经过归一化,Pro + Pro 等于 100。
Cohere 推荐模式:用 Pro 建索引,用 Fast 查询。
图表放大到 90-100 范围,使微小差距可见。
文档吞吐量(文档/秒,Cohere 实测)
每 1M 文本 tokens 价格:Pro $0.12,Fast $0.08。图片在两款层级上均为 $0.40/1M tokens。
Matryoshka 训练允许截断维度。低精度输出进一步减少字节数。修改设置后观察存储变化。
索引中的 chunk 数量:100,000,000
计算公式:维度 × 每值字节数(4、1 或 1/8)。Cohere 推荐 1024 维 int8 作为默认最佳平衡点。Binary 会有一定精度损失,适合在重排序前作为第一轮筛选。
使用新的 RCP-nDCG@10 指标报告的平均分(来源为 Cohere)。在独立跑分结果出来之前,请将这些视为厂商数据。
来源:Cohere Embed 5 发布文章,2026 年 9 月 30 日。RCP-nDCG@10 对固定候选集进行重排序,因此更多反映重排序质量而非第一阶段召回率。
更长的上下文意味着长文档和手册需要更少的 chunk 数。按下播放键比较各模型每次调用的最大输入长度。
限制值取自各厂商的模型文档。128K 以 131,072 tokens 显示以保持柱状图比例。
两款层级均已全面可用。点击路线查看详情。
| 特性 | Cohere Embed 5 Pro | Cohere Embed 5 Fast | Voyage 4 Large | Gemini Embedding 2 | OpenAI text-embedding-3-large |
|---|---|---|---|---|---|
| 最大输入 | 128K tokens | 128K tokens | 32,000 tokens | 8,192 tokens | 8,191 tokens |
| 输入类型 | 文本、图片、融合文本+图片 | 文本、图片、融合文本+图片 | 文本 | 文本、图片、视频、音频、PDF | 文本 |
| 输出维度 | 256 至 2048(6 档) | 256 至 2048(6 档) | 256、512、1024、2048 | 128 至 3072 | 最高 3072(可缩短) |
| 输出格式 | float、int8、binary | float、int8、binary | float、int8、binary、ubinary | float | float |
| 语言覆盖 | 100+ | 100+ | 多语言(未公布数量) | 100+ | 多语言(未公布数量) |
| 层级间共享空间 | 是(与 Fast) | 是(与 Pro) | 是(Voyage 4 系列) | 无同类层级 | 无同类层级 |
| 每 1M 文本 tokens 价格 | $0.12 | $0.08 | $0.12 | $0.20 | $0.13 |
| 私有/自托管 | 是(通过 vLLM 的 VPC 或本地) | 是(通过 vLLM 的 VPC 或本地) | 通过 AWS Marketplace 模型包 | 否(Gemini API、Vertex AI) | 否(仅 API) |
| ViDoRe V3 平均分(Cohere 报告) | 85.8 | 84.5 | 83.7 | 83.2 | 75.5 |
来源:Cohere 博客、Cohere 文档、Voyage 文档、Google Gemini 文档、OpenAI 文档。验证日期:2026 年 10 月 1 日。基准分数来自 Cohere,采用其 RCP-nDCG@10 指标。
Cohere 发布的多模态、多语言 embedding 模型系列,发布于 2026 年 9 月 30 日,分为 Pro 和 Fast 两个层级。
Pro 每 1M 文本 tokens $0.12,Fast 每 1M 文本 tokens $0.08。图片在两款层级上均为 $0.40/1M tokens。
可以。两者共用同一 embedding 空间,只要使用相同的输出维度即可。
查看技术详情、产品页面和 X 上的公告。所有荣誉归于该项目的研究人员。也欢迎关注我们的 Twitter,并别忘了加入我们的 15 万+ ML SubReddit 和订阅我们的 Newsletter。等一下——你用 telegram 吗?现在也可以加入我们了。
有合作意向推广你的 GitHub 仓库、Hugging Face 页面、产品发布或网络研讨会?请联系我们。
Sana Hassan,Marktechpost 咨询实习生,同时是 IIT Madras 双向学位学生,热衷于将技术和 AI 应用于解决现实世界挑战。凭借解决实际问题的浓厚兴趣,他为 AI 与现实生活解决方案的交叉领域带来了全新视角。