前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9473
  • OpenAI 发布数百个数学难题的解答成果
  • 29款LLM谄媚度基准测试:前沿模型稳住了,小模型全面溃败
  • Anthropic开放Claude最强版本用于安全测试:已发现10万漏洞
  • 谷歌 EmbeddingGemma 2:7.4 亿参数多模态嵌入模型,手机端 191MB 即可运行
  • 无 API 桌面应用远程控制方案:用 CDP 桥接手机与 Claude Code
  • AI功能按调用计费:多数设计在浪费预算
  • Simon Willison 点评 EmbeddingGemma 2:开源权重是嵌入模型唯一理智选择
  • Mistral Large 4预览发布:参数破万亿
  • Google发布EmbeddingGemma 2:开源多模态嵌入模型
  • Google 开源 EmbeddingGemma 2:740M 参数端侧向量模型,191MB 内存跑离线 RAG
  • 间接提示注入攻击链解析与防御架构
  • Whisper 口述转文字 WER 从 8.5% 降至 2.5% 的实战总结
  • 用 AgentCore + OpenClaw 构建持久记忆的个人 AI 助手
  • Google开源EmbeddingGemma 2:7.4亿参数多模态向量模型
  • Mistral Large 4:1.05万亿参数多模态MoE模型预览
  • Vercel AI Gateway 新增置信度触发降级策略
  • QA 工程师自建工具链:验证 AI 编程 Agent 的实际工作成果
  • 一个 MCP 服务器给 Claude Code 接入 200+ 图像视频生成模型
  • Agentic AI 需要元过滤器而非传统 Guardrails:安全架构新思路
  • 2026 开发者调查:AI 编程助手日活高但信任度低
  • GitLab AI Gateway 高危漏洞让我重新审视自建 Agent 权限控制
  • Mistral Large 4 发布:剑指闭源与开源竞品
  • Mistral Large 4:万亿参数主打安全合规
  • Stack Overflow 2026 开发者调查报告发布
  • Mistral Large 4 公开预览:1万亿参数、月底开源
  • Google Gemini 免费版大幅缩限:Flash Lite 限免,Pro/Deep Think 需付费
  • 上线 LLM 功能不死机的工程检查清单
  • AI代理能识别工具失效但仍持续调用,核心问题在于判断与行为的断裂
  • 给Claude Code开发Mod插件:实现额度用量条与项目待办面板
  • LLM 访问控制与监控的实战避坑指南
  • 企业 RAG 实战:混合搜索与重排序的核心差异
  • 日本开发者给 Claude Code 的 Awwwards 级前端 prompt
  • Reflection发布Beam:非中国最强开源模型,编程推理对标GLM
  • Codex CLI vs Claude Code:相同任务实测成本公开
  • Google Docs原生支持Markdown,AI Agent协作成亮点
  • Meta、微软要求员工少用Claude节省成本
  • DeepSeek Harness:24 万 stars 的插件化 AI 工具链
  • 如何给AI编程助手提供正确上下文
  • 12GB显卡跑125B大模型:Strata引擎开源
  • AI 指令遵循失效的深层原因:语义理解≠可靠执行
  • ML 系统上线前的设计审计五问
  • 本地 AI Agent 组织化管理:带预算与汇报链的开源框架
  • LangGraph 替代指南:六大框架实际解决的不同痛点
  • llama-server 推测解码时 logprobs 为假值
  • 已加载 44 / 9473
8.0
热点
AI SCORE
模型发布2026-10-07 02:53

Google开源EmbeddingGemma 2:7.4亿参数多模态向量模型

The New Stack#Google#开源#向量检索
Editor brief · 编辑速览

Google发布EmbeddingGemma 2,740M参数支持文本/代码/图片/视频/音频的向量检索,可直接在端侧设备运行,适合构建本地RAG或代码搜索引擎。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Google 于周二发布了 EmbeddingGemma 2,将文本、代码、图片、视频和音频检索整合在一个 7.4 亿参数的开源模型中,在该公司于 Pixel 11 Pro 上的量化测试中仅占用约 567MB 的活跃内存。

该模型基于 Gemma 4 构建,将五种输入类型映射到同一个 768 维向量空间中。图片不再需要先添加描述文字,音频也不需要先转录,两者都可以直接与文本一起进行搜索。

Google 以 Apache 2.0 协议发布了模型权重,通过 LiteRT 和 MediaPipe Tasks 实现设备端部署现已可用。Android ML Kit 集成(支持 NPU 加速的设备)将在未来几周内推出。

模块化编码器,一个向量空间

完整模型最多达 7.4 亿参数,但开发者只需加载其数据所需的编码器。文本和代码运行在 2.7 亿参数的基座上,Google 在同一手机上测量约需 191MB 活跃内存。

加上图像和视频的视觉编码器,模型达到 4.4 亿参数;替换为音频编码器则达到 5.7 亿参数,同时加载两者则达到完整的 7.4 亿参数。每种配置都投影到同一个嵌入空间中,因此一个团队从纯文本索引开始后,可以在之后添加图像或音频搜索,而无需重新嵌入已经存储的任何内容。

Google 还将上下文窗口扩大四倍,从 2048 增加到 8192 个 token,该公司称这足以覆盖单次输入中最多 5.5 分钟的音频、29 张图片或 58 个视频帧。视频默认按每秒一帧采样,因此这 58 帧相当于不到一分钟的 footage。

在 Google 的 Video Moments Finder 演示中,视频帧和音频片段在本地建立索引,然后通过纯文本进行搜索以定位到特定时刻,整个过程不生成任何字幕或转录文本。Instant Media Search 将相同的方法应用于手机上的照片和视频,将嵌入向量存储在 SQLite 中,并在用户输入时实时更新结果。

Matryoshka 缩小索引

在手机上,索引本身可能与模型竞争空间——因为 100 万个 768 维 bfloat16 向量约占 1.5GB。Google 使用 Matryoshka Representation Learning 训练了 EmbeddingGemma 2,允许开发者在无需重新训练的情况下将这些嵌入向量截断到 512、256 或 128 维。

在 256 维时,100 万向量的索引降至约 500MB。Google 表示,较短的嵌入向量在文本和代码上保持了大部分完整尺寸的质量,在图像、视频和语音检索上保持约 95%。

在 128 维时,权衡更为明显:Google 将文本和代码置于约 90%,但多模态检索降至约 75%,该公司建议在实际数据上测试该设置后再用于多模态查询。在嵌入向量发布中,为效率而牺牲少量检索质量已成为今年秋季的常见策略,正如 Cohere 更快的查询模型在其自身测试中几乎不影响检索质量一样。

设备端代码搜索

代码与文本运行在同一个 2.7 亿参数的基座上,Google 报告 EmbeddingGemma 2 的 MTEB Code 得分为 78.68,高于原始 EmbeddingGemma 的 68.76。

为了展示它在 agent 工作流中的表现,Google 使用纯文本设置对 Hugging Face Transformers 仓库进行嵌入,并将该索引与在 Pi 上运行的 Gemma 4 26B A4B 配对。这正是某个 MCP 服务器变通方案背后的同一 agent 框架——该方案在使用前消耗了 18000 个 token。在 Google 的设置中,EmbeddngGemma 2 负责仓库中的检索工作,而更大的模型则驱动 agent。

同一个嵌入模型还可以通过 MediaPipe Decision 处理分类任务,它将输入的嵌入向量与候选描述进行比较,而不是生成回复。在一个设备端国际象棋演示中,Google 用它在不到 100 毫秒内评估每回合 500 个选项。如果你见过 agent 在一个根本不需要生成答案的决策上烧掉 token,这提供了一种更便宜的方式来做出判断。

更轻量的本地 RAG 管道

EmbeddingGemma 2 借用了 Gemma 4 的文本分词器和音频编码器架构,这意味着两个模型在设备上一起运行时占用更少的内存。目前 Google 已在自己的旗舰手机上展示了多模态检索工作。我们只能等待,看看更大的索引、不同的硬件以及非 Google 演示的应用会表现如何。

Original source

本文由 AI 翻译整理自 The New Stack,原文版权归原作者所有。

阅读英文原文
上一篇
用 AgentCore + OpenClaw 构建持久记忆的个人 AI 助手
下一篇
Mistral Large 4:1.05万亿参数多模态MoE模型预览