前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8626
  • Project Glasswing:AI 时代关键软件安保计划
  • Marimo Pair:响应式 Notebook 构建 Agent 开发环境
  • Hippo:生物启发的 Agent 内存架构
  • Freestyle:编程 Agent 的隔离执行沙箱
  • 大规模 AI 编排系统的可观测性工程实践
  • Claude Code 2月更新后复杂工程任务失效问题
  • Google Maps for Codebases:代码库 AI 导航工具
  • 迷你 LLM:语言模型工作原理从零演示项目
  • 浏览器本地运行 AI 模型:Gemma Gem 无需 API 密钥
  • Codex 团队自用产品经验:10 个要点 Spec 撑起 50 人团队
  • Claude Code Token 优化秘诀:理解提示缓存才能降成本
  • LM Studio 新 CLI 简化本地 Gemma 4 部署流程
  • Nanocode:JAX + TPU 实现的极简编码助手
  • 树莓派上的自托管 AI 代理:35 提供商 72 工具
  • 深度拆解编程智能体:6 大核心组件的架构设计
  • LLM Wiki:"想法文件" 知识管理范例
  • sllm:GPU 节点共享,实现不限量 Token 调用
  • 编程智能体如何利用工具和上下文实现高效编码
  • Claude Code发现隐藏23年的Linux漏洞
  • 用虚拟文件系统替代RAG的AI文档助手架构
  • Gemma 4开源模型发布:推理与Agent优化
  • 通义千问Qwen3.6-Plus:Agent应用专优
  • Lemonade:AMD开源本地LLM服务器
  • Claude Code安全泄露事件
  • Cursor IDE发布3代新界面
  • Gemma 4多模态模型:设备端部署优化
  • AI 落地三大洞察:帕累托法则、非确定性与早期机遇
  • Falcon Perception:Hugging Face 新开源模型
  • Claude 自动生成内核级 RCE 漏洞利用代码
  • Claude Code 完全指南:工作原理与最佳实践
  • 学习开源代码的四步递进法:从跑通到从零搭建
  • Gradio 后端驱动:快速构建自定义 AI 应用前端
  • OpenAI 领导层:自我改进、Super App 与 AGI 路径
  • Claude Dispatch:接口设计如何制约 AI 能力释放
  • PostgreSQL 的 BM25 全文搜索扩展开源
  • Granite 4.0 3B:企业文档的轻量级多模态模型
  • Claude Code 源码泄露分析:假工具、匹配坑、隐藏模式
  • Claude Code 用户遭遇使用限制提前耗尽
  • Claude Code 源码因 NPM 地图文件泄露
  • 产品思维是 AI 编程工具替不了的能力
  • 通用 Claude.md 秘诀:切减输出 Token
  • TRL 1.0:随行业发展的开源微调库
  • 做中学:Claude Code 实战教程
  • AI 代理审计发现:内容问题逐一报警
  • Zerobox:隔离运行命令的沙箱工具
  • 长链路 Agent 的能力与限制
  • Claude Code 工具 Bug:强制重置代码仓库
  • 谷歌重新想象 AI 时代的鼠标指针
  • LLM 推理优化:KV Cache 压缩方案
  • AI 辅助求解 Knuth 经典问题的进展
  • AI 破译古代亚述泥板的新尝试
  • 已加载 51 / 8626
9.0
重磅
AI SCORE
模型发布2026-04-03 00:00

Gemma 4开源模型发布:推理与Agent优化

Google DeepMind#Google#开源模型#Agent
Editor brief · 编辑速览

Google DeepMind发布Gemma 4开源模型,号称性能最强,专为高级推理和Agent工作流优化。开发者可获得性能更强的本地开源替代方案。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

关于本文章作者

Google DeepMind 研究副总裁

Google DeepMind 产品管理总监

您的浏览器不支持音频元素。


今天,我们推出 Gemma 4 ——迄今为止我们最智能的开源模型。专为高级推理和 agent 工作流设计,Gemma 4 提供了前所未有的每参数智能水平。这一突破建立在社区巨大推动力的基础上:自我们推出第一代以来,开发者已下载 Gemma 超过 4 亿次,构建了一个拥有 10 万多个变体的生机勃勃的 Gemmaverse。我们认真听取了创新者们对 AI 未来的需求,Gemma 4 是我们的答案:突破性能力在 Apache 2.0 许可证下广泛可用。

Open model performance vs size on Arena.ai's chat arena as of 4/1.

Gemma 4 采用与 Gemini 3 相同的世界一流研究和技术构建,是你能在自己的硬件上运行的最强能模型系列。它们补充了我们的 Gemini 模型,为开发者提供了业界最强大的开源和专有工具的结合。

行业领先的能力和移动优先 AI

我们推出四种灵活规模的 Gemma 4:Effective 2B (E2B)、Effective 4B (E4B)、26B Mixture of Experts (MoE) 和 31B Dense。整个模型家族超越了简单聊天,能够处理复杂逻辑和 agent 工作流。我们的更大型模型在各自规模上提供了最先进的性能:31B 模型目前在业界标准 Arena AI 文本排行榜上排名第 3,26B 模型位居第 6。在这个排行榜上,Gemma 4 的性能超过了体型大 20 倍的模型。对于开发者来说,这一新的每参数智能水平意味着能以显著更少的硬件开销实现前沿级别的能力。

在边缘端,我们的 E2B 和 E4B 模型重新定义了设备端的实用性,优先考虑多模态能力、低延迟处理和无缝生态系统集成,而非单纯的参数数量。

强大、可及、开放

为了推动下一代开创性研究和产品,我们特别调整了 Gemma 4 模型的规模,使其能在各种硬件上高效运行和微调 ——从全球数十亿台 Android 设备,到笔记本电脑 GPU,再到开发者工作站和加速器。

通过使用这些高度优化的模型,你可以针对特定任务对 Gemma 4 进行微调,以实现最先进的性能。我们已经看到了这一方法的巨大成功;例如,INSAIT 创建了开创性的保加利亚语优先语言模型 (BgGPT),我们与耶鲁大学合作的 Cell2Sentence-Scale 发现了癌症治疗的新途径,还有许多其他项目。

以下是使 Gemma 4 成为迄今最强开源模型家族的关键特性:

高级推理:能够进行多步骤规划和深层逻辑,Gemma 4 在数学和指令遵循等基准测试中表现出显著改进。

Agent 工作流:原生支持函数调用、结构化 JSON 输出和原生系统指令,使你能够构建自主 agent,与不同工具和 API 交互,可靠地执行工作流。

代码生成:Gemma 4 支持高质量离线代码,将你的工作站变成本地优先的 AI 代码助手。

视觉和音频:所有模型原生处理视频和图像,支持可变分辨率,在 OCR 和图表理解等视觉任务上表现出色。此外,E2B 和 E4B 模型还具有用于语音识别和理解的原生音频输入。

更长上下文:无缝处理长文本内容。边缘模型具有 128K 上下文窗口,而更大型模型提供最高 256K,允许你在单个 prompt 中传入代码库或长文档。

140+ 语言:原生训练于 140 多种语言,Gemma 4 帮助开发者为全球受众构建包容、高性能的应用。

适应多样硬件的多功能模型

我们按特定硬件和用例量身定制了 Gemma 4 模型权重,确保你无论在哪里都能获得前沿级别的推理能力:

26B 和 31B 模型:你个人电脑上的前沿智能

为研究人员和开发者优化,在可访问硬件上提供最先进推理,我们的无量化 bfloat16 权重可高效拟合于单个 80GB NVIDIA H100 GPU。对于本地设置,量化版本原生运行在消费级 GPU 上,为你的 IDE、代码助手和 agent 工作流提供动力。我们的 26B Mixture of Experts (MoE) 侧重于延迟,推理时仅激活其总参数中的 38 亿,以交付异常快的 tokens-per-second,而我们的 31B Dense 最大化原始质量,为微调提供强大基础。

这些模型已针对大量不同数据集和指标进行评估,以涵盖文本生成的不同方面。参阅模型卡中的其他基准测试。

E2B 和 E4B 模型:移动和 IoT 设备的全新智能水平

从零开始精心设计以追求最大计算和内存效率,这些模型在推理时激活有效 20 亿和 40 亿参数的足迹,以保护 RAM 和电池寿命。在与我们 Google Pixel 团队以及 Qualcomm Technologies 和 MediaTek 等移动硬件领导者的密切合作下,这些多模态模型在手机、Raspberry Pi 和 NVIDIA Jetson Orin Nano 等边缘设备上完全离线运行,延迟接近零。Android 开发者现在可以在 AICore Developer Preview 中原型制作 agent 流程,以实现与 Gemini Nano 4 的向前兼容性。

开源许可证

你给了我们反馈,我们用心倾听了。构建 AI 的未来需要协作方法,我们相信在不设限制障碍的情况下赋能开发者生态。这就是为什么 Gemma 4 在商业友好的 Apache 2.0 许可证下发布。

这个开源许可证为完整的开发者灵活性和数字主权提供基础;你拥有对数据、基础设施和模型的完全控制权。它允许你在任何环境中自由构建和安全部署,无论在本地还是在云端。

建立在信任和安全基础上

这些模型经历了与我们专有模型相同的严格基础设施安全协议。通过选择 Gemma 4,企业和主权组织获得了一个可信、透明的基础,提供最先进的能力,同时满足安全和可靠性的最高标准。

选择生态系统

秒级开始体验:立即访问 Gemma 4 并开始构建。在 Google AI Studio(31B 和 26B MoE)或 Google AI Edge Gallery(E4B 和 E2B)中探索 Gemma 4。对于 Android 开发,使用它在 Android Studio 中为 Agent Mode 提供动力,并开始在 Android 上构建生产应用(使用 ML Kit GenAI Prompt API)。

使用你喜爱的工具:在 Hugging Face (Transformers, TRL, Transformers.js, Candle)、LiteRT-LM、vLLM、llama.cpp、MLX、Ollama、NVIDIA NIM 和 NeMo、LM Studio、Unsloth、SGLang、Cactus、Baseten、Docker、MaxText、Tunix、Keras 上的第一天支持,你可以灵活选择最适合你项目的工具。

下载模型:从 Hugging Face、Kaggle 或 Ollama 获取模型权重。

将 Gemma 4 定制到你的特定需求:使用你喜爱的平台训练和调整模型,如 Google Colab、Vertex AI 或甚至你的游戏 GPU。

在 Google Cloud 上扩展到生产:虽然本地设备推理最适合离线使用,Google Cloud 消除了所有计算限制。通过 Vertex AI、Cloud Run、GKE、Sovereign Cloud、TPU 加速服务和最高级别的合规保证来部署你的方式。在此了解如何开始使用 Google Cloud。

跨多个硬件平台加速 AI 开发:Gemma 4 开箱即优化了业界领先硬件。从 NVIDIA Jetson Orin Nano 到 Blackwell GPU 的 NVIDIA AI 基础设施上体验最大性能,通过开源 ROCm™ 栈与 AMD GPU 集成,或在 Trillium 和 Ironwood TPU 上部署以实现大规模和效率。

竞争以创造影响:加入 Kaggle 上的 Gemma 4 Good Challenge,构建在世界上创造有意义、积极改变的产品。

Original source

本文由 AI 翻译整理自 Google DeepMind,原文版权归原作者所有。

阅读英文原文
上一篇
用虚拟文件系统替代RAG的AI文档助手架构
下一篇
通义千问Qwen3.6-Plus:Agent应用专优