Google DeepMind发布Gemma 4开源模型,号称性能最强,专为高级推理和Agent工作流优化。开发者可获得性能更强的本地开源替代方案。
Google DeepMind 研究副总裁
Google DeepMind 产品管理总监
您的浏览器不支持音频元素。
今天,我们推出 Gemma 4 ——迄今为止我们最智能的开源模型。专为高级推理和 agent 工作流设计,Gemma 4 提供了前所未有的每参数智能水平。这一突破建立在社区巨大推动力的基础上:自我们推出第一代以来,开发者已下载 Gemma 超过 4 亿次,构建了一个拥有 10 万多个变体的生机勃勃的 Gemmaverse。我们认真听取了创新者们对 AI 未来的需求,Gemma 4 是我们的答案:突破性能力在 Apache 2.0 许可证下广泛可用。
Open model performance vs size on Arena.ai's chat arena as of 4/1.
Gemma 4 采用与 Gemini 3 相同的世界一流研究和技术构建,是你能在自己的硬件上运行的最强能模型系列。它们补充了我们的 Gemini 模型,为开发者提供了业界最强大的开源和专有工具的结合。
我们推出四种灵活规模的 Gemma 4:Effective 2B (E2B)、Effective 4B (E4B)、26B Mixture of Experts (MoE) 和 31B Dense。整个模型家族超越了简单聊天,能够处理复杂逻辑和 agent 工作流。我们的更大型模型在各自规模上提供了最先进的性能:31B 模型目前在业界标准 Arena AI 文本排行榜上排名第 3,26B 模型位居第 6。在这个排行榜上,Gemma 4 的性能超过了体型大 20 倍的模型。对于开发者来说,这一新的每参数智能水平意味着能以显著更少的硬件开销实现前沿级别的能力。
在边缘端,我们的 E2B 和 E4B 模型重新定义了设备端的实用性,优先考虑多模态能力、低延迟处理和无缝生态系统集成,而非单纯的参数数量。
为了推动下一代开创性研究和产品,我们特别调整了 Gemma 4 模型的规模,使其能在各种硬件上高效运行和微调 ——从全球数十亿台 Android 设备,到笔记本电脑 GPU,再到开发者工作站和加速器。
通过使用这些高度优化的模型,你可以针对特定任务对 Gemma 4 进行微调,以实现最先进的性能。我们已经看到了这一方法的巨大成功;例如,INSAIT 创建了开创性的保加利亚语优先语言模型 (BgGPT),我们与耶鲁大学合作的 Cell2Sentence-Scale 发现了癌症治疗的新途径,还有许多其他项目。
以下是使 Gemma 4 成为迄今最强开源模型家族的关键特性:
高级推理:能够进行多步骤规划和深层逻辑,Gemma 4 在数学和指令遵循等基准测试中表现出显著改进。
Agent 工作流:原生支持函数调用、结构化 JSON 输出和原生系统指令,使你能够构建自主 agent,与不同工具和 API 交互,可靠地执行工作流。
代码生成:Gemma 4 支持高质量离线代码,将你的工作站变成本地优先的 AI 代码助手。
视觉和音频:所有模型原生处理视频和图像,支持可变分辨率,在 OCR 和图表理解等视觉任务上表现出色。此外,E2B 和 E4B 模型还具有用于语音识别和理解的原生音频输入。
更长上下文:无缝处理长文本内容。边缘模型具有 128K 上下文窗口,而更大型模型提供最高 256K,允许你在单个 prompt 中传入代码库或长文档。
140+ 语言:原生训练于 140 多种语言,Gemma 4 帮助开发者为全球受众构建包容、高性能的应用。
我们按特定硬件和用例量身定制了 Gemma 4 模型权重,确保你无论在哪里都能获得前沿级别的推理能力:
26B 和 31B 模型:你个人电脑上的前沿智能
为研究人员和开发者优化,在可访问硬件上提供最先进推理,我们的无量化 bfloat16 权重可高效拟合于单个 80GB NVIDIA H100 GPU。对于本地设置,量化版本原生运行在消费级 GPU 上,为你的 IDE、代码助手和 agent 工作流提供动力。我们的 26B Mixture of Experts (MoE) 侧重于延迟,推理时仅激活其总参数中的 38 亿,以交付异常快的 tokens-per-second,而我们的 31B Dense 最大化原始质量,为微调提供强大基础。
这些模型已针对大量不同数据集和指标进行评估,以涵盖文本生成的不同方面。参阅模型卡中的其他基准测试。
E2B 和 E4B 模型:移动和 IoT 设备的全新智能水平
从零开始精心设计以追求最大计算和内存效率,这些模型在推理时激活有效 20 亿和 40 亿参数的足迹,以保护 RAM 和电池寿命。在与我们 Google Pixel 团队以及 Qualcomm Technologies 和 MediaTek 等移动硬件领导者的密切合作下,这些多模态模型在手机、Raspberry Pi 和 NVIDIA Jetson Orin Nano 等边缘设备上完全离线运行,延迟接近零。Android 开发者现在可以在 AICore Developer Preview 中原型制作 agent 流程,以实现与 Gemini Nano 4 的向前兼容性。
你给了我们反馈,我们用心倾听了。构建 AI 的未来需要协作方法,我们相信在不设限制障碍的情况下赋能开发者生态。这就是为什么 Gemma 4 在商业友好的 Apache 2.0 许可证下发布。
这个开源许可证为完整的开发者灵活性和数字主权提供基础;你拥有对数据、基础设施和模型的完全控制权。它允许你在任何环境中自由构建和安全部署,无论在本地还是在云端。
这些模型经历了与我们专有模型相同的严格基础设施安全协议。通过选择 Gemma 4,企业和主权组织获得了一个可信、透明的基础,提供最先进的能力,同时满足安全和可靠性的最高标准。
秒级开始体验:立即访问 Gemma 4 并开始构建。在 Google AI Studio(31B 和 26B MoE)或 Google AI Edge Gallery(E4B 和 E2B)中探索 Gemma 4。对于 Android 开发,使用它在 Android Studio 中为 Agent Mode 提供动力,并开始在 Android 上构建生产应用(使用 ML Kit GenAI Prompt API)。
使用你喜爱的工具:在 Hugging Face (Transformers, TRL, Transformers.js, Candle)、LiteRT-LM、vLLM、llama.cpp、MLX、Ollama、NVIDIA NIM 和 NeMo、LM Studio、Unsloth、SGLang、Cactus、Baseten、Docker、MaxText、Tunix、Keras 上的第一天支持,你可以灵活选择最适合你项目的工具。
下载模型:从 Hugging Face、Kaggle 或 Ollama 获取模型权重。
将 Gemma 4 定制到你的特定需求:使用你喜爱的平台训练和调整模型,如 Google Colab、Vertex AI 或甚至你的游戏 GPU。
在 Google Cloud 上扩展到生产:虽然本地设备推理最适合离线使用,Google Cloud 消除了所有计算限制。通过 Vertex AI、Cloud Run、GKE、Sovereign Cloud、TPU 加速服务和最高级别的合规保证来部署你的方式。在此了解如何开始使用 Google Cloud。
跨多个硬件平台加速 AI 开发:Gemma 4 开箱即优化了业界领先硬件。从 NVIDIA Jetson Orin Nano 到 Blackwell GPU 的 NVIDIA AI 基础设施上体验最大性能,通过开源 ROCm™ 栈与 AMD GPU 集成,或在 Trillium 和 Ironwood TPU 上部署以实现大规模和效率。
竞争以创造影响:加入 Kaggle 上的 Gemma 4 Good Challenge,构建在世界上创造有意义、积极改变的产品。