Gemma 4 12B 统一编码器架构,可直接集成到应用中。对想添加视觉能力的开发者有实用价值,降低多模态 AI 集成成本。
Gemma 4 12B 旨在将高性能多模态智能能力直接带到你的笔记本电脑,结合了移动优先的高效性与先进的推理能力。
Google Deepmind 产品管理总监
Google DeepMind 产品经理
你的浏览器不支持音频元素。
今天,我们推出 Gemma 4 12B,这是我们最新的模型,旨在将 agentic 多模态智能能力直接带到笔记本电脑。Gemma 4 12B 在我们边缘友好的 E4B 和更强大的 26B 混合专家模型 (MoE) 之间架起了桥梁,在内存占用减少的情况下封装了强大的功能。它也是我们第一个支持原生音频输入的中等规模模型。
感谢开发者社区的支持,Gemma 4 模型现已突破 1.5 亿次下载。你们从为物理辅助而打造的可穿戴机械臂,到企业级的人工智能安全解决方案,创造了各种应用。我们很期待看到你们用这个最新版本构建的内容。
以下是 Gemma 4 12B 的独特之处概览:
新颖的统一架构:没有多模态编码器。视觉和音频输入直接流入 LLM 主干。
先进的推理能力:基准性能接近我们的 26B 模型,支持强大的多步骤推理和 agentic 工作流。
笔记本就绪:足够小巧,只需 16GB VRAM 或统一内存就能在本地运行。
开放和易用:在 Apache 2.0 许可证下发布,并在整个开发者生态系统中获得支持。
Drafter 就绪:Gemma 4 12B 配备了多标记预测 (MTP) drafter,可降低延迟。
这些特性共同为日常硬件带来了先进的多模态能力,无需在速度或推理能力上做出妥协。现在让我们仔细看看 Gemma 4 12B 如何实现这一目标。
Gemma 4 12B 在标准基准上的性能接近我们更大的 26B MoE 模型,但总内存占用不到其一半。它足够小巧,可以在配备 16GB RAM 的消费级笔记本电脑上本地运行,为你的机器上的强大多模态和 agentic 体验解锁了可能性。
Gemma 4 12B 之所以脱颖而出,在于它处理视觉和音频输入的流畅方法。传统的多模态模型通常依赖单独的编码器来转换图像和音频,然后将这些表示传递给语言模型。由于这些分离的编码器会增加延迟并增加内存使用,我们训练 Gemma 4 12B 时采用了无编码器架构,以直接集成音频和视觉输入。
以下是 Gemma 4 12B 如何原生处理多模态输入的方式:
视觉:我们用一个轻量级的嵌入模块替换了 Gemma 4 的视觉编码器,该模块由单个矩阵乘法、位置嵌入和归一化组成。这使 LLM 主干能够接管视觉处理。
音频:我们进一步简化了音频处理。我们完全移除了音频编码器,并将原始音频信号投影到与文本标记相同的维度空间中。
对于想要详细分析的开发者,请查看我们配套的 Gemma 4 12B 开发者指南。
亲自体验:在 LM Studio、Ollama、Google AI Edge Gallery App、Google AI Edge Eloquent app 和 LiteRT-LM CLI 中点击几下即可开始实验。
下载权重:直接从 Hugging Face 和 Kaggle 下载预训练和指令微调的检查点。
集成与学习:查看开发者文档和快速入门笔记本。
使用你喜爱的开发工具:使用 Hugging Face Transformers、llama.cpp、MLX、SGLang 和 vLLM 实现本地推理管道,或使用 Unsloth 进行高效微调。
使用 Gemma Skills 解锁 Agentic 开发:为了支持 agent 使用最新的 Gemma 进步,我们正在发布我们的官方技能仓库。这是一个技能库,专门设计用于使 agent 能够使用 Gemma 模型进行构建。
按你的方式部署:在 Google Cloud 中通过 Gemini Enterprise Agent Platform Model Garden、Cloud Run 和 GKE 启动生产端点。