AI 发展的本地化与开源化趋势
分析 AI 生态的关键趋势,认为开源模型和本地化部署将成为主流,影响程序员的技术栈选择。
分析 AI 生态的关键趋势,认为开源模型和本地化部署将成为主流,影响程序员的技术栈选择。
AI Engineer World’s Fair 现场报道
每场黑客松都会出现这样一个特定时刻。通常是在凌晨两三点,免费能量饮料已经彻底喝光,Demo 还处于半坏不坏的状态,这时团队里有人靠在折叠椅上,突然问道:“等等……这东西真的能上线吗?我们的 credits 还够吗?”
很长一段时间里,要诚实回答这个问题,情况都极其复杂。最好的 AI 模型被锁在僵化的 API 背后;使用与访问条款让商业化变得模糊不清;token 定价则让一个周末业余项目看起来像是在财务上玩火。你当然可以做出一个很酷的 Demo!但要把它变成一家真正的创业公司,却是一次巨大的跨越。
从历史上看,开源 AI 的名声多少有些问题。多年来,“开放”模型意味着“做本地 Demo 勉强够用,但肯定达不到生产环境的要求”。Gemma 4,以及如今市面上的许多其他开放模型,例如 GLM-5.2,正在彻底打破这一性能天花板。我们基于与旗舰 Gemini 模型完全相同的研究基础构建了 Gemma 4,而它的表现也证明了这一点。在复杂推理、多模态理解和多语言任务上,Gemma 4 的表现远超你对一款可以自行下载和运行的模型的预期。
这个模型家族覆盖了非常广泛的参数规模,从紧凑型端侧模型(2B),一直到能力强大的 26B MoE 和 31B 稠密模型。更棒的是:你可以通过 Google AI Studio 的 Gemini API 完全免费地使用更大的 Gemma 4 版本。这意味着你可以免费使用前沿级模型,在考虑计费接入之前,先完成创意的原型开发、迭代和验证。
通常来说,开放权重 AI 最容易迅速陷入混乱的地方就是许可证。带有隐蔽商业限制的定制许可证、仅限研究的条款,以及律师最爱争论的署名要求——这些正是那些本有机会成长为真正公司的黑客松项目所面临的隐形杀手。
Gemma 4 采用 Apache 2.0 许可证发布。如果你在开源软件领域待过一段时间,就会非常清楚这意味着什么:你可以使用它、修改它、微调它,还可以在它之上构建产品。你可以基于它创办一家公司。你可以使用创业公司的专有数据集微调 Gemma 4,将它作为软件产品的核心组成部分发布,而不必半夜叫醒律师,确认自己到底有没有权利这么做。
对于这一代开发者来说,这不仅具有实践意义,在理念层面同样重要。他们通过拆解 GitHub 上的开源项目学会了编程,如今正在创建自己的第一家创业公司。最好的工具理应向所有人开放,而不应该只属于那些拥有巨额企业合同的传统团队。
如果无法在你的技术栈中运行,那么世界上最好的模型也毫无用处。Google DeepMind 很清楚这一点,因此我们与最合适的生态合作伙伴联手,让 Gemma 4 出现在每一个你真正想要开展开发工作的地方:
Google AI Edge Gallery —— 想在决定投入开发之前先看看端侧性能?现在,你可以通过 Google AI Edge Gallery App,直接在 iOS 和 Android 上原生体验 Gemma。这是验证移动端友好版本是否快如闪电、是否已经为你的下一个移动应用项目做好准备的最佳方式。
Google AI Edge Gallery —— 想在决定投入开发之前先看看端侧性能?现在,你可以通过 Google AI Edge Gallery App,直接在 iOS 和 Android 上原生体验 Gemma。这是验证移动端友好版本是否快如闪电、是否已经为你的下一个移动应用项目做好准备的最佳方式。
Hugging Face 和 Transformers.js —— 如果你连后端都不需要呢?得益于与 Hugging Face 生态系统及 Transformers.js 的深度集成,你可以通过 WebGPU,完全在客户端的浏览器中直接运行 Gemma 4。不需要承担服务器成本,不必担心 API keys 被意外泄露到公开仓库中,而且延迟为零。
Hugging Face 和 Transformers.js —— 如果你连后端都不需要呢?得益于与 Hugging Face 生态系统及 Transformers.js 的深度集成,你可以通过 WebGPU,完全在客户端的浏览器中直接运行 Gemma 4。不需要承担服务器成本,不必担心 API keys 被意外泄露到公开仓库中,而且延迟为零。
Ollama —— 只需一条命令,就能把 Gemma 4 拉取到本地。你可以离线开发、快速迭代,并彻底避开速率限制。如果你曾参加过一场场地 WiFi 时断时续的黑客松,并为了 Demo 拼命尝试调用云端 API,就会完全明白这为什么如此重要。
Ollama —— 只需一条命令,就能把 Gemma 4 拉取到本地。你可以离线开发、快速迭代,并彻底避开速率限制。如果你曾参加过一场场地 WiFi 时断时续的黑客松,并为了 Demo 拼命尝试调用云端 API,就会完全明白这为什么如此重要。
Cerebras —— 如果你需要近乎瞬时完成的推理,Cerebras 的晶圆级芯片可以提供极快的 token 生成速度,让实时应用真正拥有实时体验。流式响应、低延迟 Agent、语音界面——Cerebras 与 Gemma 4 的组合让这些能力显得原生而自然,而不是后来生硬拼接上去的附加功能。
Cerebras —— 如果你需要近乎瞬时完成的推理,Cerebras 的晶圆级芯片可以提供极快的 token 生成速度,让实时应用真正拥有实时体验。流式响应、低延迟 Agent、语音界面——Cerebras 与 Gemma 4 的组合让这些能力显得原生而自然,而不是后来生硬拼接上去的附加功能。
Unsloth —— 过去,微调大型语言模型需要庞大的计算集群和风险投资级别的预算。借助 Unsloth,通过 Colab 或在本地使用单张消费级 GPU 微调 Gemma 4,不仅成为可能,而且速度快得惊人。定制模型、针对特定领域的性能、你自己的数据——而且不需要启动一个费用比每月房租还高的云端训练任务。
Unsloth —— 过去,微调大型语言模型需要庞大的计算集群和风险投资级别的预算。借助 Unsloth,通过 Colab 或在本地使用单张消费级 GPU 微调 Gemma 4,不仅成为可能,而且速度快得惊人。定制模型、针对特定领域的性能、你自己的数据——而且不需要启动一个费用比每月房租还高的云端训练任务。
Google DeepMind 一直在参与黑客松:是真正的黑客松,就发生在大学体育馆、共享办公空间和会议中心的地下室里。因为 MLH 社区正是下一代 AI 工程师成长起来的地方。
DeepMind 通过 MLH 赞助的 Gemini 和 Gemma 挑战赛,已经覆盖了各大洲各种活动中的黑客。这些都是真正的技术挑战,由那些想亲眼看看开发者在获得强大工具,并拥有彻底放飞创意的自由之后,会创造出什么的人设计。那些黑客松中诞生的项目——出人意料的 RAG 应用、针对特定领域的微调,以及让人惊呼“等等,这也能做到?”的硬件和机器人技术 Hack——切实影响了 DeepMind 对开发者需求的理解。
AI Engineer World’s Fair 2026 正值一个重大的转折点。科技界提出的问题,已经从“AI 能做到这件事吗?”转变为“你会用它构建什么?”Gemma 4 回答了那些过去始终没人能妥善回应的后续问题:“但我真的能拥有自己构建出来的东西吗?而且我负担得起吗?”
答案是肯定的。下载它、微调它、部署它、发布它。这个模型属于你。现在,去做点东西出来吧!
Gemma 4 现已通过 Google AI Studio 和 Gemini API 提供。你可以在 ai.google.dev/gemma 获取模型权重、快速入门指南和微调指南。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。