GPT-OSS与Gemma 3N架构深度对比
分析OpenAI和Google开源模型在核心设计、量化优化、多模态能力的细节差异。技术深度高,帮助程序员理解最新开源模型的权衡。
分析OpenAI和Google开源模型在核心设计、量化优化、多模态能力的细节差异。技术深度高,帮助程序员理解最新开源模型的权衡。
有一个话题整整一周都没离开过我们的 ML 工程群聊 → gpt-oss 与 Gemma 3n 架构相比,究竟表现如何?
事情要从 OpenAI 开源部分模型说起。随后,他们又发布了针对这些模型优化过的 kernels。
还不到一天,Ollama 就已经更新了文档:“快速开始使用 GPT-OSS、DeepSeek-R1、Gemma 3 等模型。”……这速度真够快的。
我们自然也开始深入研究:运行测试、阅读 kernels、交换心得。毫不意外,讨论逐渐变成了一场持续进行的对比:GPT-OSS 与 Google 的 Gemma3N 架构。
它们之间的差异不只是技术细节,更像是两种相互竞争的理念。
GPT-OSS 是一个庞大的 Mixture of Experts 模型,原生采用 MXFP4 训练,因此 120B 模型可以在单张 H100 GPU 上运行,而 20B 模型只需 16GB 内存即可运行。
Gemma3N 基于 Matryoshka Transformer 构建。它的每一层都会参与运算,但又以嵌套方式组织,因此你可以随时从中抽取出规模更小、功能完整的模型。
Gemma3N 是多模态模型,支持文本、图像、音频和视频。它的效率优势,源自 Google 多年来对架构和算法的持续优化。GPT-OSS 则仅支持文本,更侧重于依靠庞大的模型规模和针对硬件特性的扩展能力。
Benchmarks?现在要进行真正的开源正面对比还为时过早。但早期信号已经很能说明问题:
GPT-OSS:将模型规模推到硬件承载能力的边缘,在 Cerebras 硬件上达到约 3000 tok/s。
Gemma3N:效率优化得极为出色,在笔记本电脑上生成 256 个 tokens,响应时间可以低于 0.5 秒。
此外,还有我们自己实际测试后的直观感受:
与此同时,Cerebras 表示,他们已经在自家硬件上部署了 openai-oss-120b,并以 3000 tok/s 的吞吐量创下纪录。
现在还不是选出赢家的时候,真正值得关注的是正在发生的变化。多年来,“本地 AI”一直像是一个属于未来的话题:速度太慢、负担太重,也过于边缘化。如今,数十亿参数的模型已经能够在单张 GPU 上运行。各种 quantization 技巧不仅让本地 inference 成为可能,还让它变得足够快。多模态模型也正悄然融入现有工作流,而不会将其打乱。
这些已经不再是实验室里的演示,而是在逐渐成为工具箱的一部分——你不再把它们特意视为“AI”,而是直接拿来使用。
本周围绕 GPT-OSS 与 Gemma 3N 的反复讨论,只是整个领域快速变化的一个缩影。一个版本的发布会触发另一个版本,kernels 得到修补,文档随之更新。转眼之间,你一直在等待的东西已经摆在了桌面上。过去还只是 roadmap 中的一项内容,如今已经可以在生产环境中、在本地硬件上直接运行,而且不会破坏你的现有工作流。