社区深度分析揭示 OpenAI 最新开源模型在性能上与 Phi-5 无异,引发对开源模型策略的广泛讨论与反思。
OpenAI 刚刚发布了首批开源¹大语言模型,名为 gpt-oss-120b 和 gpt-oss-20b。你可以在这里与它们对话。这些模型表现好吗?这取决于你想用它们做什么。当然,它们在一些 benchmark 上表现出色(否则 OpenAI 根本不会发布),但在另一些 benchmark 上却差得有些离谱,比如 SimpleQA。
有些人非常喜欢它们,另一些 Twitter 用户则完全不买账。据我观察,这些模型在技术层面具备不错的能力,但缺乏大量领域外知识。例如,它们拥有广泛的科学常识,却不太了解流行文化。再过六个月,我们就会知道这些模型在实际应用中究竟有多大用处。不过我的预测是,它们最终会被归入“benchmark 表现远好于真实任务表现”的那一类模型。
2024 年,Sebastien Bubeck 领导开发了 Microsoft 的开源 Phi 系列模型²。这些模型背后的核心思路,是完全使用合成数据进行训练:不使用从书籍或互联网中获取的文本,而是使用其他语言模型生成的文本,或经过人工筛选整理的教材。
合成数据没有普通数据那么常见,因为你不能直接免费下载数 TB 的数据,而是必须花钱生成每一个 token。但它带来的好处是,你可以完全掌控训练数据。如果完全使用高质量的合成数据和精选数据训练模型,会发生什么?
事实证明,这样训练出的模型在 benchmark 上表现很好,实际使用时却令人失望。搜索人们对每一代 Phi 模型的评价,都能看到同样的模式:benchmark 成绩非常亮眼,引发大量热情,随后实际表现却远弱于 benchmark 所呈现的水平。
我认为,这些模型之所以能取得亮眼的 benchmark 成绩,是因为它们很容易针对特定任务进行训练——毕竟,大量训练数据都是由你自己生成的。如果使用合成数据训练,却不生成一些与常见 benchmark 题型相匹配的数据,那才是犯傻。
但既然你是在“应试教学”,就应该预料到:与那些使用广泛数据训练、只是碰巧也擅长 benchmark 的语言模型相比,你在其他任务上的表现会更差。
为什么我要谈 Phi 模型?因为 2024 年年底,Sebastien Bubeck 离开 Microsoft,加入了 OpenAI。我们不知道哪些人参与了 OpenAI 新款 gpt-oss 模型的开发,model card 也没有提供太多 pretraining 阶段的细节。不过我愿意打赌,Sebastien Bubeck 参与了这项工作,而且这些模型使用的是经过严格筛选的数据集,或合成数据集。
明知 Phi 风格的模型在 benchmark 上会比在真实应用中表现得更好,OpenAI 为什么还要这样训练?原因可能与 Microsoft 持续训练 Phi 风格模型一样:安全。
对一家大型组织而言,发布开源模型是一件很可怕的事。模型一旦发布,你的名字就会永远与它绑定,而成千上万的研究人员也会争先恐后地尝试对其进行 fine-tuning,以移除安全护栏。
这件事很少被公开讨论,但对小型语言模型进行 fine-tuning 的主要使用场景,其实是色情角色扮演,而且这方面的需求非常旺盛。任何由本地模型玩家组成的小型在线社区里,至少有 50% 的人是变态。
如果你发布的是普通的闭源权重模型,并将它留在自己的基础设施中,人们就无法对其进行 fine-tuning。即便犯了错误,你也随时可以直接更新线上模型。但开源模型一旦发布,就会永远流传下去。
使用合成数据,或教材等受到严格控制的数据进行训练,可以大幅降低构建安全模型的难度。你想生成多少“你要求我做 X,但作为一个理智的语言模型,我拒绝这样做”的内容都可以。
如果训练数据中不存在颠覆性或恶劣的内容,模型也就永远学不会以颠覆性或恶劣的方式行事——至少目标是这样。
对于 OpenAI 来说,为这次开源发布训练一个 Phi 风格的模型,想必极具吸引力。他们需要一个能在 benchmark 上击败中国开源模型,同时又不会行为失控、再次引发丑闻的模型。
与 Meta 不同,OpenAI 并不需要自己的开源模型真的很好用,因为它的主要业务来自闭源模型。
这就是为什么我认为,OpenAI 为新款 gpt-oss 模型选择了合成数据路线。不管这是好是坏,我们完全可以把它们看作 Phi-5 和 Phi-5-mini。
编辑:这篇文章已在 Hacker News 上引发讨论,并收到了许多评论。
严格来说应该叫 open weight,而不是 open source,因为模型权重可以自由获取,但训练数据和代码并未开放。当然,OpenAI 此前也发布过 GPT-2 等 open-weight 模型,不过这次发布的是首批“真正意义上”的模型。↩
严格来说应该叫 open weight,而不是 open source,因为模型权重可以自由获取,但训练数据和代码并未开放。当然,OpenAI 此前也发布过 GPT-2 等 open-weight 模型,不过这次发布的是首批“真正意义上”的模型。
我在 GitHub 从事 AI 相关工作,而 GitHub 归 Microsoft 所有,但对于上述任何事情,我都完全没有内部消息。本文纯粹基于公开信息撰写。↩
我在 GitHub 从事 AI 相关工作,而 GitHub 归 Microsoft 所有,但对于上述任何事情,我都完全没有内部消息。本文纯粹基于公开信息撰写。
如果你喜欢这篇文章,可以考虑订阅邮件更新,及时了解我的新文章,或者将它分享到 Hacker News。
下面是另一篇带有相同标签的相关文章预览。
今年 4 月,OpenAI 发布了一个过度谄媚的 GPT-4o 版本,酿成了一次失误。如果你告诉它,Brian Cox 在《Succession》最后一季中向你发送了秘密信息,它会表示赞同,并夸你居然能注意到这一点,实在太聪明了。
几天后,OpenAI 稍微收敛了这种行为并公开道歉,将问题归咎于他们让模型根据用户的点赞和点踩评分进行学习时所采用的配置方式。继续阅读……