大模型时代已终结,转向小模型和专用模型
OpenAI CEO 观点:未来是更小、更高效的专用模型。行业观点,对短期开发决策影响有限。
OpenAI CEO 观点:未来是更小、更高效的专用模型。行业观点,对短期开发决策影响有限。
ChatGPT 是创业公司 OpenAI 推出的聊天机器人,其惊艳的能力引发了人们对人工智能的新一轮浓厚兴趣与投资热潮。但上周晚些时候,OpenAI CEO 警告称,催生这款机器人的研究策略已经走到尽头。未来的突破究竟会来自哪里,目前仍不明确。
近年来,OpenAI 沿用现有的机器学习算法,将其规模扩大到过去难以想象的程度,从而在语言类 AI 领域取得了一系列令人瞩目的进展。作为其中最新的项目,GPT-4 很可能使用了数万亿词的文本以及数千枚高性能计算芯片进行训练,整个过程的成本超过 1 亿美元。
但该公司 CEO Sam Altman 表示,未来的进步不会来自继续扩大模型规模。“我认为,依靠这种超级、超级巨型模型的时代已经走到尽头了。”上周晚些时候,他在 MIT 举办的一场活动中对观众说道,“我们会用其他方式把模型做得更好。”
Altman 的这番判断意味着,开发和部署新型 AI 算法的竞赛可能迎来一次意想不到的转折。自 OpenAI 去年 11 月推出 ChatGPT 以来,Microsoft 已利用其底层技术为 Bing 搜索引擎加入聊天机器人,Google 也推出了名为 Bard 的竞品。许多人争相尝试使用这类新一代聊天机器人,协助完成工作或个人任务。
与此同时,包括 Anthropic、AI21、Cohere 和 Character.AI 在内的多家资金雄厚的创业公司,正投入巨量资源构建规模越来越大的算法,试图追赶 OpenAI 的技术。ChatGPT 的最初版本基于略经升级的 GPT-3,但用户现在也可以使用由能力更强的 GPT-4 驱动的版本。
Altman 的表态说明,GPT-4 可能是 OpenAI 通过扩大模型规模并向其输入更多数据这一策略所带来的最后一次重大突破。他并未透露,未来会由哪种研究策略或技术取而代之。在介绍 GPT-4 的论文中,OpenAI 表示,其估算结果显示,扩大模型规模所带来的收益正在递减。Altman 还表示,公司能够建设的数据中心数量以及建设速度同样存在物理极限。
Cohere 联合创始人 Nick Frosst 此前曾在 Google 从事 AI 工作。他认为,Altman 所说的“单纯扩大规模无法永远奏效”确实符合实际。Frosst 同样相信,对于 transformer——GPT-4 及其竞争对手采用的核心机器学习模型——其进步空间并不在于继续扩展规模。“有很多方法可以让 transformer 变得好得多、实用得多,其中很多方法都不需要为模型增加参数。”他说。Frosst 表示,新的 AI 模型设计或架构,以及基于人类反馈进行更深入的调优,都是前景可期的方向,许多研究人员已经在探索这些领域。
OpenAI 这一极具影响力的语言算法家族,其每个版本都由人工神经网络构成。这类软件的设计在一定程度上受到神经元协同工作方式的启发,通过训练来预测一段给定文本之后应该出现哪些词。
其中第一个语言模型 GPT-2 于 2019 年发布。其最大版本拥有 15 亿个参数;参数数量用于衡量模型中那些粗略模拟的人工神经元之间可调连接的数量。
在当时,与此前的系统相比,这一规模极其庞大,部分原因在于 OpenAI 的研究人员发现,扩大规模能够让模型生成的内容更加连贯。随后,该公司进一步扩大了 GPT-2 继任者的规模:2020 年发布的 GPT-3 拥有多达 1750 亿个参数。该系统在生成诗歌、电子邮件和其他文本方面展现出的广泛能力,促使其他公司和研究机构也将自己的 AI 模型扩大到相近乃至更大的规模。
ChatGPT 去年 11 月首次亮相后,表情包创作者和科技评论人士纷纷猜测,GPT-4 问世时会是一个规模与复杂程度都令人目眩的模型。然而,当 OpenAI 最终发布这一新的人工智能模型时,公司并未披露它究竟有多大——或许是因为规模已经不再决定一切。在 MIT 的活动上,有人问 Altman,训练 GPT-4 是否花费了 1 亿美元;他回答:“不止这些。”