斯坦福开源 Alpaca 模型展现开源 LLM 的竞争力,成为 OpenAI 的潜在威胁。行业格局变化,对开源关注者有价值。
研究人员用 OpenAI 的 GPT-3.5 生成的文本训练 Meta 的语言模型,耗资不足 600 美元,却取得了相似的性能。
斯坦福大学的研究人员使用 OpenAI 的 GPT-3.5(text-davinci-003)生成的 52,000 个遵循指令的演示,对 Meta 最近发布的 LLaMA 模型的 70 亿参数变体进行了微调。
指令训练是使 GPT-3.5 优于原始 GPT-3 模型的关键技术之一,而用于训练的数据完全由 OpenAI 专有。
虽然 RLHF 对于微调 ChatGPT 甚至 GPT-4 这样的模型至关重要,但这些模型的核心能力来自于它们最初的训练——即指令训练。
在他们的工作中,斯坦福团队使用 AI 生成的指令来训练 Alpaca 7B,这是一个语言模型,研究人员表示它展现出许多类似 GPT-3.5 的行为。在使用来自 Self-Instruct Evaluation Set 的输入进行的盲测中,两个模型的表现不相上下。
Alpaca 存在其他语言模型常见的问题,比如幻觉、毒性和刻板印象。特别是,幻觉的出现频率比 OpenAI 模型更高。
该团队正在发布一个交互式演示、训练数据集和训练代码。他们也已向 Meta 请求发布该模型的许可。通过这一发布,团队希望能够推动对用指令训练的语言模型的研究。为了防止滥用,他们通过 OpenAI API 引入了内容过滤,并在演示中添加了水印。
该模型不能用于商业目的。除了安全顾虑和 Meta 的 LLaMA 模型的非商业许可证外,该团队指出了 OpenAI GPT-3.5 的使用条款,其中规定该模型不得用于开发与 OpenAI 竞争的 AI 模型。
最后一点表明 OpenAI 意识到其自身模型的输出可以被用作潜在复制品的数据源。随着参数量高达 650 亿的更大 LLaMA 模型的泄露,这类项目可能已经在进行中——而且还可能使用 GPT-4 的输出。
除了对这样一个小型模型来说令人印象深刻的性能外,Alpaca 还展示了 AI 训练成本已经变得多么便宜:该团队花费不足 600 美元训练了 Alpaca 7B。更大的模型会更贵,但预期成本应该在可以轻松由公司或众筹项目资助的范围内。
对齐研究员 Eliezer Yudkowsky 总结了这对 OpenAI 这样的公司带来的问题:"如果你允许任何足够广泛的访问你的 AI 模型,即使通过付费 API,你就是在把你的商业皇冠宝石送给竞争对手,他们可以在没有你为建立自己微调数据集所付出的所有辛苦工作的情况下,几乎克隆你的模型。"
OpenAI 能做什么?Yudkowsky 说没什么:"如果你成功地实施了一项限制,禁止商业化基于你的 I/O 训练的仿制品——这在法律上从未被测试过——那意味着竞争对手的检查点会被上传到 BitTorrent。"
我不认为人们意识到斯坦福重新训练一个 LLaMA 模型,将其转化为指令遵循的形式,通过廉价地在来自 text-davinci-003 的输入和输出上进行微调,这有多大的意义。
这意味着:如果你允许任何足够广泛的访问你的 AI……https://t.co/rr5zag6C8Z
——Eliezer Yudkowsky (@ESYudkowsky) 2023 年 3 月 14 日
你可以免费试用斯坦福的 Alpaca 7B。
订阅 THE DECODER,获得无广告阅读、每周 AI 通讯、我们独家的"AI Radar"前沿报告(每年六次)、完整存档访问权限及评论区访问权限。
继续阅读了解全面情况。订阅获得无夸大的报道。
访问所有 THE DECODER 文章。
无干扰阅读——没有谷歌广告。
访问评论和社区讨论。
每周 AI 通讯。
每年六次:"AI Radar"——关键 AI 主题的深度报道。
THE DECODER 在线活动享受最多 25% 折扣。
访问我们整个十年的存档。
从 The Decoder 获取最新 AI 新闻。