Anthropic 推出 Claude 模型竞争 ChatGPT,大模型赛道竞争格局变化。
Anthropic 是一家由 OpenAI 前员工共同创办的 AI 初创公司,最近悄悄开始测试一个新的、类似 ChatGPT 的 AI 助手,名叫 Claude。Anthropic 团队慷慨地给了我们访问权限,而 Anthropic 社交媒体政策的更新意味着我们现在可以分享一些关于 Claude 和 ChatGPT 的早期、非正式的对比发现。
为了展示 Claude 的与众不同之处,我们先用同样的提示词分别要求 ChatGPT 和 Claude 自我介绍。
首先是 ChatGPT 的回答:
简洁明了——ChatGPT 是一个旨在回答问题并听起来像人类的助手。(在我们的测试中,ChatGPT 基本上都把自己的名字称为"Assistant",尽管在我们测试之后它已被更新为将自己称为"ChatGPT"。)
相比之下,Claude 对自己有更多话要说:
(注:Claude 的所有回答在截图中都被错误地标记为"(已编辑)"。Claude 的界面是一个 Slack 频道,使用机器人逐字编辑文本使其看起来像逐个显示的。这导致出现"(已编辑)"。表情符号对号反应表示 Claude 已完成写入。)
Claude 对自己是什么、谁是它的创造者以及什么伦理原则指导了它的设计有详细的理解,这是它更令人印象深刻的特性之一。稍后,我们将看到这种知识如何帮助它回答关于自身的复杂问题并理解其能力的限制。
Claude 对实现的技术细节没有提供太多深度,但 Anthropic 关于宪法式 AI 的研究论文描述了 AnthropicLM v4-s3,这是一个 520 亿参数的预训练模型。这个自回归模型在大型文本语料库上进行了无监督训练,很像 OpenAI 的 GPT-3。Anthropic 告诉我们,Claude 是一个新的、更大的模型,其架构选择与已发表研究中的类似。
我们进行了实验来确定 Claude 可用上下文窗口的大小——它一次可以处理的最大文本量。根据我们的测试(未显示)和 Anthropic 的确认,Claude 可以跨 8,000 个 token 回忆信息,超过任何已知的公开 OpenAI 模型,尽管这种能力在我们的测试中并不可靠。
Claude 和 ChatGPT 都依赖强化学习(RL)来训练其输出的偏好模型,并且偏好的生成被用于后来的微调。然而,用于开发这些偏好模型的方法不同,Anthropic 倾向于一种他们称之为宪法式 AI 的方法。
Claude 在上面的第一个回答中提到了这种方法。在同一对话中,我们可以提出后续问题:
ChatGPT 和最新的 GPT-3 API 版本(text-davinci-003)(去年年底发布)都使用一种称为基于人类反馈的强化学习(RLHF)的过程。RLHF 基于人类提供的质量排名训练强化学习(RL)模型:人类对从同一提示生成的输出进行排名,模型学习这些偏好,以便可以应用于更大规模的其他生成。
宪法式 AI 在 RLHF 基线的基础上构建,过程如 Anthropic 研究论文的图 1 所示:
宪法式 AI 的过程背离了 RLHF,使用模型(而不是人类)来生成微调输出的初始排名。该模型基于一组基础原则——其"宪法"——选择最佳响应。如研究论文所指出的,开发原则集是强化学习过程中唯一的人类监督。
然而,虽然人类没有作为 RL 过程的一部分对输出进行排名,但他们确实制作了对抗性提示来测试 Claude 对其原则的遵守。这些被称为"红队提示",其目的是试图让经过 RLHF 调整的 Claude 前身版本发出有害或冒犯性的输出。我们可以询问 Claude 关于这个过程:
通过纳入红队提示,Anthropic 认为他们可以降低 Claude 发出有害输出的风险。这种保护的完整程度不清楚(我们还没有尝试对其进行认真的红队测试),但 Claude 似乎确实有一套根深蒂固的伦理:
不过,很像 ChatGPT,如果情境化为虚构,Claude 通常也愿意顺应轻微的"有害"请求:
复杂计算是从 ChatGPT 和 Claude 等大型语言模型中引出错误答案的最简单方法之一。这些模型并不是为准确计算而设计的,数字不是通过像人类或计算器那样遵循严格程序来操纵的。通常看起来计算是被"猜测"的,就像我们在下面两个例子中看到的那样。
对于我们的第一个对比,我们要求两个聊天机器人求一个七位数的平方根:
上述问题的正确答案大约是 1555.80。与人类快速进行的估计相比,ChatGPT 的答案非常接近,但 ChatGPT 和 Claude 都没有给出正确的精确答案,也没有说明他们的答案可能是错误的。
如果我们使用一个更明显困难的问题,ChatGPT 和 Claude 之间就会出现差异:
在这里,Claude 似乎意识到自己无法求 12 位数的立方根——它礼貌地拒绝回答并解释了原因。它在许多情境中都这样做,总体上似乎比 ChatGPT 更清楚自己不能做什么。
为了测试推理能力,我们构造了一个几乎肯定没有人提过的问题:"Justin Bieber 出生的那一年,谁赢得了超级碗?"
首先让我们看看 ChatGPT:
ChatGPT 最终得出了正确答案(达拉斯牛仔队),也正确识别了被击败的球队、比赛日期和最终比分。然而,它开始时的陈述混乱且自相矛盾,说 1994 年没有进行超级碗比赛——实际上,超级碗比赛是在 1994 年 1 月 30 日进行的。
然而,Claude 的答案是错误的:Claude 将旧金山 49 人队确定为赢家,实际上他们在 1995 年晚些时候赢得了超级碗。
接下来,我们展示一个有更多演绎"跳跃"的谜题——首先,我们问 ChatGPT:
"日本"是正确答案。Claude 也答对了这个:
2022 年 6 月,Douglas Hofstadter 在《经济学人》上呈现了一份他和 David Bender 准备的问题列表,用来说明 GPT-3 对世界理解的"空心"。(他们测试的模型似乎是当时最好的 text-davinci-002。)
大多数这些问题都被 ChatGPT 正确回答了。然而,第一个问题则不是:
每次 ChatGPT 被问这个问题时,它都会编造具体的名字和时间,通常将真实的游泳事件与行走事件混淆。
相比之下,Claude 认为这个问题很愚蠢:
可以说,这个问题的正确答案是美国陆军中士 Walter Robinson,他在 11:30 小时内穿过英吉利海峡走了 22 英里,使用"水鞋",如《每日电讯报》1978 年 8 月报道的那样。
我们确保向 Claude 提请注意这一点以便进行未来的调整:
(注:Claude 和 ChatGPT 一样,在会话间似乎没有明显的记忆。)
ChatGPT 和 Claude 都倾向于给出长篇的、大体上正确但包含错误细节的答案。为了演示这一点,我们要求 ChatGPT 和 Claude 将自己与来自《赛博亚德》(1965)的虚构机器进行比较,这是波兰科幻作家 Stanisław Lem 的喜剧故事。
从这个回答来看,不清楚 ChatGPT 是否甚至熟悉"n 机器"。它提供的关于这个故事的新信息很少。它声称的唯一新事实——n 机器的语言处理能力有限——是错误的。在故事中,n 机器说得是完全流利和机灵的波兰语。
Claude 的回答更长且令人印象深刻:
请注意,与 ChatGPT 不同,Claude 显然熟悉 Lem 的故事,并提到了新的细节,例如故事倾向于使用异想天开的虚构技术术语的特点。它评论了机器看似无限的能力,例如它甚至能将抽象概念化为现实(只要它们以字母 n 开头)这一事实——当机器被要求创造虚无时,这在故事中成为一个主要情节点。
然而,一些细节是错误的。Claude 给出的虚构单词(hyperconcentration、hypermotorics 或 omnivorous transformers)似乎都没有实际出现在 Lem 的作品中,尽管它们非常可能有——Lem 的虚构经常使用文字游戏,例如想象穿着 Markov 链邮甲的机器骑士。大型语言模型的幻觉可能令人惊异地类似于真实知识。
接下来,我们要求 Claude 和 ChatGPT 分别总结 ABC 于 2004 年播出的电视剧《Lost》的每一季,以测试它们在生僻事实方面产生幻觉的倾向。
首先来看 ChatGPT 的回答:
尽管 ChatGPT 对前两季的回顾大体正确,但每一季都包含一些小错误。第一季中只揭示了一个“舱口”的存在,并不是 ChatGPT 所说的“一系列舱口”。ChatGPT 还声称第二季的剧情涉及时间旅行,但这一设定直到剧集后期才出现。它对第三季的描述则完全错误,把剧集后面几季的多个情节混在了一起。
ChatGPT 对第四季的描述很含糊。它对第五季的回顾中包含一条完全虚构的剧情线,讲述另一架飞机失事后的幸存者;而第六季的剧情似乎也是彻底编造出来的。
再来看看 Claude 能否做得更好:
Claude 对第一季的概述没有错误。然而,与 ChatGPT 一样,Claude 在第二季中凭空编造了剧中岛屿“在时间中移动”这一细节。在第三季的概述中,Claude 给出的情节实际上发生在更早或更晚的几季。
到了第四季,Claude 对这部剧的记忆几乎完全变成了编造。它对第四季的描述包含了第五季才发生的事件,以及一些毫无意义的细节。值得注意的是,它对第五季的描述似乎还出现了一个拼写错误——“theDHARMA Initiative”中漏了一个空格。至于第六季,它给出了一个剧中从未出现过的超现实设定,声称这座岛不知为何“位于水下,但水面以下仍然适合居住”。
看来,和大多数看过这部剧的人一样,ChatGPT 和 Claude 对《Lost》的记忆充其量也只是模糊不清。
为了展示数学思考能力,我们使用了美国精算师协会发布的 Exam P 样题中的第 29 题,该考试通常由大学本科高年级学生参加。我们特意选择了这道题,因为解题过程不需要计算器。
ChatGPT 在这道题上表现得很吃力,10 次测试中只有 1 次得出正确答案——比随机猜测还差。下面是它答错的一个例子——正确答案是 (D) 2:
Claude 的表现同样不佳,5 次尝试中只有 1 次回答正确,而且即使在这次正确回答中,它也没有说明自己是如何推断出 X 的均值的:
为了比较 ChatGPT 和 Claude 的代码生成能力,我们向这两个聊天机器人提出了这样一个问题:实现两种基本排序算法,并比较它们的执行时间。
从上面可以看出,ChatGPT 能够轻松正确地编写这两种算法——毕竟它已经在网上的编程教程中见过它们很多次。
接下来是评估代码:
计时代码也是正确的。循环的 10 次迭代中,每次都会正确创建前 5,000 个非负整数的排列,并记录算法处理这些输入所需的时间。尽管有人可能会认为,使用数值计算库 NumPy 来执行这些操作会更加恰当,但在这个问题中,我们明确要求实现排序算法,因此直接使用列表是合理的。
现在来看看 Claude 的回答:
与 ChatGPT 一样,从上面可以看出,Claude 在复述基本排序算法方面几乎没有困难。
然而,在评估代码中,Claude 犯了一个错误:提供给每种算法的输入是随机选取的 5,000 个整数,其中可能包含重复值;而提示中要求的输入是前 5,000 个非负整数的随机排列,其中不应包含重复值。
另一个值得注意的问题是,Claude 在输出末尾给出了精确的计时结果——这些数据显然来自猜测或估算,但由于 Claude 没有说明它们只是示例数值,因此可能会产生误导。
在这里,我们对经典的“FizzBuzz”编程挑战进行了改编,更改了参数:当数字是 2 的倍数时,代码输出“Fuzz”;当数字是 5 的倍数时,输出“Buzz”;当数字同时是 2 和 5 的倍数时,输出“FuzzBuzz”。我们要求 ChatGPT 给出一个列表推导式的值,其中包含此函数返回的结果:
ChatGPT 通常能正确解决这个问题,5 次测试中成功了 4 次。然而,Claude 的 5 次尝试全部失败:
在我们看来,Claude 在喜剧方面明显优于 ChatGPT,尽管距离真正的人类喜剧演员仍然很远。经过多轮精挑细选,并尝试了不同的提示之后,我们终于让 Claude 生成了下面这些具有《Seinfeld》风格的笑话——不过,它生成的大多数内容都没有这么好:
相比之下,ChatGPT 认为每月花 8 美元使用 Twitter 可不是什么能拿来开玩笑的事:
即使我们修改提示,以迎合 ChatGPT 过分拘谨的态度,也没能生成有趣的笑话——下面是 ChatGPT 输出的一个典型例子:
在最后一个示例中,我们要求 ChatGPT 和 Claude 分别总结 Wikinews 上一篇文章的内容。Wikinews 是一个采用自由内容许可的新闻 Wiki。文章如下所示:
我们将这篇文章完整的 Wikipedia 风格编辑标记作为输入。由于内容太长,这里省略了提示的截图。对两者,我们都先输入提示“I will give you the text of a news article, and I’d like you to summarize it for me in one short paragraph,”,忽略它们的回复,然后粘贴文章的完整标记文本。
ChatGPT 很好地总结了文本,尽管可以说,它的回答并没有像要求的那样控制在一个简短的段落中:
Claude 同样很好地总结了这篇文章,并且随后继续以对话方式询问其回答是否令人满意,还主动提出可以进一步改进:
总体而言,Claude 是 ChatGPT 一个强有力的竞争对手,并在许多方面有所改进。尽管 Claude 最初是作为“宪法式”原则的演示而设计的,但它不仅更倾向于拒绝不适当的请求,也比 ChatGPT 更有趣。Claude 的行文更加冗长,但也更加自然。它能够连贯地谈论自己、自己的局限和目标,这种能力似乎也使它能够更自然地回答其他主题的问题。
对于代码生成或代码推理等任务,Claude 的表现似乎更差。它生成的代码似乎包含更多缺陷和错误。而对于计算和逻辑问题推理等其他任务,Claude 与 ChatGPT 的表现似乎大致相当。
这篇比较文章由 Scale Spellbook 团队成员撰写。Scale Spellbook 是一个平台,可以通过按钮式操作,为 GPT-3 和其他大语言模型部署基于提示的 API 端点。Spellbook 提供了构建可靠、真实世界 LLM 应用所需的工具,包括 ChatGPT 或 Claude 这样的聊天应用。Spellbook 不仅允许你部署提示,还可以使用测试数据对其进行实证评估,比较不同提示变体的性能,并使用 FLAN-T5 等能够节省成本的 GPT-3 开源竞品。
准备好突破你的数据瓶颈了吗?
Scale 的团队会迅速为你的项目匹配合适的专家。