Anthropic 发布 Claude 3.5 Sonnet 和 Haiku 新版本,引入计算机使用能力,让 AI 可直接操作屏幕完成复杂任务。
更新(2024 年 12 月 3 日):我们调整了 Claude 3.5 Haiku 的定价。该模型目前的价格为:输入每百万 Token(MTok)0.80 美元,输出每百万 Token 4 美元。
今天,我们宣布推出升级版 Claude 3.5 Sonnet 和新模型 Claude 3.5 Haiku。升级版 Claude 3.5 Sonnet 相比上一版本实现了全方位提升,尤其是在其原本就处于领先地位的编程领域,进步尤为显著。Claude 3.5 Haiku 在多项评测中的表现可媲美我们此前规模最大的模型 Claude 3 Opus,同时速度与上一代 Haiku 相近。
我们还以公开测试版的形式推出了一项突破性的新能力:computer use。开发者从今天起即可通过 API,让 Claude 像人类一样使用计算机——查看屏幕、移动光标、点击按钮以及输入文本。Claude 3.5 Sonnet 是首个以公开测试版形式提供 computer use 能力的前沿 AI 模型。现阶段,这项能力仍处于实验阶段,有时操作繁琐,也容易出错。我们选择尽早开放 computer use,以收集开发者的反馈,并预计这项能力将随着时间推移迅速提升。
Asana、Canva、Cognition、DoorDash、Replit 和 The Browser Company 已经开始探索这些可能性,执行需要数十步、有时甚至数百步才能完成的任务。例如,Replit 正在利用 Claude 3.5 Sonnet 的 computer use 和 UI 导航能力开发一项关键功能,用于在 Replit Agent 产品构建应用的过程中对其进行评估。
升级版 Claude 3.5 Sonnet 现已向所有用户开放。从今天开始,开发者可以通过 Anthropic API、Amazon Bedrock 和 Google Cloud Vertex AI,使用 computer use 测试版进行开发。新的 Claude 3.5 Haiku 将于本月晚些时候发布。
更新后的 Claude 3.5 Sonnet 在多项行业基准测试中均有广泛提升,在 Agent 编程和工具使用任务方面的进步尤其显著。在编程方面,它在 SWE-bench Verified 上的成绩从 33.4% 提升至 49.0%,超过所有公开可用的模型,其中包括 OpenAI o1-preview 等推理模型,以及专为 Agent 编程设计的系统。在面向 Agent 的工具使用测试 TAU-bench 中,它在零售领域的成绩也从 62.6% 提升至 69.2%,在难度更高的航空领域则从 36.0% 提升至 46.0%。新版 Claude 3.5 Sonnet 在实现这些提升的同时,价格和速度均与上一版本保持一致。
早期客户反馈表明,升级版 Claude 3.5 Sonnet 实现了 AI 辅助编程能力的一次重大飞跃。GitLab 使用该模型测试 DevSecOps 任务后发现,它在不增加延迟的情况下展现出更强的推理能力——不同用例中的提升最高可达 10%,因此非常适合用来驱动多步骤软件开发流程。Cognition 使用新版 Claude 3.5 Sonnet 进行自主 AI 评估,与上一版本相比,其编程、规划和问题解决能力均有显著提升。The Browser Company 使用该模型自动化基于 Web 的工作流,并指出 Claude 3.5 Sonnet 的表现超过了他们此前测试过的所有模型。
作为我们持续与外部专家合作的一部分,美国 AI Safety Institute(US AISI)和英国 Safety Institute(UK AISI)共同对新版 Claude 3.5 Sonnet 模型进行了部署前测试。
我们还评估了升级版 Claude 3.5 Sonnet 可能带来的灾难性风险,结果表明,《Responsible Scaling Policy》中规定的 ASL-2 Standard 仍然适用于该模型。
Claude 3.5 Haiku 是我们速度最快模型的下一代版本。在速度与 Claude 3 Haiku 相近的情况下,Claude 3.5 Haiku 的各项能力均有提升,并且在多项智能基准测试中,甚至超过了我们上一代规模最大的模型 Claude 3 Opus。Claude 3.5 Haiku 在编程任务上的表现尤其出色。例如,它在 SWE-bench Verified 上取得了 40.6% 的成绩,超过许多使用公开可用顶尖模型的 Agent,其中包括使用初代 Claude 3.5 Sonnet 和 GPT-4o 的 Agent。
凭借低延迟、更出色的指令遵循能力以及更准确的工具使用能力,Claude 3.5 Haiku 非常适合面向用户的产品、专业化的 sub-agent 任务,以及利用海量数据生成个性化体验,例如处理购买历史、定价或库存记录。
Claude 3.5 Haiku 将于本月晚些时候通过我们的第一方 API、Amazon Bedrock 和 Google Cloud Vertex AI 上线。它最初将作为纯文本模型发布,后续还将支持图像输入。
借助 computer use,我们正在尝试一种从根本上不同的新方法。我们不再为 Claude 完成单项任务而开发特定工具,而是教会它通用的计算机操作技能,使其能够使用各种为人类设计的标准工具和软件程序。开发者可以利用这项尚处于早期阶段的能力,自动执行重复性流程、构建和测试软件,以及完成研究等开放式任务。
为了实现这些通用技能,我们构建了一个 API,让 Claude 能够感知计算机界面并与之交互。开发者可以集成该 API,使 Claude 将指令(例如“使用我计算机中和网上的数据填写这张表单”)转换为计算机操作命令(例如查看电子表格、移动光标打开 Web 浏览器、前往相关网页、使用这些网页中的数据填写表单,等等)。OSWorld 用于评估 AI 模型像人类一样使用计算机的能力。在仅提供截图的类别中,Claude 3.5 Sonnet 取得了 14.9% 的成绩,明显优于排名第二的 AI 系统所取得的 7.8%。如果允许使用更多步骤来完成任务,Claude 的成绩可达到 22.0%。
尽管我们预计这项能力将在未来几个月内迅速提升,但 Claude 目前使用计算机的能力仍不完善。一些人类可以轻松完成的操作——滚动、拖动和缩放——目前对 Claude 来说仍然具有挑战性,因此我们建议开发者从低风险任务开始探索。由于 computer use 可能为垃圾信息、虚假信息或欺诈等常见威胁提供新的传播途径,我们正采取积极主动的方式,推动其安全部署。我们开发了新的分类器,可以识别 computer use 是否正在被使用,以及是否正在造成危害。关于这项新技能背后的研究过程以及安全措施的进一步讨论,可以参阅我们介绍 computer use 开发工作的文章。
通过了解这项仍处于最初阶段的技术在早期部署中的表现,我们将能更深入地理解能力不断增强的 AI 系统所蕴含的潜力及其影响。
我们非常期待大家探索这些新模型和 computer use 公开测试版,也欢迎与我们分享反馈。我们相信,这些进展将为你使用 Claude 的方式带来新的可能性,并期待看到你将创造出什么。