Claude 3 模型系列发布
Anthropic 发布新一代大语言模型。对 AI 应用开发者选型决策有重要参考价值。
Anthropic 发布新一代大语言模型。对 AI 应用开发者选型决策有重要参考价值。
今天,我们正式发布 Claude 3 模型家族。它在广泛的认知任务上树立了新的行业基准。该家族包含三款能力依次增强的先进模型:Claude 3 Haiku、Claude 3 Sonnet 和 Claude 3 Opus。每一款后续模型都能提供更强大的性能,让用户可以根据具体应用,在智能、速度和成本之间选择最佳平衡。
Opus 和 Sonnet 现已可在 claude.ai 和 Claude API 中使用;Claude API 目前已在 159 个国家和地区正式开放。Haiku 即将推出。
Opus 是我们最智能的模型。在大多数常用 AI 系统评测基准上,它的表现都优于同类模型,包括本科水平的专家知识(MMLU)、研究生水平的专家推理(GPQA)、基础数学(GSM8K)等。在复杂任务中,它展现出接近人类水平的理解力和流畅度,引领着通用智能的前沿。
所有 Claude 3 模型在分析与预测、细腻的内容创作、代码生成,以及使用西班牙语、日语和法语等非英语语言进行对话方面,都展现出了更强的能力。
以下是 Claude 3 模型与其他同类模型在多项能力基准测试 [1] 上的对比:
Claude 3 模型能够支持实时客服聊天、自动补全和数据提取等对响应即时性与实时性要求极高的任务。
Haiku 是同等智能级别中速度最快、最具成本效益的模型。它可以在不到 3 秒的时间里,读完一篇包含图表、信息与数据密集的 arXiv 研究论文(约 10k tokens)。在正式发布后,我们预计还会进一步提升它的性能。
对于绝大多数工作负载,Sonnet 的速度是 Claude 2 和 Claude 2.1 的 2 倍,同时拥有更高的智能水平。它尤其擅长知识检索、销售自动化等要求快速响应的任务。Opus 的速度与 Claude 2 和 Claude 2.1 相近,但智能水平要高得多。
Claude 3 模型具备与其他领先模型相当的先进视觉能力。它们可以处理多种视觉格式,包括照片、图表、曲线图和技术示意图。我们尤其期待将这一新模态提供给企业客户,因为其中一些客户的知识库有多达 50% 的内容以 PDF、流程图或演示文稿等不同格式存储。
以往的 Claude 模型经常做出不必要的拒绝,这表明它们缺乏对上下文的理解。我们在这一方面取得了显著进展:与前几代模型相比,Opus、Sonnet 和 Haiku 面对接近系统安全边界的 prompt 时,拒绝回答的概率大幅降低。如下所示,Claude 3 模型能够更细致地理解请求、识别真正的危害,同时大幅减少对无害 prompt 的拒绝。
各种规模的企业都依赖我们的模型为客户提供服务,因此,模型输出必须在大规模使用时依然保持较高的准确性。为了评估这一点,我们使用了一组规模庞大、复杂且基于事实的问题,专门测试当前模型的已知弱点。我们将回答分为三类:正确答案、错误答案(或幻觉),以及承认不确定性——即模型在不知道答案时明确表示不知道,而不是提供错误信息。与 Claude 2.1 相比,Opus 在这些具有挑战性的开放式问题上的准确率(即正确答案比例)提高了一倍,同时错误答案的比例也有所下降。
除了生成更可信的回答外,我们还将很快在 Claude 3 模型中启用引用功能,使其能够指向参考资料中的具体句子,以验证自己的答案。
Claude 3 模型家族在发布之初将提供 200K context window。不过,这三款模型都能够接收超过 100 万 tokens 的输入;我们可能会向需要更强处理能力的特定客户开放这一功能。
为了有效处理长上下文 prompt,模型必须具备强大的召回能力。“大海捞针”(Needle In A Haystack,NIAH)评测用于衡量模型从海量数据中准确回忆信息的能力。我们增强了这一基准测试的稳健性:每条 prompt 都从 30 组随机的“针”与问题组合中选取一组,并使用由众包方式收集的多样化文档语料库进行测试。Claude 3 Opus 不仅实现了近乎完美的召回,准确率超过 99%;在某些情况下,它甚至识别出了评测本身的局限——模型发现作为“针”的句子似乎是由人类刻意插入原始文本中的。
我们在开发 Claude 3 模型家族时,致力于让它们在能力强大的同时同样值得信赖。我们设有多个专门团队,持续追踪并缓解广泛的风险,涵盖虚假信息、儿童性虐待材料(CSAM)、生物技术滥用、选举干预以及自主复制能力等。我们持续开发 Constitutional AI 等方法,以提升模型的安全性与透明度;同时也对模型进行了调优,以缓解新模态可能引发的隐私问题。
如何解决日益复杂的模型中存在的偏见,是一项持续进行的工作,而我们在此次新版本中已经取得了进展。正如 model card 所示,根据问答偏见基准(Bias Benchmark for Question Answering,BBQ)的评测结果,Claude 3 的偏见少于此前的模型。我们仍致力于推动相关技术的发展,以减少偏见、提升模型的中立性,确保模型不会偏向任何特定的党派立场。
尽管与以往模型相比,Claude 3 模型家族在生物知识、网络安全相关知识和自主能力等关键指标上有所提升,但根据我们的 Responsible Scaling Policy,它仍处于 AI Safety Level 2(ASL-2)。我们的 red teaming 评估依据我们对白宫作出的承诺以及 2023 年美国行政命令进行。评估结论认为,这些模型目前造成灾难性风险的可能性微乎其微。我们将继续谨慎监测未来的模型,评估它们与 ASL-3 门槛之间的距离。更多安全信息可参阅 Claude 3 model card。
Claude 3 模型能够更好地遵循复杂的多步骤指令。它们尤其擅长遵循品牌语调和回复规范,并能帮助用户打造值得信赖的客户体验。此外,Claude 3 模型也更善于生成 JSON 等常见格式的结构化输出,因此,针对自然语言分类和情感分析等使用场景向 Claude 下达指令会更加简单。
Claude 3 Opus 是我们最智能的模型,在高度复杂的任务上拥有市场领先的表现。它能够以非凡的流畅度和接近人类的理解力,应对开放式 prompt 以及从未见过的场景。Opus 向我们展现了生成式 AI 能力边界的最远端。
任务自动化:跨 API 和数据库规划并执行复杂操作、交互式编程
研发:研究综述、头脑风暴与假设生成、药物发现
战略:对图表、财务数据和市场趋势进行高级分析与预测
*针对特定使用场景可提供 1M tokens,请联系我们咨询。
Claude 3 Sonnet 在智能与速度之间实现了理想平衡,尤其适合企业工作负载。与同类模型相比,它以更低的成本提供了强劲的性能,并针对大规模 AI 部署中的高强度持续运行进行了专门设计。
数据处理:针对海量知识进行 RAG 或搜索与检索
销售:产品推荐、预测、定向营销
节省时间的任务:代码生成、质量控制、从图像中解析文本
Claude 3 Haiku 是我们速度最快、最精简的模型,可以实现近乎即时的响应。它能够以无可比拟的速度回答简单问题和请求。用户将可以构建流畅、自然、近似人类互动的 AI 体验。
客户互动:在实时交互中提供快速、准确的支持与翻译
内容审核:识别高风险行为或客户请求
节省成本的任务:优化物流、库存管理、从非结构化数据中提取知识
Opus 和 Sonnet 今天已可通过我们的 API 使用。该 API 现已正式开放,开发者可以注册并立即开始使用这些模型。Haiku 即将推出。Sonnet 为 claude.ai 的免费体验提供支持,而 Claude Pro 订阅用户可以使用 Opus。
Sonnet 今天也已登陆 Amazon Bedrock,并在 Google Cloud 的 Vertex AI Model Garden 中开启 private preview;Opus 和 Haiku 也将很快登陆这两个平台。
我们认为,模型智能远未达到极限,并计划在未来几个月内频繁更新 Claude 3 模型家族。我们也很高兴即将推出一系列增强模型能力的功能,尤其面向企业使用场景和大规模部署。这些新功能将包括 Tool Use(也称为 function calling)、交互式编程(也称为 REPL),以及更高级的 Agent 能力。
在不断拓展 AI 能力边界的同时,我们也同样致力于确保安全防护措施能够跟上性能跃升的步伐。我们的判断是,站在 AI 发展的最前沿,是引导其发展轨迹走向积极社会成果的最有效方式。
我们很期待看到你使用 Claude 3 创造出的成果,也希望你能向我们提供反馈,让 Claude 成为更加实用的助手和创意伙伴。要开始使用 Claude 进行构建,请访问 anthropic.com/claude。
此表对比的是目前已经商用并公布评测结果的模型。我们的 model card 还对比了已经发布公告、但尚未正式推出的模型,例如 Gemini 1.5 Pro。此外,我们还要说明,工程师们已经针对评测优化了 prompt 和 few-shot 样本,并报告了新版 GPT-4T 模型取得的更高分数。来源。