Anthropic官方评价Opus 5.5为其测试过的最强模型,在保持Fable级能力的同时降低了使用门槛。
Anthropic 最新推出的模型 Opus 5.5 于本周二发布,据该公司称,这是一款在编程和知识工作性能方面达到全新最高水准的模型。Opus 是 Anthropic 三层 Claude 系列中能力最强、价格最高的层级;Sonnet 居中,Haiku 则是速度最快、价格最低的。值得注意的是,Anthropic 表示,这款产品在多项基准测试中超越了更大的 Fable 模型,并在一些 Fable 未能完成的非正式任务中取得了成功。
新版模型在成本上也比前代产品大幅降低。Opus 5.5 的输出 token 定价为每百万 token 20 美元,而前代模型为 25 美元。其他指标也有类似的价格下降。该模型的运行速度也更快,反映出为其提供服务所需的计算资源总体下降。
新版还在 Opus 的沟通方式上做出了重大改变——Opus 5.5 更少使用专业术语,更倾向于将重要信息放在消息开头。
此次发布距 7 月 24 日 Opus 5 发布仅过去两个月。根据公告,Sonnet 5.5 和 Haiku 5.5(系列中的下一层级)将在"未来几周内"发布,并带来类似的性能提升。
Anthropic 表示,Opus 5.5 在生物学和网络安全方面的能力与 Mythos 相当,因此其发布受到与该公司 Fable 模型相同的安全保障措施的约束。这些措施限制了模型在发现编译程序中的漏洞或开发生物武器等方面的使用程度。
Opus 5.5 是 Anthropic 自 CEO Dario Amodei 接受"放缓前沿进展"的呼吁以来的首次模型发布,有意放慢 AI 能力的发展速度,以与对齐工作的进展速度相匹配。
Amodei 在本月早些时候的一篇文章中写道:"我越来越确信,要充分应对风险,需要更加谨慎,不仅要投资于风险防范,还要控制能力提升的速度,以便风险防范工作有时间跟上。"
Opus 5.5 的安全训练与前代产品大体相似,通过了 METR 和 Frontier Design 等外部组织的对齐测试和发布前评估。但 Anthropic 强调,更先进的训练和评估系统已经在为未来模型做准备,包括改进的安全和监控系统。
博客文章写道:"随着 AI 变得越来越强大,公共政策应该在确保人们依赖的系统安全方面发挥更大的作用。这种能力的构建需要时间,我们已经开始建立支持它所需的基础设施。我们预计将在不久后分享这些努力的更多细节。"