Anthropic发布重大模型版本,能力和性能显著升级,直接改变程序员AI编程工作方式。
我们正在升级 Claude Opus 到新版本:Claude Opus 4.8。它在 Opus 4.7 的基础上进行了改进,涵盖基准测试的各个方面,是一个更有效的协作者。价格保持不变。
Opus 4.8 推出时附带了多项新功能。claude.ai 上的用户现在可以控制 Claude 在完成任务时投入的工作量。Claude Code 拥有新的"动态工作流"功能,可以处理非常大规模的问题。Opus 4.8 的快速模式——模型可以以 2.5 倍的速度工作——现在的成本是之前模型的三分之一。
下表显示了 Opus 4.8 与其前身以及其他模型在编码、智能体技能、推理和实际知识工作任务测试中的对比。更多详情和更广泛的能力评估范围可在 Claude Opus 4.8 System Card 中找到。
早期测试者发现 Opus 4.8 在执行智能体任务时更加可靠,判断力更敏锐。以下是众多测试者对与 Opus 4.8 协作体验的评价:
Opus 4.8 最显著的改进之一是其诚实性。我们训练所有模型都保持诚实——例如,避免做出无法支持的声称。但 AI 模型存在的一个普遍问题是,它们有时会仓促下结论,尽管证据不足,仍自信地声称在工作中取得了进展。早期测试者报告称,Opus 4.8 更可能标记出对其工作的不确定性,也不太可能做出无根据的声称。这也体现在我们的评估中,Opus 4.8 允许其编写的代码中的缺陷不被注意的可能性比其前身低大约四倍。
与往常一样,我们在发布前对该模型进行了详细的对齐评估。在积极特质方面,我们的对齐团队得出结论,Opus 4.8 在"支持用户自主权和按用户最佳利益行动等利他特质的衡量标准上达到新高"。评估还表明,Opus 4.8 的不对齐行为(如欺骗或配合滥用)发生率大幅低于 Opus 4.7,与我们对齐度最好的模型 Claude Mythos Preview 相当。完整的对齐评估及部署前安全测试套件报告在 Claude Opus 4.8 System Card 中提供。
除了 Claude Opus 4.8,我们还进行了以下更新:
动态工作流。这项在研究预览中可用的新功能允许 Claude 在 Claude Code 中处理更大规模的任务。Claude 可以规划工作,然后在一次会话中运行数百个并行子智能体(使用 Opus 4.8 时,智能体的运行时间更长)。随后它会在向用户报告前验证输出。例如,具备 Opus 4.8 的 Claude Code 现在可以进行代码库规模的迁移,跨越数十万行代码,从启动到合并,以现有测试套件作为标准。你可以在这篇文章中了解更多关于动态工作流的内容——该功能在 Claude Code 企业版、团队版和 Max 计划中可用。
claude.ai 和 Cowork 中的工作量控制。模型选择器旁边新增了一个控件,让用户可以选择 Claude 投入到响应中的工作量。在更高工作量设置下,Claude 会更频繁、更深入地思考,以提供更好的响应。在较低工作量设置下,Claude 会更快地响应,使用用户的速率限制也更慢。用户现在可以进行这种选择——工作量控制在所有计划上都可用。
Messages API 现在接受消息数组内的系统条目。开发者可以在任务过程中更新 Claude 的指令,而不会破坏提示缓存或通过用户转向进行更新路由。这可以在给定的框架中用于更新权限、令牌预算或环境上下文,同时智能体运行。
Opus 4.8 默认为高工作量,我们认为这是质量和用户体验的最佳整体平衡。在编码任务中,此工作量级别消耗的令牌数与 Opus 4.7 的默认设置相似,但性能更好。用户可以选择"额外"(Claude Code 中的"xhigh")或"最大",模型将花费更多令牌以获得更好的结果;我们建议对困难任务和长期运行的异步工作流使用"额外"。我们已增加了 Claude Code 中的速率限制,以适应更高工作量级别的更高令牌使用量;用户可以选择最适合其特定项目的设置。
用户会发现 Opus 4.8 在其前身基础上的改进微妙但可感知。仍有更多工作要做:我们正在开发和发布能提供与 Opus 许多相同能力但成本更低的模型。
不仅如此,我们还计划发布一类具有比 Opus 更高智能水平的新模型。作为 Project Glasswing 的一部分,少数组织目前正在使用 Claude Mythos Preview 进行网络安全工作。这种能力级别的模型在广泛发布前需要更强的网络防护措施。我们在开发这些防护措施方面取得了快速进展,预计在未来几周内能够向所有客户提供 Mythos 级别的模型。
Claude Opus 4.8 今天在各处推出。常规使用定价与 Opus 4.7 相同:每百万个输入令牌 5 美元,每百万个输出令牌 25 美元。快速模式定价为每百万个输入令牌 10 美元,每百万个输出令牌 50 美元。开发者可以通过 Claude API 使用 claude-opus-4-8。
Terminal-Bench 2.1:我们使用 Terminus-2 公共框架报告了所有模型的分数。GPT-5.5 使用 Codex CLI 框架报告的分数为 83.4%。
OSWorld-Verified:我们修改了运行 OSWorld-Verified 评估的方式,以更准确地反映模型在现实世界中的性能,并将 Opus 4.7 的分数更新为 82.3%。阅读 System Card 中关于更新的更多内容。
Finance Agent v2:Gemini 3.5 Flash 在 Finance Agent v2 上的分数为 57.9%,相比 Gemini 3.1 Pro 取得了显著改进。
Cognizant 和 Anthropic 扩展合作关系,为企业客户带来 Claude
Opus 5 是 Opus 级别的阶跃性改进,为长期运行的智能体提供支持,同时在编码和专业工作中带来改进。