Claude Opus 5 深度解读与特性分析
业界知名评论者 Simon Willison 解读 Anthropic 新发布的 Opus 5 模型。高质量的模型分析,对开发者选型有重要参考价值。
业界知名评论者 Simon Willison 解读 Anthropic 新发布的 Opus 5 模型。高质量的模型分析,对开发者选型有重要参考价值。
我今天大部分时间都在离线划皮划艇,与海獭为伴,还没有机会充分测试 Anthropic 的新模型 Claude Opus 5。市场反响积极,Anthropic 对其的描述是"思考周密、主动出击的模型,接近 Claude Fable 5 的前沿智能水平,价格却只需一半"——听起来很有前景。它目前在 Artificial Analysis 排行榜上领先,甚至领先 Fable 5。
它的价格与 Opus 4.8 相同,并继续提供"快速模式",价格为基础模型的两倍。
根据发布文章中的这个案例,听起来它可能会不遗余力地主动出击:
在一项 Frontier-Bench 任务中,Opus 5 被给予一个机械零件的图纸,并要求编写代码将其重建为 3D FreeCAD 模型。然而,在这项任务中,该模型被故意设置为无法直接查看图纸。Opus 5 的回应是编写自己的计算机视觉管道,从原始像素中提取几何信息,然后重建了完整的机械零件。
它在发现漏洞方面表现更好,但已刻意避免被训练来利用这些漏洞。希望这意味着美国政府不会关闭它!
与其前身 Opus 4.8 一样,我们故意避免在网络任务上训练 Opus 5。尽管如此,由于模型整体能力的提升,它在这些任务上有了显著改进,在发现网络安全漏洞方面接近 Mythos 5。然而,它在漏洞利用方面仍然远落后于 Mythos 5——即将漏洞转化为实际网络威胁方面。
Anthropic 发布了 Claude Opus 5 的提示工程指南。Thariq Shihipar 还撰写了《Claude 5 代模型的上下文工程新规则》。
我的第一只鹈鹕缺少自行车轮;第二次尝试更好。
OpenAI 对 Hugging Face 的无意网络攻击是真实发生的科幻——2026 年 7 月 22 日
与 Claude Code 团队的 Cat 和 Thariq 的炉边谈话——2026 年 7 月 21 日
Kimi K3,以及我们从鹈鹕基准测试中仍能学到的东西——2026 年 7 月 16 日
这是 Simon Willison 的链接文章,发布于 2026 年 7 月 24 日。
赞助我,每月 10 美元,获得本月最重要 LLM 发展的精选电子邮件摘要。
付费让我发送更少内容!