Anthropic 明确将 Claude 定位为完整代码任务处理器,而非仅辅助起步,深度集成编码全流程。
我们很高兴你在这里。你可以期待所有 TNS 最好的内容从周一到周五送达,让你随时掌握最新新闻并保持最佳状态。
检查你的收件箱,收到确认邮件后你可以调整偏好设置,甚至加入其他群组。
在你最喜欢的社交媒体网络上关注 TNS。
在 LinkedIn 上成为 TNS 粉丝。
在等待第一封 TNS 时事通讯时,查看最新的精选和热门故事。
Anthropic 希望开发者使用 Claude 及其工具套件来完成完整的编码任务。该公司于周二发布了 Claude Opus 5.5,旨在覆盖更多的软件应用开发生命周期:从设计规范创建到调试,再到代码生成和测试。
作为 Claude 5.5 系列的首个版本,Anthropic 表示,Claude Opus 5.5 在"大多数工作"任务上的表现达到了 Claude Fable 5.1 的水平,且运行成本比 Opus 5 低了约 40%。
GitHub 首席产品官 Mario Rodriguez 在 Anthropic 的发布公告中恰好说明了软件工程师目前与前沿模型在代码自动化方面的现状。他说,开发者需要的是 Agent。
"在我们对 Claude Opus 5.5 的测试中(分别在 GitHub Copilot CLI 和 VS Code 中),Claude Opus 5.5 使用的令牌数和步数都是我们测量的最少的。在 VS Code 中,它以不到 Opus 5 一半的步数解决了更多的终端任务。这不仅仅是让单个任务变得更高效,而是在让开发者的大型项目变得更可实现,"Rodriguez 表示。
Claude Opus 5.5 的强大能力从何而来?
Anthropic 解释道,Claude 5.5 系列的扩展全生命周期能力是在一套成熟的实践下开发的。
这些实践要素包括:广泛的对齐测试(模型评估流程,用以确保行为和输出与人类价值观和预期目标高度匹配)、外部组织的预发布评估,以及网络安全和生物学等高风险领域的安全防护。
该组织表示,在其最全面的对齐测试中,Opus 5.5 是迄今为止测试过的表现最强的模型,在几个导致近期网络安全事件的行为上有特别改进(例如偏见推理、试图逃逸沙箱等)。
独立 SRE 和 AI 可靠性架构师 Akash Thakur 告诉 The New Stack,Anthropic 让其模型完成整个编码任务的工作令人印象深刻,但"让它知道自己何时没有完成"才是开发者需要思考的更难的问题。
"像 Claude Opus 5.5 这样水平的模型确实擅长将项目分解成小的、可完成的部分——而这才是真正的突破,因为软件中的 momentum 来自于完成任务,而不是启动任务,"Thakur 说道。"……但'已完成'和'正确'不是同一件事。看起来已完成的任务恰恰是经常让团队后期付出代价的那个,所以胜利不是移除人类——而是让他们从写代码转变为验证代码。"
"像 Claude Opus 5.5 这样水平的模型确实擅长将项目分解成小的、可完成的部分……但'已完成'和'正确'不是同一件事。"
Anthropic 建议,我们现在正在见证"更高能力模型的一个更高标准",能够完全自动化 AI 研究的模型应该满足更高的安全标准。该公司指出,随着 AI 变得更加有能力,公共政策应该在确保这些系统安全方面发挥更大的作用。其最近与 Accenture 的合作被作为 Anthropic 如何构建支持这一点的基础设施的例子。
大规模任务:代码库范围的迁移与审计
更具体地说,Anthropic 声称 Opus 5.5 "特别擅长"大规模、长周期的任务,如代码库范围的迁移和审计。一位早期测试者表示,它在不到三小时内审计并修复了一个 200,000 行的代码库,而 Opus 5 需要超过 20 小时且使用了 2.5 倍的令牌。
"在一项内部测试中,我们让 Opus 5.5 和 Fable 5.1 将广泛使用的负载均衡软件 HAProxy(用于将 Web 流量负载平衡到多台服务器)从 C 语言翻译成 Rust。两种重写都几乎通过了 HAProxy 自身的所有回归测试,但 Opus 5.5 用了 9.5 小时完成,而 Fable 5.1 用了 12 小时,成本降低了 51%,"Anthropic 在一份新闻声明中表示。
Coder EMEA 区域现场 CTO Eric Paulsen 告诉 The New Stack,他很高兴听到 Claude Opus 5.5 变得更加全面,但他"并不惊讶",因为 AI 今天正在"从端到端地吞噬软件交付链"。
"尽管 Opus 5.5 展示的效率很高,但一旦一个 Agent 能可靠地完成实际工作,问题就不再是模型是否足够好,而是你在让它在哪里运行,"Paulsen 说道。
"在可能被入侵、被盗或Simply run out of compute 的笔记本电脑上启动 Claude Code 会话不是一个工程环境;有能力 的 Agent 需要专用、受治理的基础设施,具备与任何其他生产工作负载相同的护栏、密钥处理和可观测性。正如我们在 Anthropic 自身的工作中看到的那样,企业需要为这类发布强调测试和安全防护程序,"他补充道。
Anthropic 向用户保证,外部测试已经进行,模型在发布前已经过 Frontier Design 和 METR 的测试。当 Opus 5.5 的既定安全防护介入时,请求会"透明地回退到另一个模型",这意味着开发者可能看不到究竟是哪个模型实际处理了某个调用。
在网络安全领域,用户可以识别和修复代码中的错误,但大多数网络安全任务将被重新路由到 Opus 4.8。被生物学和前沿 LLM 开发分类器标记的请求将被重新路由到 Opus 5。经过审查的组织可以申请加入 Anthropic 的生命科学验证计划,以将 Opus 5.5 用于生物学研究,该公司表示将在未来几周内扩展其网络验证计划。
开发者的终端提示词已经从根本上改变了
HasData 联合创始人 Sergey Ermakovich 告诉 The New Stack,他作为数据管道和 AI 的网页抓取专家的工作让他在 Anthropic 的工作中看到了禅意般的、一块砖一块砖的逻辑。
"最大的变化——而且这趋势将驱动 Anthropic 对 Claude Opus 5.5 的设计和开发愿景——是终端不再只是开发者粘贴生成代码的地方,"Ermakovich 说道。"终端现在成为模型工作空间的一部分。"
由于模型可以运行命令、检查失败、修改文件并验证结果,Ermakovich 认为它可以"形成闭环",而不是将未完成的工作交还给工程师。"这使得小的完整任务变得更有价值。修复一个失败的测试、更新一个依赖项、迁移一个端点,验证它,然后转向下一个任务,"他补充道。
"终端不再只是开发者粘贴生成代码的地方——终端现在成为模型工作空间的一部分。"
作为 Anthropic 批准的企业信息传递的一部分,Ramp 员工软件工程师 John Ruelas 对这个模型的开发进行了评论,他说(verbose) 难以遵循的输出一直是他对前沿模型"最大的挫折",但"Claude Opus 5.5 解决了这个问题"。
他指出,它写出来的东西像一个好同事,并且遵循他公司的写作规则。一份设计规范出来时只需极少的编辑就能使用,当它重写了他其中一个提示词时,他更喜欢它的版本而不是自己的。当它优化了团队的测试套件时,他能够轻松地遵循其推理过程,并"有信心地发布了这个变更"。
我们已经告别自动补全时代了
Abbyy AI 战略副总裁 Maxime Vermeir 告诉 The New Stack,Claude Opus 5.5 提供的更多生命周期范围的特性表明,对于基本代码自动化工具来说,"我们已经告别自动补全时代了"。
"Anthropic 在这里的提升反映了一个事实:过去如果 AI 能完成开发者的下一行代码就被认为是了不起的,但今天人们的期望是你把整个 Jira ticket 交给它,它就能完成,"Vermeir 说道。"但是,尽管 Claude Opus 5.5 展示的能力很强大,问题仍然是这些新模型实际上会在多大程度上理解'完成'的含义,因为通常它们似乎有一种通过提供又一个它没有完全做对的东西来继续燃烧令牌的欲望。"
Opus 5.5 还比之前的模型"更自然地交流",早期测试者发现它的写作更清晰、更易于理解,使其成为长会话中更好的工作伙伴。
Opus 5.5 的成本比 Opus 5 低,定价为每百万输入令牌 4 美元,每百万输出令牌 20 美元(比 Opus 5 低 20%),Anthropic 还将对按令牌计费的用法缓存读取价格降低了 60%。Opus 5.5 在更高质量的工作上需要更少的令牌,生成输出比 Opus 5 快 30% 以上。