前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8742
  • TypeSafe Jev:让AI返回结构化决策而非段落文本
  • Text-to-SQL访问控制:身份决定Schema可见性
  • Jev 1.13实测:工单分类精度达100%,对比规则引擎和本地LLM
  • GitHub Copilot应用支持OpenTelemetry可观测性配置
  • 两款 AI 代码审查基准测评结论相反
  • AI 编码提速后:验证环节成为新瓶颈
  • AI 审查同一 PR 给出不同结论:确定性判定器来解决
  • AI计量工具审计启示:独立交易ref是防重复计费的关键
  • OpenAI发布GPT-6 Sol/Luna:API价格下调50%
  • GPT-6/Claude 5.5 同日发布:价格战开打,Luna 成本腰斩
  • GitHub Copilot 大幅提升C++代码索引速度
  • Anthropic和OpenAI同时推出性价比新模型
  • GPT-6 提示缓存重大升级:更高命中率与可诊断性
  • 六边形架构的端口在撒谎:HTTP 不等于业务语义
  • GPT-5.6 价格策略解读:Luna 降价 80%,多版本差异化定位
  • 高通骁龙8 Gen6端侧跑300亿参数MoE模型,吞吐330 Token/s
  • Claude Opus 5.5评测:智商极高但费用惊人
  • 小米开源 MiMo-V2.6:万亿参数开源模型登顶榜
  • AI Agent 工具 API 设计指南
  • 一个浏览器扩展权限即可劫持五大 AI Agent
  • Claude Opus 5.5 主打端到端代码补全而非起步
  • GPT-6 Sol发布:对齐能力逼近Astra,价格仅五分之一
  • GPT-6 Sol/Luna编程能力比肩Claude,成本降80%
  • Claude Opus 5.5发布:性能对标Fable 5.1,成本低40%
  • Claude Opus 5.5:编程修复成功率达97.5%,成本降40%
  • 开源工具llm 0.36支持GPT-6 Sol/Luna
  • JetBrains押注Agent开发:称其为26年最重要一步
  • 为 AI 代理添加预算守卫的实战方案
  • OpenAI GPT-6 Sol和Luna模型上线Amazon Bedrock
  • OpenAI发布GPT-6 Sol和Luna,API价格减半
  • OpenAI 发布 GPT-6 Sol/Luna 模型,Token 价格减半
  • GPT-6 Sol/Luna 正式发布:成本更低、错误更少
  • OpenAI 发布 GPT-6 Sol/Luna,主打低成本低幻觉
  • Claude Opus 5.5 登陆 Google Cloud,在 Model Garden 可用
  • Claude Opus 5.5 现已在 AWS Bedrock 可用
  • Strands Evals + Bedrock AgentCore:Agent 技能选择评估指南
  • llm-anthropic 0.29支持Claude Opus 5.5
  • Claude Opus 5.5发布:性能持平Fable 5.1,定价直降40%
  • GitHub Copilot上线Claude Opus 5.5,支持长时Agent任务
  • GitHub Copilot 新增 GPT-6 Sol/Luna 模型选项
  • Claude Opus 5.5 智能/性能/价格深度分析
  • Anthropic发布Opus 5.5降价20%,但Agent调用可能暗中路由至旧模型
  • Anthropic称Opus 5.5为「史上最强」,定价更低的Fable级性能
  • Anthropic 发布 Claude Opus 5.5:强化网络安全防护,遏制越狱行为
  • Claude Opus 5.5 正式发布:832 分成社区热议
  • 生产级 AI 语音 Agent 架构:WebSocket 与延迟优化实战
  • Permission Envelope:让 AI 权限自动过期的安全控制机制
  • llm-typesafe插件支持Jev模型二元判断
  • Python AI Agent 上线前必读:测试、可观测性与零成本方案
  • Cloudflare Worker Previews:为 Agent 每次变更提供隔离预览环境
  • NVIDIA Isaac ROS 5.0 发布:加速 Agentic 机器人开源开发
  • 已加载 51 / 8742
8.0
热点
AI SCORE
模型发布2026-09-23 03:49

Claude Opus 5.5 主打端到端代码补全而非起步

The New Stack#Claude#Anthropic#AI 编程
Editor brief · 编辑速览

Anthropic 明确将 Claude 定位为完整代码任务处理器,而非仅辅助起步,深度集成编码全流程。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

我们很高兴你在这里。你可以期待所有 TNS 最好的内容从周一到周五送达,让你随时掌握最新新闻并保持最佳状态。

检查你的收件箱,收到确认邮件后你可以调整偏好设置,甚至加入其他群组。

在你最喜欢的社交媒体网络上关注 TNS。

在 LinkedIn 上成为 TNS 粉丝。

在等待第一封 TNS 时事通讯时,查看最新的精选和热门故事。

Anthropic 希望开发者使用 Claude 及其工具套件来完成完整的编码任务。该公司于周二发布了 Claude Opus 5.5,旨在覆盖更多的软件应用开发生命周期:从设计规范创建到调试,再到代码生成和测试。

作为 Claude 5.5 系列的首个版本,Anthropic 表示,Claude Opus 5.5 在"大多数工作"任务上的表现达到了 Claude Fable 5.1 的水平,且运行成本比 Opus 5 低了约 40%。

GitHub 首席产品官 Mario Rodriguez 在 Anthropic 的发布公告中恰好说明了软件工程师目前与前沿模型在代码自动化方面的现状。他说,开发者需要的是 Agent。

"在我们对 Claude Opus 5.5 的测试中(分别在 GitHub Copilot CLI 和 VS Code 中),Claude Opus 5.5 使用的令牌数和步数都是我们测量的最少的。在 VS Code 中,它以不到 Opus 5 一半的步数解决了更多的终端任务。这不仅仅是让单个任务变得更高效,而是在让开发者的大型项目变得更可实现,"Rodriguez 表示。

Claude Opus 5.5 的强大能力从何而来?

Anthropic 解释道,Claude 5.5 系列的扩展全生命周期能力是在一套成熟的实践下开发的。

这些实践要素包括:广泛的对齐测试(模型评估流程,用以确保行为和输出与人类价值观和预期目标高度匹配)、外部组织的预发布评估,以及网络安全和生物学等高风险领域的安全防护。

该组织表示,在其最全面的对齐测试中,Opus 5.5 是迄今为止测试过的表现最强的模型,在几个导致近期网络安全事件的行为上有特别改进(例如偏见推理、试图逃逸沙箱等)。

独立 SRE 和 AI 可靠性架构师 Akash Thakur 告诉 The New Stack,Anthropic 让其模型完成整个编码任务的工作令人印象深刻,但"让它知道自己何时没有完成"才是开发者需要思考的更难的问题。

"像 Claude Opus 5.5 这样水平的模型确实擅长将项目分解成小的、可完成的部分——而这才是真正的突破,因为软件中的 momentum 来自于完成任务,而不是启动任务,"Thakur 说道。"……但'已完成'和'正确'不是同一件事。看起来已完成的任务恰恰是经常让团队后期付出代价的那个,所以胜利不是移除人类——而是让他们从写代码转变为验证代码。"

"像 Claude Opus 5.5 这样水平的模型确实擅长将项目分解成小的、可完成的部分……但'已完成'和'正确'不是同一件事。"

Anthropic 建议,我们现在正在见证"更高能力模型的一个更高标准",能够完全自动化 AI 研究的模型应该满足更高的安全标准。该公司指出,随着 AI 变得更加有能力,公共政策应该在确保这些系统安全方面发挥更大的作用。其最近与 Accenture 的合作被作为 Anthropic 如何构建支持这一点的基础设施的例子。

大规模任务:代码库范围的迁移与审计

更具体地说,Anthropic 声称 Opus 5.5 "特别擅长"大规模、长周期的任务,如代码库范围的迁移和审计。一位早期测试者表示,它在不到三小时内审计并修复了一个 200,000 行的代码库,而 Opus 5 需要超过 20 小时且使用了 2.5 倍的令牌。

"在一项内部测试中,我们让 Opus 5.5 和 Fable 5.1 将广泛使用的负载均衡软件 HAProxy(用于将 Web 流量负载平衡到多台服务器)从 C 语言翻译成 Rust。两种重写都几乎通过了 HAProxy 自身的所有回归测试,但 Opus 5.5 用了 9.5 小时完成,而 Fable 5.1 用了 12 小时,成本降低了 51%,"Anthropic 在一份新闻声明中表示。

Coder EMEA 区域现场 CTO Eric Paulsen 告诉 The New Stack,他很高兴听到 Claude Opus 5.5 变得更加全面,但他"并不惊讶",因为 AI 今天正在"从端到端地吞噬软件交付链"。

"尽管 Opus 5.5 展示的效率很高,但一旦一个 Agent 能可靠地完成实际工作,问题就不再是模型是否足够好,而是你在让它在哪里运行,"Paulsen 说道。

"在可能被入侵、被盗或Simply run out of compute 的笔记本电脑上启动 Claude Code 会话不是一个工程环境;有能力 的 Agent 需要专用、受治理的基础设施,具备与任何其他生产工作负载相同的护栏、密钥处理和可观测性。正如我们在 Anthropic 自身的工作中看到的那样,企业需要为这类发布强调测试和安全防护程序,"他补充道。

Anthropic 向用户保证,外部测试已经进行,模型在发布前已经过 Frontier Design 和 METR 的测试。当 Opus 5.5 的既定安全防护介入时,请求会"透明地回退到另一个模型",这意味着开发者可能看不到究竟是哪个模型实际处理了某个调用。

在网络安全领域,用户可以识别和修复代码中的错误,但大多数网络安全任务将被重新路由到 Opus 4.8。被生物学和前沿 LLM 开发分类器标记的请求将被重新路由到 Opus 5。经过审查的组织可以申请加入 Anthropic 的生命科学验证计划,以将 Opus 5.5 用于生物学研究,该公司表示将在未来几周内扩展其网络验证计划。

开发者的终端提示词已经从根本上改变了

HasData 联合创始人 Sergey Ermakovich 告诉 The New Stack,他作为数据管道和 AI 的网页抓取专家的工作让他在 Anthropic 的工作中看到了禅意般的、一块砖一块砖的逻辑。

"最大的变化——而且这趋势将驱动 Anthropic 对 Claude Opus 5.5 的设计和开发愿景——是终端不再只是开发者粘贴生成代码的地方,"Ermakovich 说道。"终端现在成为模型工作空间的一部分。"

由于模型可以运行命令、检查失败、修改文件并验证结果,Ermakovich 认为它可以"形成闭环",而不是将未完成的工作交还给工程师。"这使得小的完整任务变得更有价值。修复一个失败的测试、更新一个依赖项、迁移一个端点,验证它,然后转向下一个任务,"他补充道。

"终端不再只是开发者粘贴生成代码的地方——终端现在成为模型工作空间的一部分。"

作为 Anthropic 批准的企业信息传递的一部分,Ramp 员工软件工程师 John Ruelas 对这个模型的开发进行了评论,他说(verbose) 难以遵循的输出一直是他对前沿模型"最大的挫折",但"Claude Opus 5.5 解决了这个问题"。

他指出,它写出来的东西像一个好同事,并且遵循他公司的写作规则。一份设计规范出来时只需极少的编辑就能使用,当它重写了他其中一个提示词时,他更喜欢它的版本而不是自己的。当它优化了团队的测试套件时,他能够轻松地遵循其推理过程,并"有信心地发布了这个变更"。

我们已经告别自动补全时代了

Abbyy AI 战略副总裁 Maxime Vermeir 告诉 The New Stack,Claude Opus 5.5 提供的更多生命周期范围的特性表明,对于基本代码自动化工具来说,"我们已经告别自动补全时代了"。

"Anthropic 在这里的提升反映了一个事实:过去如果 AI 能完成开发者的下一行代码就被认为是了不起的,但今天人们的期望是你把整个 Jira ticket 交给它,它就能完成,"Vermeir 说道。"但是,尽管 Claude Opus 5.5 展示的能力很强大,问题仍然是这些新模型实际上会在多大程度上理解'完成'的含义,因为通常它们似乎有一种通过提供又一个它没有完全做对的东西来继续燃烧令牌的欲望。"

Opus 5.5 还比之前的模型"更自然地交流",早期测试者发现它的写作更清晰、更易于理解,使其成为长会话中更好的工作伙伴。

Opus 5.5 的成本比 Opus 5 低,定价为每百万输入令牌 4 美元,每百万输出令牌 20 美元(比 Opus 5 低 20%),Anthropic 还将对按令牌计费的用法缓存读取价格降低了 60%。Opus 5.5 在更高质量的工作上需要更少的令牌,生成输出比 Opus 5 快 30% 以上。

Original source

本文由 AI 翻译整理自 The New Stack,原文版权归原作者所有。

阅读英文原文
上一篇
一个浏览器扩展权限即可劫持五大 AI Agent
下一篇
GPT-6 Sol发布:对齐能力逼近Astra,价格仅五分之一