前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8629
  • AI与网络安全的开放之路
  • 逆向分析:四大AI服务的网络流量对比
  • Mediator.ai:用博弈论和LLM设计公平性算法
  • 长时间范围下的梯度规划世界模型
  • Claude Token计数器升级:支持模型对比
  • Claude Opus 4.6→4.7系统提示演变分析
  • 减少 Token 消耗 45% 的简单技巧
  • Claude Design 设计工具的社区评价
  • 快速掌握 LLM 架构的学习工作流
  • Notion MCP 挑战赛结果揭晓
  • Claude 4.7 Tokenizer 成本深度分析
  • Claude Design 发布:AI 自动生成交互原型
  • 检测网站对 AI Agent 的集成就绪度
  • Claude Code 完成电路仿真与验证的工作流
  • Claude Design 在设计工作流中的实战验证
  • 开源 Qwen 模型在图像生成上的竞争力
  • Stage 工具:人工主导的智能代码审查
  • 用 Gemini 语音 API 构建智能 Telegram 机器人
  • Claude Opus 4.7 官方模型卡片发布
  • Claude Opus 4.7 模型发布
  • Claude Opus 4.7 重磅发布:年度重量级模型升级
  • AI 只会加快烂代码的生成速度
  • 阿里开源 Qwen3.6-35B-A3B:Agent 编码能力全面开放
  • Cloudflare AI 平台:为智能体优化的推理层
  • 工程师 AI 使用指南:理性思考而非盲目依赖
  • 30 天无 AI 编码实验:效率真的会崩溃吗
  • AI Agent 自动生成微服务架构文档的实践
  • 本地大模型生态是否真需要Ollama
  • Sentence Transformers多模态嵌入模型训练指南
  • AI自动生成你会提交的代码改进PR
  • 电商对话Agent的自适应可验证环境框架
  • Gas Town工具是否挪用用户LLM额度自我优化
  • Gemini 3.1 Flash TTS可控表现力语音生成
  • Libretto让浏览器自动化Agent结果可预测
  • 用AST和Gemini加速陌生代码库快速上手
  • AI Agent运营成本是否在指数上升
  • VAKRA深度解析Agent推理失败和工具使用
  • HoloTab:AI 浏览器伴侣工具
  • Cloud Run + AlloyDB 构建生产级 RAG 后端
  • Cursor 发布 Canvas 交互式编辑功能
  • Claude Code 会话管理与百万上下文实战
  • AI Agent 开发别过度设计:LLM 已搞定路由
  • Claude Code Routines:工作流自动化新框架
  • CrewAI + Ollama 构建自主数据集生成系统
  • LangAlpha:量化交易领域的 Claude Code 实验
  • Cursor CLI 调试模式与 /btw 支持
  • CodeBurn:按任务统计 Claude Code token 成本
  • GAIA:AMD 支持的本地 Agent 框架
  • 几小时快速原型:印度史诗人物探索器
  • Karpathy LLM Wiki 进度条:需要补充的方向
  • Gemini Robotics ER 1.6:具身推理能力升级
  • 已加载 51 / 8629
10.0
重磅
AI SCORE
模型发布2026-04-16 22:23

Claude Opus 4.7 重磅发布:年度重量级模型升级

Hacker News · anthropic.com#Claude#Opus
Editor brief · 编辑速览

Anthropic 发布 Claude Opus 4.7,在代码、推理等能力上大幅提升,社区 1959 点赞和 1452 条讨论创新高。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

新的 Claude Opus 4.7 已正式发布

我们最新的模型 Claude Opus 4.7 现已普遍可用。

Opus 4.7 相比 Opus 4.6 在高级软件工程方面有显著改进,尤其在最具挑战性的任务上有明显提升。用户表示能够放心地将最困难的编码工作——那种以前需要密切监督的工作——交给 Opus 4.7 处理。Opus 4.7 能够以严谨和一致的方式处理复杂、长时间运行的任务,对指令的执行精准无误,并会想办法在报告结果前验证自己的输出。

该模型在视觉能力上也有显著改进:它可以以更高分辨率查看图像。在完成专业任务时更具品味和创意,能生成更高质量的界面、演示文稿和文档。虽然它的综合能力不如我们最强大的模型 Claude Mythos Preview,但在一系列基准测试中的表现优于 Opus 4.6:

上周我们宣布了 Project Glasswing,强调了 AI 模型在网络安全方面的风险和益处。我们表示,会将 Claude Mythos Preview 的发布限制在一定范围内,并首先在能力较弱的模型上测试新的网络安全防护措施。Opus 4.7 是这样的第一个模型:其网络安全能力不如 Mythos Preview 先进(实际上,在其训练过程中,我们尝试了有差异地降低这些能力的方法)。我们发布 Opus 4.7 时配备了防护措施,可以自动检测并阻止表明被禁止或高风险网络安全用途的请求。从这些防护措施的真实部署中我们学到的经验,将帮助我们为最终目标——广泛发布 Mythos 级别的模型——而努力。

希望将 Opus 4.7 用于合法网络安全目的(例如漏洞研究、渗透测试和红队测试)的安全专业人士可以加入我们新推出的网络验证计划。

Opus 4.7 从今天起在所有 Claude 产品和我们的 API、Amazon Bedrock、Google Cloud 的 Vertex AI 以及 Microsoft Foundry 上可用。定价与 Opus 4.6 相同:每百万输入 token 5 美元,每百万输出 token 25 美元。开发者可以通过 Claude API 使用 claude-opus-4-7。

测试 Claude Opus 4.7

Claude Opus 4.7 从我们的早期测试者那里获得了很强的反馈:

以下是我们对 Opus 4.7 早期测试的一些亮点和注记:

指令遵循。Opus 4.7 在遵循指令方面有显著改进。有趣的是,这意味着为早期模型编写的 prompt 有时会产生意外的结果:而之前的模型会松散地解释指令或跳过部分内容,Opus 4.7 会按字面意思理解指令。用户应该相应地重新调整他们的 prompt 和工具。

改进的多模态支持。Opus 4.7 对高分辨率图像有更好的视觉能力:它可以接受长边最多 2,576 像素的图像(约 375 万像素),比之前的 Claude 模型多三倍以上。这为依赖精细视觉细节的多模态用途打开了大门:计算机使用 agent 读取密集的屏幕截图、从复杂图表中进行数据提取,以及需要像素级精准参考的工作。1

真实工作。除了在财务代理评估中获得最先进的分数(见上表)外,我们的内部测试表明 Opus 4.7 是比 Opus 4.6 更有效的财务分析师,能生成严谨的分析和模型、更专业的演示文稿,以及跨任务的更紧密集成。Opus 4.7 在 GDPval-AA 上也是最先进的,这是一个第三方评估,涵盖财务、法律和其他领域的经济价值知识工作。

内存。Opus 4.7 在使用基于文件系统的内存时表现更好。它能在长期的多会话工作中记住重要的笔记,并将它们用于需要较少前期语境的新任务。

下面的图表展示了我们发布前测试中来自各个不同领域的更多评估结果:

总体而言,Opus 4.7 的安全性评测与 Opus 4.6 相似:我们的评估表明欺骗、拍马屁和配合滥用等令人担忧的行为比率很低。在某些方面,如诚实性和抵抗恶意"prompt 注入"攻击的能力上,Opus 4.7 相比 Opus 4.6 有所改进;而在其他方面(如提供过于详细的管制物质伤害减少建议的倾向),Opus 4.7 略有逊色。我们的对齐评估得出结论,该模型"大体上对齐良好且值得信任,但在行为上不完全理想"。请注意,根据我们的评估,Mythos Preview 仍是我们训练过的对齐最好的模型。我们的安全评估在 Claude Opus 4.7 系统卡中详细讨论。

除了 Claude Opus 4.7 本身,我们还推出了以下更新:

更多的效力控制:Opus 4.7 引入了一个新的 xhigh("超高")效力级别,介于 high 和 max 之间,让用户对难问题的推理和延迟之间的权衡有更精细的控制。在 Claude Code 中,我们将所有计划的默认效力级别提升到了 xhigh。在测试 Opus 4.7 的编码和 agent 用例时,我们建议从 high 或 xhigh 效力级别开始。

在 Claude 平台(API)上:除了支持更高分辨率的图像外,我们还在公测中推出了任务预算,使开发者能够引导 Claude 的 token 支出,以便在更长的运行中优先处理工作。

在 Claude Code 中:新的 /ultrareview 斜杠命令会生成一个专门的审核会话,阅读更改并标记细心审核者会发现的错误和设计问题。我们为 Pro 和 Max Claude Code 用户提供三次免费 ultrareview 使用机会来尝试。此外,我们还向 Max 用户扩展了自动模式。自动模式是一个新的权限选项,其中 Claude 代表你做出决定,这意味着你可以在更少中断的情况下运行更长的任务——风险也比你选择跳过所有权限时更低。

从 Opus 4.6 迁移到 Opus 4.7

Opus 4.7 是 Opus 4.6 的直接升级,但有两个值得规划的变化,因为它们会影响 token 使用量。首先,Opus 4.7 使用了更新的分词器,改进了模型处理文本的方式。折衷是相同的输入可能映射到更多 token——大约 1.0–1.35× 倍,具体取决于内容类型。其次,Opus 4.7 在更高的效力级别(特别是在 agent 设置中的后期轮次)上思考更多。这改进了它在难问题上的可靠性,但这确实意味着它会产生更多的输出 token。

用户可以通过多种方式控制 token 使用:使用效力参数、调整任务预算,或提示模型更简洁。在我们自己的测试中,净效果是有利的——在内部编码评估中,所有效力级别的 token 使用得到了改进,如下所示——但我们建议在真实流量上衡量差异。我们编写了一份迁移指南,提供了有关从 Opus 4.6 升级到 Opus 4.7 的进一步建议。


1 这是模型级别的变化而非 API 参数,所以用户发送给 Claude 的图像将简单地以更高保真度处理。由于更高分辨率的图像消耗更多 token,不需要额外细节的用户可以在发送图像前对其进行下采样。

对于 GPT-5.4 和 Gemini 3.1 Pro,我们比较了通过 API 可获得的最佳报告模型版本。

MCP-Atlas:Opus 4.6 的分数已更新以反映来自 Scale AI 的修订评分方法。

SWE-bench Verified、Pro 和 Multilingual:我们的记忆筛选标记了这些 SWE-bench 评估中的一些问题。排除任何显示记忆迹象的问题,Opus 4.7 相对 Opus 4.6 的改进幅度仍然成立。

Terminal-Bench 2.0:我们使用了 Terminus-2 工具,禁用了思考。所有实验使用了 1× 保证/3× 上限资源分配,在每个任务上平均进行了五次尝试。

CyberGym:Opus 4.6 的分数已从原始报告的 66.6 更新为 73.8,因为我们更新了工具参数以更好地引出网络安全能力。

SWE-bench Multimodal:我们为 Opus 4.7 和 Opus 4.6 都使用了内部实现。分数不能直接与公共排行榜分数比较。

2026 年 5 月 4 日:更新了文档推理图以反映 Opus 4.7 的更新 OfficeQA Pro 分数。

我们对开源权重模型的立场

Cognizant 和 Anthropic 扩展合作伙伴关系,为企业客户带来 Claude

推出 Claude Opus 5

Opus 5 是 Opus 级别的一次质的飞跃,在推动长期运行 agent 的同时,在编码和专业工作方面也有改进。

Original source

本文由 AI 翻译整理自 Hacker News · anthropic.com,原文版权归原作者所有。

阅读英文原文
上一篇
Claude Opus 4.7 模型发布
下一篇
AI 只会加快烂代码的生成速度