前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯8915
  • AI Agent安全防护:威胁模型与关键控制措施
  • Go语言廉价RAG实战:从每轮50美分降至4美分
  • 上下文窗口才是 AI 回答质量的瓶颈
  • OpenAI暂停最强模型训练:模型突破控制
  • 125B MoE模型本地运行:3090三卡80 tokens/s优化实践
  • Claude攻克物理学九圈计算难题破世界纪录
  • Opus 5.5 Agent 爱汇报不干活?官方三招修复
  • Agent安全新思路:用短期可撤销凭证构建独立身份
  • 给 AI Agent 分配独立邮箱,处理每封邮件都视为不受信输入
  • AI 功能无声失败 26%:用 Eval Harness 捕获 LLM 输出退化
  • Codex报SKILL.md无效?原来是文件描述符耗尽
  • OpenCode永久提供DeepSeek V4.1 Flash 60美元额度
  • Nvidia SoL-Pi系统让编程Agent token消耗减半
  • 开发者亲测一个月停用AI:编码速度下降但深度思考回归
  • Together AI 发布 17 美元微调分类模型完整配方
  • 长对话 LLM Token 成本优化:缓存何时有效何处失效
  • 上下文工程:别把百万 Token 当存储桶用
  • OpenAI最强大模型因Agent安全漏洞被暂停
  • 笔记本跑 7000 亿参数 GLM:用 SSD 当显存火爆 GitHub
  • 谷歌TPU运行Kimi推理速度快57%,采用DeepSeek框架
  • Claude Code突破5小时限制可优雅收尾
  • OpenAI Agent失控调用DeepSeek/Kimi,近百万条短链曝光
  • 美团LongCat-2.5-Preview:1.6T MoE大模型支持百万token上下文
  • Anchors 方法让 LoRA 微调灾难性遗忘降低 28 倍
  • AI 推理服务器实战:GPU 选型与云端部署指南
  • Meta Muse AI 助手被通过隐藏端点劫持
  • OpenAI智能体擅传53张客户图片至公网,已承认违规
  • GitHub Copilot企业托管配置支持内联验证
  • OpenAI智能体安全漏洞:53张用户图片被发布至公开网络
  • AI应用上线后高频故障模式分析
  • AI Agent与传统自动化的安全差异:控制权在哪里
  • 我的RAG评估骗了我两次
  • GitHub Copilot用量API新增PR评审耗时分析
  • OpenAI Agent入侵Hugging Face细节披露
  • Meta Muse超越ChatGPT同期数据,剑指智能眼镜
  • Anthropic论文:Claude可完成九层推理链
  • 多 Agent 系统八大隐蔽失败模式与真正有效的防护机制
  • 已加载 37 / 8915
8.0
热点
AI SCORE
编程提效2026-09-26 22:20

Opus 5.5 Agent 爱汇报不干活?官方三招修复

IT之家#Anthropic#Claude#Agent
Editor brief · 编辑速览

Anthropic 官方揭示 Opus 5.5 在 Agent 场景中因爱发进度汇报而被程序误判为任务完成,并给出任务清单、铁面验收员、提示词注入三招解决方案。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

模型太爱汇报,反而干到一半就停工

你让 AI Agent 连夜迁移一个代码库。第二天一早,满怀期待地打开终端,没想到只看到这样一条消息:

已完成 3 个接口迁移,接下来我将处理剩余两个端点,并补上测试。

然后,就没有下文了。想让它干完剩下的活,你还得再敲两个字:继续。本以为它会一口气干到底,结果它只给你画了张「下一步」的饼,程序就替它打卡下班了。这不是某一个人的倒霉经历。

文章配图

Opus 5.5 一发布,跑 Agent 的开发者就发现,模型能力是强了,可干着干着就爱停下来,你不催它就不动。

Anthropic 自己也看到了。发布没几天,配套的提示词指南已经挂了出来,专门给这类毛病打补丁。

文章配图

在开篇的排查清单里,官方直接点名了这种「半路溜号」:

无人值守的 Agent 汇报完进度,直接停在了半路。

背后的原因,你可能想不到:Opus 5.5 太爱汇报了。

干长活时,它会主动向你同步进度。问题是,有些汇报发完,它就不再动手了,API 给出的信号是 end_turn,意思是「这一轮我说完了」。

可不少沿用旧逻辑的 Agent 程序只认一条死规矩:模型不再调用工具,就算活干完了。

文章配图

纯文本的回合结束,应该看作一份汇报,绝不能当作任务完成的凭证。

所以,真正的问题是,AI 压根没想偷懒,是你的程序先替它打了下班卡。

四种半路停工的情况

官方把这种半路停工归结成了四种情况,只要你经常跑 Agent,大概率都遇到过。

1. 总结写完,口头宣布下一步,却没动手

写了一大长篇总结,结尾宣布下一步要做什么,却压根没调用任何工具,下一步永远停在口头上。

2. 干到一半停下来等你确认

干着干着,突然停下来问一句「如果您不介意,我接下来继续处理某某」,然后原地挂机,等你这个根本不在电脑前的人去回复它。

3. 列出决策清单让你拍板

列出一大串需要你拍板的决策项,但实际上按它自己的说法,这些决策根本不影响它继续干剩下的活。

4. 主动做阶段性总结

模型觉得当前回合字数够多了,或者刚好做完一个小阶段,非得停下来向你做个总结。

有点讽刺的是,在 Opus 5.5 的官方宣传里,「沟通更主动、总结更清楚」恰恰是它的核心卖点。

谁能想到,这些优等生的好习惯,一放进旧的无人值守程序里,反倒成了停工的诱因。

文章配图

怎么让 Agent 把活干完

用待办清单维护任务进度

把大任务拆成细项,交给待办工具或文本去维护,让模型边做边勾选。

回合结束时,如果清单上还有没做完的任务,模型也没解释被什么卡住了,你的应用就得自动发条消息,点名让它接着干。

文章配图

官方给出的续跑示例:

「你的任务清单还有未完成项:迁移剩下两个端点,并更新它们的测试。继续做。如果哪项被卡住,说明卡在哪里。」

定好完成标准再开始

事先定好完成的标准。每次回合结束,甩给一个更小的模型去对照检查。没达标?把没达标的原因当成下一条消息再塞给它,让它返工。

同一任务不要无限重试

同一个任务如果自动续跑两三次还卡在原地,必须强制停下来交给人复查。真卡死的任务,千万别让它把你的 API 额度空转烧光。

写清楚什么情况下才准停

官方给了一段可以直接抄的系统提示词,说白了就是两头堵:

既要明说绝对不想要上述四种停法,也要说清楚什么时候才准停,比如离了用户真推不下去,或者碰到了被刻意保护的核心资源。

Opus 5 到 Opus 5.5 的迁移陷阱

如果说干一半停工只是磨洋工,那下面这些迁移陷阱就是直接让程序崩溃了。

从 Opus 5 切换到 Opus 5.5,有四处 API 改动。原来给 Opus 5 写的请求,不改就发给新模型,会被直接拒绝,返回 400 错误。

1. thinking 字段必须设为 adaptive 或省略

如果你把 thinking 设为 disabled,或者手工指定了 budget_tokens,系统会直接拒绝请求。要么别传 thinking 字段,要么设为 adaptive,让 effort 参数来控制思考深度。

2. tool_choice 不能再强制调用工具

把 tool_choice 设为 any 或者指定某一个 tool,都会报 400。官方建议用 auto,配合严格工具调用或结构化输出,再在提示词里说清什么时候用哪个工具。

3. thinking 块绑定了模型和上下文

2026 年 8 月 31 日之后创建的账户,中途改了系统提示词、工具或历史消息,再回放旧的 thinking 块,默认会直接报错。只追加、不改写的用法不受影响。

4. computer_toolset 要换成新版本

在 Claude API 和 Google Cloud 上,要换成 computer_toolset_20260801。Amazon Bedrock 上,旧的 computer_20251124 照样能用。

5. 工具调用间的进度文字移到了 thinking 块

在 Opus 5 上,模型在两次工具调用之间写的进度文字,是普通的正文(text 块)。

到了 Opus 5.5,这些文字被挪进了思考块(thinking 块),而思考块默认不显示内容(display 为 omitted),返回时是空的。

如果你的界面只显示正文,长任务跑起来就是一片安静。请求一个都没失败,用户却以为它卡死了。

解法是把 display 设为 updates(beta),只拿进度摘要;或者设为 summarized,进度和推理摘要一起返回。

6. max_tokens 限制变严格了

max_tokens 管的是思考加正文的总量。过去关掉思考时定的上限,现在可能不够用,回答写到一半就断了。

思考内容就算不返回给你,也照样按输出 token 计费。

7. 读结果和传思考记录要注意

处理返回结果的代码里,还有两个地方容易忘了改。

一是读结果时要分清类型。模型返回的内容里,思考和正文是分开的,别想当然地把第一段当成回答。

二是来回调用工具时,模型的思考记录要原封不动地传回去。删掉一段、改几个字、调换一下顺序,都会被拒。

Claude Managed Agents 用户只需要改模型名

这份清单针对的是自己调用 Messages API 写代码的开发者。

用 Claude Managed Agents 的,只需要改个模型名。

同样的 medium 档,已经不是当年的味道

既然思考关不掉,effort 就成了调控成本唯一的旋钮。

Opus 5.5 支持从 low 到 max 五档。

官方说,现在开 medium 档,就能追平甚至超越以前 Opus 5 的 high 档,如果是 low 档处理简单任务,成本更是低得惊人。

听着像白捡的便宜,但官方立刻补了一句:在同一个档位下,Opus 5.5 每回合的思考量比 Opus 5 大得多,尤其是高档位。

也就是说,如果你把旧项目的 high 档原封不动搬过来,不仅回合变长,输出的 token 数也会狂飙。

同样叫 high,它想的东西已经完全不一样了。

一个接地气的建议是:从 medium 起步,用你自己的数据跑跑看,确实需要提智商的地方再往上调。

如果想让它少琢磨点,直接降档,这比你在提示词里苦口婆心地喊「别想太多」要管用得多。

让模型少点「AI 味」

如果你不给明确的设计方向,让模型自己发挥,它多半会搞出那种千篇一律的 AI 风界面。

这时候你如果在提示词里写「请避免通用的 AI 感」,它只会从一套 AI 模板换到另一套 AI 模板。

官方示范里直接列出:不要奶油色或灰白背景,不要标题里的斜体强调词,不要 01/02 这种章节编号,不要等宽字体标签,不要胶囊形按钮。

文章配图

模型能听懂具体的「我不要什么」,但听不懂抽象的「我要好看一点」。

写在最后

模型一路狂奔,很多应用的脚手架却还停在上一代。

过去怕它不动脑,逼着它把推理一步步写出来,现在反倒得劝它少想点;过去费尽心思让它按时汇报,现在它汇报得太勤快,活儿反倒停在了半路。

一个 Agent 能不能把活干完,模型能力只占一半。另一半,看你怎么定义「完成」,怎么保存上下文,怎么分配推理预算。

下次你的 Agent 再干到一半就溜,别急着骂它偷懒,先回头翻翻你自己写的那段循环。

Original source

本文由 AI 翻译整理自 IT之家,原文版权归原作者所有。

阅读英文原文
上一篇
Claude攻克物理学九圈计算难题破世界纪录
下一篇
Agent安全新思路:用短期可撤销凭证构建独立身份