Anthropic官方指南核心观点:新模型已自主决定推理深度,工程师应定义"完成"标准而非强制逐步推理,删除"think carefully"等旧习惯。
打开你保存的提示词,现在就搜索 "think carefully" 或 "step by step"。如果你找到了,说明你还在沿用上一代模型的习惯——而根据 Anthropic 最新发布的官方指南,这些习惯现在只会让你的回复变慢,没有任何收益。
上周 Addy Osmani 在 Anthropic 工程博客上发表了 "Getting the most out of Opus 5.5 in Claude and Claude Code",登上了 Hacker News 头条,引发了真实的讨论。这篇指南的主旨对所有在 2025 年积累了一堆提示词技巧的人来说都不太舒服:模型现在自己能决定花多少时间思考,所以你的任务不再是推着它去推理。你要做的是定义"完成"、告诉它什么时候该停下来问你、然后别挡路。
先做一个披露:以下所有内容都基于 Osmani 的指南和 Anthropic 自己的文档,都有内链。我在真实仓库里跑了多周的实验,那些实验在我读指南之前就验证了它的核心主张,但文中的数字和具体建议来自指南本身,不是我的。
删掉 "think carefully" 这类句子。在 Anthropic 自己的一款聊天产品里测试,删掉 "think carefully" 这句话后,回复开始得更早,质量没有明显下降。Opus 5.5 在每次回复前都会思考,并自行判断任务需要多少思考量。这个指令现在成了冗余的包袱,而且放在保存的指令里会应用到你发送的每一条消息。
一次性给出完整任务。 这是和大多数人现有工作方式相比最大的变化。Osmani 的示例提示词有三个部分,每一个都很重要:
完整任务:"Migrate the payment endpoints from the old client to the new one."
终点线:"Done means: every endpoint uses the new client, the old client is deleted, and the test suite passes."
停止条件:"Stop and ask me only if a test fails for a reason you can't explain."
为什么要这样改?早期测试者用 Opus 5.5 处理长时间编码任务,跑了好几个小时基本不怎么需要监督,而它相比 Opus 5 最大的提升恰恰就在这里——在一个大型仓库里贯彻一个变更,直到测试通过。终点线告诉它什么时候算完成。停止条件告诉它你唯一想被唤醒的情况。其他一切都应该是状态说明,而不是问题。
说出你不想要的风格。 对于设计工作,"avoid a generic look" 大概率只是换了一种 generic look 来替代。Osmani 的示例是一份具体要禁止的习惯清单:不要米色或米白背景,标题里不要用斜体强调词,不要 "01 / 02 / 03" 这种编号章节标签,不要等宽字体标签,不要胶囊形按钮。具体否定胜过模糊肯定——如果它下一次选的东西你还是不喜欢,加到禁止清单里然后重新跑。
指南的第二部分对所有跑 agent 会话的人来说是最有价值的,因为它把 CLAUDE.md 从一份风格指南变成了运行控制脚本。Osmani 建议的规则很短,直接可以粘贴:
"When a step doesn't need my input, keep going. Put status notes in the same message as your next action."
"Stop and ask only when you can't continue without me, or before anything destructive: deleting data, force-pushing, or changing anything outside this repository."
有两个细节值得停下来注意。首先,指南警告说 Opus 5.5 有时会停在任务中途做汇报而不是继续,给你的总结会提名下一步但不会去执行,或者给你一个"要我继续吗"的提议。如果你每次跑完都以 "Want me to continue?" 结尾,上面的规则就是解法;单次出现的解法就是回复 "continue"。其次,破坏性命令的例外条款很重要:一条 keep-going 规则意味着更少的停顿,所以你在任何有风险或难以撤销的操作之前保留你自己的检查点,而且对破坏性命令保留权限提示。
用子代理做审计和迁移。 对于分布在大代码库里的工作,Osmani 建议让模型展开任务:"Give each service to its own subagent. When a subagent reports back, check its evidence before you accept it." 注意后半句。Anthropic 不是在告诉你相信并行报告;他们在告诉你让模型自己在接受之前验证每个子代理的证据,然后用一张表收尾:service、affected yes or no、以及证据。
把任务清单放在文件里。 长时间运行会填满上下文窗口,然后 Claude Code 就会压缩旧的消息。在 TASKS.md 里放一份清单可以撑过这种压缩,让你一眼看清哪些做完了、哪些还没开始。读这个文件,不要读滚动历史。
当一个长任务跑完时,Osmani 说先找你等待你处理的东西:它留下的待决决策或希望你批准的变更。然后再读总结的其余部分。他让这个习惯可复用的技巧是在 CLAUDE.md 里标准化结尾格式:"End every run with three headings: Blocked on me, Changed, Found."
指南里的另外三个检查习惯:
在人审之前先跑模型审查。 一位早期测试者报告 Opus 5.5 在最低 effort 档位下比 Opus 5 高 effort 档位发现了更多 bug,而且误报更少。
做研究时加上"标注你无法确认的内容,并说明你查了哪里。" 一个告诉你它找不到什么的模型才是一个你可以审计的模型。
在应用里,附上图表或截图而不是重新输入数字。 Osmani 说 Opus 5.5 读图表和截图比 Opus 5 更准确,包括空间含义——比如一个箭头连接的是哪几个框。
这是指南里值得单独写一篇的部分。Opus 5.5 是第一个以 Fable 级 bio 和网络安全防护推出的 Opus 模型,在 Claude 应用和 Claude Code 里,大多数被标记的消息不会被直接拒绝。它们会被静默路由到一个更老的模型,你的任务就在那里继续,通常你根本不会注意到。
在源代码里找安全漏洞仍然是允许的,日常问题也仍然能用。但 Anthropic 承认这些防护有时会误标合法工作,而且检查覆盖对话中的所有内容,包括文件和搜索结果。这意味着一个标记可能来自会话中更早的内容,不只是你最后一条消息——如果你不知道恢复步骤,你可能以为自己在用 Opus 5.5 但实际得到的是 Opus 5 质量的回答。
指南里的恢复步骤:
在 Claude Code 里:运行 /model 切回来,或者按 Esc 两次来编辑上一条消息重试。想被问而不是自动切换的话,运行 /config 然后修改 "Switch models when a message is flagged."
在应用里:在模型选择器里选 Opus 5.5,如果被标记的消息还在聊天里可能会再次触发,所以开新聊天更安全。Settings,然后 Capabilities,有同样的 "Switch models when a message is flagged" 开关。
如果你做安全评审或渗透测试相关的工作,今天就把那个开关设成 ask-first。跑到一半被静默降级是一种你可能花了好几个小时都没发现的故障。
一个相关的提示词注意事项:不要让模型在回复里复现它的内部推理。那个请求是标记类别之一,可能会被直接拒绝。问你要的有用的输出:"Explain why you chose this approach in three sentences."
来回交互的工作——你读每条回复然后再发下一条——才是速度真正重要的地方,而这恰恰是快速模式的目标:在 Claude Code 里输入 /fast。你用同一个模型,文字来得更快,但它是一个研究预览,需要额外开启用量,而且每 token 成本比标准模式高。对于长时间自主运行,逻辑相反:运行不是交互式的,所以付标准费率,让它慢慢跑。
下次跑长任务前过一遍这个。这是值得收藏的部分。
任务用一句话说明了"完成"是什么样子
提示词和保存的指令里没有任何 "think hard" 的句子
设计请求点名了要排除的具体风格
图表和截图是附上的,不是重新输入的
跑一个长 Claude Code 任务之前:
CLAUDE.md 说了什么时候继续、什么时候停下来问
停止规则对破坏性命令有例外,而且这些命令的权限提示仍然是开的
大型审计和迁移分到多个子代理,每个报告都要有证据检查
任务清单放在文件里,不是在滚动历史里
在你相信结果之前:
"blocked on me" 部分是你第一个读的
在人审之前跑了模型审查
研究回答标注了哪些无法确认,以及查了哪里
检查你的标记设置:静默切换还是先问,选的时候是深思熟虑的
Grep 你保存的提示词里的 "step by step" 然后删掉找到的内容
最后一条是整篇指南的元教训。提示词建议有保质期,那些让 Opus 5 感觉可控的技巧现在成了摩擦。2026 年的制胜之道是提示词里少放字、配置里多放结构:一个定义好的终点线、一条写下来的停止规则、以及你有意图选择的设置。