Anthropic 工程师分享 Claude Code 即将支持 Mods、插件系统、项目管理和标签功能,配合 Opus/Sonnet 5.5 模型更新。
Claude Code 的下一个时代 — Thariq Shihipar,Anthropic
我们很高兴能邀请到 Anthropic 在两周后的 AI Engineer New York 大会上分享他们最新的 AI x 金融工作成果!
如果你消息闭塞,以下是 Anthropic 自 5 月以有史以来最大规模融资($47B ARR)关闭以来发布的产品不完全清单:
6 月:发布 Claude Tag、Sonnet 5 和 Fable 5
6 月:发布 Claude Tag、Sonnet 5 和 Fable 5
7 月:Opus 5、/checkup。ARR 突破 $65B
7 月:Opus 5、/checkup。ARR 突破 $65B
上月:Fable/Mythos 5.1,以及 EFS(即将上市)
IPO 目标 $2T,2026 年底 ARR 预计 $100B
IPO 目标 $2T,2026 年底 ARR 预计 $100B
Cowork/chat 在 <竞品> 之前完成了合并
Cowork/chat 在 <竞品> 之前完成了合并
Dario 认同所有实验室签署的"Pacing the Frontier"信息
Dario 认同所有实验室签署的"Pacing the Frontier"信息
上周:Opus 5.5、Plugins 门户、Cloud Sessions/Claude Projects
上周:Opus 5.5、Plugins 门户、Cloud Sessions/Claude Projects
今天的节目应该能让你跟上进度,嘉宾是 Anthropic 的"解释之王"Thariq Shihipar,我们上次在 Fable 发布日与他交流是在《The Field Guide to Fable》:
[AINews] The Field Guide to Fable
在我们祝贺(节目之友!)General Intuition 的新模型和(节目之友!)俞舜宇的新模型的同时,世界正在等待 GPT-5.6 Sol Ultra 的发布,人们正在竞相探索 Fable 5 的极限,然后——
可变软件的未来
请特别关注 Claude Mods(尤其是速查表):
总体来说,这也与 Thariq 的另一条病毒推文形成对照:
云端大脑,本地双手
不妨试试 Claude Projects:
"双手"这个术语不仅仅是 Frontier 编程智能体公司(如 Cognition)正在构建的本地/云端范式的一个比喻,也与我们即将与 Anthropic 讨论的安全系统讨论特别相关,因为他们正准备以负责任的 AI 部署来"Pace the Frontier"。
对于那些想要我们在节目开头提到的 Thariq 写作技巧的人,可以在这里观看完整视频:
从 Claude Code 的快速崛起到一个智能体可以重写自身 harness、跨团队协作并在云端和本地环境中运行的未来,我们构建软件的方式正在非常快速地变化。在这一集中,Anthropic 的 Thariq Shihipar 与 swyx 和 Vibhu 一起深入探讨:高级用户如今是如何真正使用 Claude Code 的、为什么提示工程仍然是一门高技能学科,以及 Anthropic 认为 agent harness 的下一步发展方向。
我们对 Claude Code 不断演进的接口进行了深入讨论:Ask User Question 与引出、artifacts 作为持久化的生成式接口、Claude Tag 用于多智能体工作流、Projects、模型 effort、实现笔记,以及用于自定义 harness 本身的新 Claude Mods 系统。Thariq 解释了为什么 Claude.md 最终可能会消失、为什么最聪明的模型也可能成为许多任务中最便宜的模型,以及为什么可变软件可能成为一种构建和定制应用程序的新范式。
对话随后转向智能体安全和 Anthropic 的"Pacing the Frontier"论点。Thariq 回顾了最近发生的事件:智能体发现了意想不到的通信方式、利用基础设施漏洞、reverse-engineer 基准评分器,以及将多个漏洞串联起来。我们讨论了沙箱化、提示注入、自主智能体、可解释性、宪法分类器、探测、fallbacks、Auto Mode,以及为什么保护日益强大的智能体可能成为未来几年最重要的工程问题之一。
为什么智能体编程在不到一年内从备受争议变成了默认选项
为什么智能体编程在不到一年内从备受争议变成了默认选项
为什么提示工程仍然是使用 Claude Code 最高杠杆的技能之一
为什么提示工程仍然是使用 Claude Code 最高杠杆的技能之一
专家用户如何构建对 Claude 及其可靠一次性完成任务能力的心理模型
专家用户如何构建对 Claude 及其可靠一次性完成任务能力的心理模型
为什么随着智能体变得越来越强大,发现"未知的未知"变得更加重要
为什么随着智能体变得越来越强大,发现"未知的未知"变得更加重要
Artifacts 作为人与智能体之间持久化的生成式接口
Artifacts 作为人与智能体之间持久化的生成式接口
Claude 如何可能分裂为云端"大脑"、本地或远程"双手"和动态接口
Claude 如何可能分裂为云端"大脑"、本地或远程"双手"和动态接口
Claude Tag、Projects 与多智能体,以及协作式智能体工作流如何发展
Claude Tag、Projects 与多智能体,以及协作式智能体工作流如何发展
为什么在初始提示上投入更多时间可以显著减少智能体浪费的工作
为什么在初始提示上投入更多时间可以显著减少智能体浪费的工作
何时对不同的工程任务使用低、中、高或最大 effort
何时对不同的工程任务使用低、中、高或最大 effort
为什么 Frontier 模型最终可能在智能和 token 效率上都超越更小的模型
为什么 Frontier 模型最终可能在智能和 token 效率上都超越更小的模型
为什么实现笔记可以揭示模型考虑过但选择不做的决策
为什么实现笔记可以揭示模型考虑过但选择不做的决策
为什么 Claude.md 最终可能会消失——以及为什么有时不带它开始反而更好
为什么 Claude.md 最终可能会消失——以及为什么有时不带它开始反而更好
Claude Mods:自定义 Claude Code 的执行循环、UI、子智能体、路由和行为
Claude Mods:自定义 Claude Code 的执行循环、UI、子智能体、路由和行为
模型路由器、分叉智能体和自动改进智能体工作流的监督智能体
模型路由器、分叉智能体和自动改进智能体工作流的监督智能体
为什么 Claude Mods 可能是"可变软件"的早期预览
为什么 Claude Mods 可能是"可变软件"的早期预览
Harness 工程的苦涩教训,以及为什么智能体架构如此快速地过时
Harness 工程的苦涩教训,以及为什么智能体架构如此快速地过时
Claude Tag 如何成为多智能体工作的组织性 harness
Claude Tag 如何成为多智能体工作的组织性 harness
为什么给智能体访问公司数据的权限会创造巨大的新安全面
为什么给智能体访问公司数据的权限会创造巨大的新安全面
Exploit-Bench 事件:智能体发现了通信和协作的方式
Exploit-Bench 事件:智能体发现了通信和协作的方式
为什么智能体入侵 Hugging Face 获取评分器代码而非基准答案
为什么智能体入侵 Hugging Face 获取评分器代码而非基准答案
智能体如何以意想不到的方式串联沙箱和基础设施漏洞
智能体如何以意想不到的方式串联沙箱和基础设施漏洞
为什么日益强大的智能体使传统安全假设越来越难维持
为什么日益强大的智能体使传统安全假设越来越难维持
Anthropic"Pacing the Frontier"提案背后的论点
Anthropic"Pacing the Frontier"提案背后的论点
为什么软件工程师越来越多地在做两份工作:工程和跟上 AI
为什么软件工程师越来越多地在做两份工作:工程和跟上 AI
宪法分类器、探测和 fallbacks,以及可解释性在生产环境中是什么样的
宪法分类器、探测和 fallbacks,以及可解释性在生产环境中是什么样的
Auto Mode 如何检查智能体的行为是否真正匹配用户的权限
Auto Mode 如何检查智能体的行为是否真正匹配用户的权限
为什么 Thariq 能看到严重的 AI 风险,同时仍然有相对较低的 p(doom)
为什么 Thariq 能看到严重的 AI 风险,同时仍然有相对较低的 p(doom)
LinkedIn: https://www.linkedin.com/in/thariqshihipar
LinkedIn: https://www.linkedin.com/in/thariqshihipar
00:00:00 开场介绍
00:04:12 Ask User Question 与智能体接口的未来
00:08:29 Artifacts、Projects 与多智能体
00:15:37 提示工程作为核心 Claude Code 技能
Swyx [00:00:00]:我们和 Anthropic 的朋友 Thariq 来到演播室,我想说,关于 Claude Code,有太多事情——边界越来越模糊,而加入 Anthropic 以来你一直紧跟所有进展。你是最早接触 Claude Code 的人之一,但后来——你在其他播客里讲过这个故事,你也一直在关注 AI 智能体。最近你做了 AIE World Tour 的演讲《Fable 现场指南》,很明显你们发布了 Fable,所以这算是在"作弊"。而且最近你还发布了 Claude Tag,我们还会聊一聊 Pacing the Frontier。Anthropic 现在有太多事情在进行。我想首要的问题是:身处这样一个节奏如此之快的地方,是什么感觉?
Thariq Shihipar [00:00:48]:我觉得吧,有时候真的会有点晕眩。我觉得——我加入 Anthropic,是因为 Claude Code。那时候 Claude Code 刚出来,我觉得,"这太棒了。"Opus 4 对我来说就是,我无法想象它能有多好?那真的是一个转折点。但当时,我试着说服我那些创业的朋友使用智能体编程,他们说,"哦,不,我们的工程师觉得还不够好,"之类的。我当时想,"这也太疯狂了。"然后快进 12 个月,甚至更短,它就成了所有人编程的默认方式,对吧?我想,从——从推销它,到——现在教人们如何——最大化利用它、提高效率,诸如此类——这是一个巨大的——巨大的变化。是的,我觉得,作为一个人类,真的很难跟上所有事情?事情发生得太快了——
Swyx [00:01:51]:那就扔更多 AI 智能体去处理。
Thariq Shihipar [00:01:52]:对,智能体相关的东西比人类相关的东西扩展性好得多,遇到的情况是——哦,现在有三件事同时发生,它们都是紧急情况——你该怎么响应?是的。
Vibhu [00:02:05]:你的时间怎么分配的?你做很多技术写作和工程工作。
Thariq Shihipar [00:02:10]:是的,我觉得——加入 Claude Code 团队的时候,我想教人们怎么用 Claude Code,我觉得——这是我曾经想过可能会花一点时间的事情,或者——我——我一开始在做 agent SDK,我不太确定——关于工具链的苦涩教训会怎么演进,对吧?我想有时候我们会说,"哦,Claude Code 之后是什么?"所以最初我想,我只想教人们怎么用 Claude Code,让 Claude Code 更容易用。但我觉得,随着工具链越来越好——现在最大的问题变成了——你怎么用 AI 智能体,对吧?这真的是一个非常需要技巧表达的事情。所以我主要做这个,然后做工程工作。我做演讲,但我想——做工程工作的时候,我的目标是收集用户的反馈,然后——能够分享——怎么用 Claude Code 做工程。所以这中间有一个很好的循环。是的。
Swyx [00:03:07]:是的。我——听众朋友们,我们会附上你和 Sarah 在 Dev Writers Meetup 做的演讲——
Thariq Shihipar [00:03:13]:哦,对。
Swyx [00:03:13]:我们之前稍微聊过,先做工作,再谈工作。
Thariq Shihipar [00:03:16]:对。
Swyx [00:03:16]:差不多是这个意思。
Thariq Shihipar [00:03:17]:是的。
Swyx [00:03:17]:种瓜得瓜——
Thariq Shihipar [00:03:19]:是的,种瓜得瓜。
Swyx [00:03:21]:差不多。差不多。所以稍微预告一下,我们今天要聊工具链的演进。它已经从单纯的 CLI 走了很长的路。我们还要聊 Claude Mods,它今天开始泄露了,因为你们保密不了。
Thariq Shihipar [00:03:36]:是的,是的。
Swyx [00:03:39]:是的,有很多要聊的。我想你一开始做的是添加 ask user question 工具,人们又爱又恨。
Thariq Shihipar [00:03:48]:是的。
Swyx [00:03:48]:我觉得这非常有创新,然后现在我有我自己的版本。你有你的 Interview Me 版本。
Thariq Shihipar [00:03:55]:是的。
Swyx [00:03:56]:每个人都有自己的版本。而且——现在不在乎这个了,因为现在你应该——写能创建其他提示词和循环的提示词,以及所有这些。
Thariq Shihipar [00:04:05]:好的,是的。
Swyx [00:04:06]:那现在的最新技术是什么?你现在告诉人们怎么做?
Thariq Shihipar [00:04:12]:是的,ask user question 第一次让模型在信息收集上表现很好。我想这是——我希望看看模型能不能做到的一个—— emergent behavior。我有——人机交互的背景,所以我在本科和研究生阶段都做过这个方向。所以这对我来说就是——人机交互——尝试弄清楚——智能体怎么和你沟通并提取需求,对吧?我觉得——随着 Claude Code 越来越普及,有一件困难的事情是——每个人都有自己独特的使用方式,很难改变默认行为。比如说,如果有人让 Claude Code 做一件事——
Thariq Shihipar [00:04:59]:有时候他们只是想让它把活干完,因为他们可能是——很会写提示词的人,有时候他们——不擅长写提示词?而你需要——智能体需要——澄清一下?这是一个很好的分叉点。而 ask user question 工具——就在这个维度上做区分——你觉得你现在的水平足以指导智能体吗,还是智能体需要——能够——提取更多需求,和你更深度协作,真正理解你的偏好?
Thariq Shihipar [00:05:27]:总的来说,我认为几乎所有人都更偏向于后者,也就是说,他们面临更多的模糊性,他们知道的比他们以为自己知道的要少。但这是一个界面设计问题,让这件事变得容易,对吧?所以,如果你正在设计一个问题,或者你正在处理一个问题,像模式(schema)这样的东西,或者调用栈这些东西是非常重要的。设计中的细节很重要。理想情况下,你希望在实际开始实现之前就能弄清楚一些这类难题。这就是为什么他们称之为未知,对吧?所以我认为,在智能体编程中,这永远是一项技能——弄清楚你的未知数。因为即使模型超级智能——它也需要知道你想要什么?而且你有偏好。你需要把这些偏好挖掘出来。所以这就是我正在推动的方向。问题在于,智能体如何与你交互?我认为 HTML 一直是实现这一目标的主要方式。我们最近添加了 artifacts,对吧?artifacts,我觉得我们对如何充分使用它们的解释做得不好。我们有很多属性能力。它们有一个关联的数据库?所以每个 artifact 都可以存储和写入持久数据。它们可以反馈给 Claude?所以,有一件事是人们还没有在做但我在尝试鼓励的,那就是 dashboard artifact 这个概念。让 Claude 长期在一个项目上工作。也许它像是一个看板。它可以将那些看板数据存储在其数据库中。多个 Claude 可以通过 artifact MCP 访问这些数据,而且那个 artifact 也可以与那些 Claude 通信。所以,我们正在为你构建一些原语,让你能通过 artifacts 实现这种生成式界面,这将让你从智能体中获取更丰富的细节。我认为,目前关于智能体的几乎所有问题都是这样的:你以为你想要什么,但你实际上不知道你想要什么,智能体需要很多细节,在循环中与它们协作非常重要。所以 artifacts 是我们在这里尝试演进的方式。但这还有很多工作要做,因为这比选择题复杂得多。在图表、代码片段、模式或任何适合该问题的内容方面,有更多的细节。但 artifacts 是做"询问用户"问题的更接近 AGI 的方式。是的。
Artifacts 作为控制台的界面
Swyx [00:08:15]:关于这些 artifact 的东西,有一件事我不清楚,那就是什么样的反馈应该通过 artifact 输入,什么样的反馈应该通过 Claude、聊天输入?因为更 AGI 的做法是把所有东西都传给 Claude。
Thariq Shihipar [00:08:29]:我认为更 AGI 的做法是通过 artifact 来做。我认为,在极限情况下,我们设想 artifacts 将成为你进入控制台的界面。你可以评论这个实时的——比如你的计划文档,工作文档。你可以看到,也许有多个智能体,不同的智能体在做不同的事情,而那个 artifact 是为你的当前工作构建的,对吧?所以每一个都有稍微不同的——我认为从基础设施的角度来看,我们仍在到达那里的过程中。但是的,我认为,动态界面来控制你的控制台,这可能是事情发展的方向。
Vibhu [00:09:03]:有没有一种版本是从 CLI 或聊天中抽象出来的?因为现在很多事情都是这样,你正在与 Claude Code 交互,你收到了一个 HTML 生成的 mockup。它相当丰富。有图表。Artifacts 是将这些东西连接在一起的方式。为什么不干脆所有事情都这样做?
分离大脑、双手和表面 UI
Thariq Shihipar [00:09:22]:那它就变成了分离——推理发生在哪里?智能发生在哪里?工作发生在哪里?我认为这是本地和云之间的一些区别,对吧?所以,我认为现在如果你使用 Claude Code,它是本地的,你可以启动 Remote Control 来获得一些云行为,或者你可以在云端启动 Claude Code,对吧?我们正在朝着这样一个方向前进:不再是 Claude——你给本地 Claude 发消息,它在本地启动一个会话并执行——而是更像你给一个在云端运行的 Claude 发消息,它可以运行本地或云端会话。这就是 Claude Tag 的工作方式。但随着时间的推移,我们也会添加本地双手。所以本地双手将是该智能体访问你计算机的能力,如果它在线的话,并且能够在那里工作。所以它可以派生出许多不同的子智能体。那些子智能体可以相互通信,这就是 artifact 发挥作用的地方,来展示所有那些工作。所以你可以想象——你正在分离这些东西。所以有一个表面 UI 显示,它是一个 artifact,托管在某个地方,有一个数据库和所有东西。有一个推理智能部分,对吧,那是在云端发生的,你不用担心关闭电脑或其他什么,对吧?然后还有——就像双手。它可以是本地的,它可以在远程沙箱或任何你需要完成工作的地方。那就是——解包现在的 Claude Code 体验,因为现在它都发生在一个地方,对吧?所以。
多人智能体、Claude Tag 和项目
Vibhu [00:11:00]:你如何看待这方面的多人协作?比如说团队想要以这种方式工作。现在它是高度个人化的,但你对多人的未来有什么看法?现在,我想有 Claude Tag,它是一个版本,但是——
Thariq Shihipar [00:11:12]:我们正在推出 Projects。Projects 就是这个抽象,它就像 Claude Tag,但是在我们的 Claude 产品上,对吧?所以你可以给它发消息,它会做类似 Claude Tag 的事情,比如派生子智能体。所以——关于多人协作,我们认为——Claude Tag 有点更原生的多人协作,因为它就在你的 Slack 里,权限之类的东西都已经处理好了。但我确实认为多人协作是故事的一个重要部分,而且那将需要更紧密地联系在一起。你可以想象当你遇到这种情况时它变得有多复杂:哦,你有双手,但现在你有其他人的电脑里的双手,你需要给他们授权,或者你有你的 MCP 和别人的 MCP,你要怎么弄清楚如何使用它们,对吧?它变得相当复杂。Claude Tag 在处理所有这些问题方面做得很好,对吧?所以当你有 Google Docs 时,它如何访问 Google Docs,对吧?它通过共享的 Claude MCP 访问,或者如果它没有访问权限,它也可以通过你的本地凭证访问。但是的,我认为 Claude Tag 是我们的多人协作产品,它对于这些本质上是多人协作的事情真的很有用。比如,值班,例如,事件本质上是多人协作的。你想 tag Claude,你想让多个人登录,你想让它能够——