Addy Osmani 阐述工程师应掌控系统全链路的理念,揭示过度授权的三个隐形成本。
在过去的一年里,围绕AI智能体工程的讨论已经转向了框架、循环、舰队和软件工厂。我的看法是,工程师需要掌控外部循环——对这些系统的问责。随着Fable和GPT-5.6这样强大的模型变得可用,这一点只会愈发真实。
这是我在2026年AI工程师世界博览会闭幕主旨演讲的书面版本。以下是演讲内容:
AI智能体具有杠杆作用,而杠杆作用产生了义务。必须有人能够准确解释发生了什么变化、为什么这是安全的,以及如果他们错了会发生什么。否则,他们的行为无法得到证明。这也使得他们的组织不太可能首先要求他们这样做。
因此,我想讨论三个术语。
第一个,质量(Quality),指的是我们在让系统运行之前安装的所有检查。这些检查会产生证据,从这些证据中我们得出一个判决。
第二个,判决(Verdict),指的是在工作进入我们的依赖系统之前做出的最终决定:我是这个内容的直接生产者。我运营的团队的工作以我的名义发货。模型可能会写出这一行,但判决是我的。我的团队的工作不会在没有我的决定的情况下进入我们的依赖系统。判决是一个生产决定:我们应该发货、阻止、重定向、缩小响应、添加护栏还是直接拒绝?
第三个,可解释性(Answerability),指的是一种保证,即如果有人询问,我可以解释为什么。
换句话说:我们的AI智能体(我将其定义为一个模型加上一套文件、工具、记忆、技能、沙箱、权限、可观测性和恢复机制的框架)是运行我们循环的东西(我将其定义为调查、实现、验证和重复)。它创造了我们的软件工厂。
模型只是引擎。框架——工具、记忆、权限、沙箱、测试——是你在它周围构建的汽车,以便它能够安全地做真实工作。
将该框架包装在一个可重复的循环中:调查、实现、验证、重复。循环是如何将一次好的运行变成可以信任再次运行的过程。在这个循环中,一个独立的检查(而不是模型的自我主张)决定了工作何时完成。
现在同时运行许多循环。一个工厂是大规模的循环——AI智能体在内部运送工作,而人类拥有边界处的决定权。
在该工厂的核心是系统内部和外部之间的一个仔细的边界。
在系统内部:我们收集输入(来自产品团队的意图、或之前发货工作的知识、或最近事件的知识、或来自用户的具体反馈)。AI智能体循环调查任务、实现计划并验证结果。然后,证据越过那个边界。拥有依赖系统的人看到证据并决定是否继续。
朋友们,这就是我们试图做出的转变。以前,我们的AI智能体在执行循环的内部循环中运行。现在它们运行内部执行循环。工程师掌控外部循环。
在系统内部,我们的AI智能体真正做的就一种事情:能力。调查任务、实现计划、测试结果和报告的能力。这是一个模型的能力。正如我们所说,那个未来已经来临。
在系统外部,只有一种东西:代理权。决定、验证、批准和拥有的代理权。
你看,我们仍在讨论代码。它只需要存在于某个地方,并由知道自己在做什么的人来执行。
AI代码的潜力不再是边缘性的。在Sonar 2026的调查中,我们询问团队他们提交中有多少比例是AI辅助的。比例很小,但并非微不足道。一些受访者表示,他们预计AI辅助提交的比例会大幅增长。Sonar 2026年代码现状报告发现,42%的已提交代码是AI生成的或显著AI辅助的,预期该比例将继续增长而不是趋于平稳。
换句话说,创建变得越来越便宜。更稀缺的资源是审查、验证、理解和维护。
我们提高了生成速度,但没有相应地提高控制速度。因此,我们存在一个信任-验证间隙。我们交谈的许多人仍然对AI代码表示某种程度的不信任。然而,似乎很少有人将这种不信任一致地纳入他们的验证过程。
这是一个危险的位置。我们需要更便宜、更清晰的方法来验证AI代码的可信度。
如果你看一下GitLab 2026年6月的报告,你会看到治理问题已经转变。GitLab 2026年6月的AI问责制研究表明,审查和验证是使用AI时的当前瓶颈,更令人担忧的是,治理通常在代码创建后进行,在我们已经接受风险并失去对所有权的控制之后。今天,这不仅仅是关于控制。这是关于我们对系统设置什么约束。这是关于我们如何用证据检查工作,以及我们如何让团队负责。这是关于谁将拥有AI生命周期的哪一部分。
所以这个系列的最后一个区别是过程和质量之间。质量是反压的概念。我们的意思是字面意思。
我们不想给我们的AI智能体尽可能多的自主权。我们想给他们足够的自主权,使我们有足够的反压来停止他们、调节他们、检查他们的工作,并确保我们的人性。
普通工程提供了许多信号,表明正在进行的工作是在做正确的事情。类型检查、测试、钩子、沙箱限制、审计日志、监视器。我们的工程系统充满了这样的信号,它们被设计为提供足够的反压来保持系统的诚实。
因此,只要我们的AI智能体发出这些相同的信号,我们就可以相信我们的普通工程提供适当的反压。
相信我们的系统并不意味着我们不想让人在循环中。这只是意味着人不需要在内部循环中。
我们希望他们在约束循环中(我们应该设置什么输入、架构、指令或不变量?)、采样循环中(我们应该采样和审查多少输出?)、审计循环中(我们应该保留什么证据以及我们如何确保我们的审计日志有效?),以及所有权循环中(我们应该拥有生产边界的哪一部分?)。
但人不需要在内部循环中。
AI智能体可以发货比你能审查的更多。稀缺的资源是你自己的核心人类判断,由日志或测试等质量信号告知。
AI 2026年6月的报告显示,在实验设置中,沿着小时级别时间范围的AI智能体委托本质上已经存在。OpenAI今年在AI智能体和工作未来上的工作是这些想法的一个很好的来源。
因此,当我们的系统开始发货比我们能审查的更多时,我们需要开始思考如何建立这个所有权边界。
这正是可解释性发挥作用的地方。
对于长期的AI智能体,在小时级别时间范围内做出的决定就是决定。并非所有的决定都会被记录。你不能将它们全部追踪回输入令牌。如果你所做的只是相信你得到的输出是当前问题的正确选择,那么你需要花费数百甚至数千个人工小时来重构导致它的决定链就变得不可能了。因此,再一次,可解释性成为必须在我们系统设计核心的东西。
有三个隐藏成本:
认知投降 ~ 盲目接受AI给你的东西。当你将工作委托给AI智能体时,工作本身可能看起来是AI智能体的工作。但这实际上是你的工作。这是你的声誉。这是你的责任。这是你的软件,输出中的缺陷就在于它。这是你的软件,需要更改以反映该输出。因此,AI智能体的输出成为你的答案。随之而来的是所有的问责。沃顿研究在AI正确时是令人放心的。但当它错误时,新闻就不那么好了。当AI错误时,近四分之三的人仍然接受它,并感到比没有AI时更有信心。
认知债务,是指你对如何解决问题的理解与记忆逐渐退化。当你把工作委托给一个 AI 智能体时,也就把所有思考工作都卸载给了它。虽然亲自把一切想清楚需要时间和精力,但要在一个庞大的代码库中把所有问题想透,则需要大量资源,而当你正努力爬升学习曲线时,这些资源往往并不存在。因此,最终得到的产出常常是你凭自身能力无法实现的。AI 智能体规划的时间跨度越长,它生成的代码与你对这些代码的理解之间的差距就越大。这种差距会不断复利,债务会持续累积,而重新爬上学习曲线的成本几乎呈指数级增长。Anthropic 曾进行过一项随机对照试验,研究依赖 AI 编写代码的工程师,是否能像亲自编写代码的工程师一样充分理解代码。结论并不乐观:在理解能力测验中,借助 AI 工作的工程师得分比未借助 AI 的工程师低了 17 个百分点,分别为 50% 和 67%。
然后是编排税——现在启动大量 AI 智能体很容易,但你的认知带宽无法以同样的方式并行扩展。你需要引导 AI 智能体避开最糟糕的行为,对它产出的工作进行分类,识别哪些部分需要你关注;指示它优先处理你最关心的工作;在放任它运行之前,验证你最重要的约束和最危险的假设……
所有这些都需要付出工作,而且无法自动化。
人类判断无可替代。
遗留系统在这方面尤其危险,因为你必须审查的系统行为并不存在于代码中,而存在于那些伤疤里。
如何解决?在架构决策中,把注意力放在第一位。使用 worktree、作用域和证据,降低初始计划与计划执行过程中涌现出来的工作之间的耦合。为解决无法执行的步骤设定时间上限。并且,让软件中的任何变更都必须经过严格的主动授权。
Alpha、衰减与品味:这是塑造不同领域职业发展和表现的三种核心模式。
Alpha 是竞争中表现最出色者所占据的领先部分,也就是你正在走出价值最高的那一步。衰减是所有人通过反复练习和观察他人而习得的既有模式——如果你愿意,也可以称之为平台期。品味则是我们最早感知到 Alpha 中的领先趋势或衰减模式发生变化的能力。它是这样一种判断:在尚无任何证据表明变化正在发生之前,我们便能判断接下来会出现什么。Paul Graham 的观点是,当任何人都能创造任何东西时,选择创造什么就变得更加重要;Mitchell Hashimoto 给出的则是一个可操作的定义:在尚不存在客观指标的地方,做出高质量的定性判断。从现在开始,品味驱动一切:Alpha 的转移就是品味的变化,而衰减之所以消退,是因为我们开始感知到不同的东西。
下一步是什么?让你的品味具备可操作性。怎么做?为它取一个名字,体现你正试图将什么从本能层面转移到意识层面。在批评和示例中反复实践它,并明确说明其背后的理由。
还要不断采取那个能够为你所在行业带来最持久竞争优势的行动。那是什么?不断提升你的能力边界:从仅仅完成任务,提升到教授如何完成任务、将任务系统化、决定任务何时应该完成,并为结果负责。
每个人都可以是开发者,但并非每个人都是工程师。当开发者接受一种更严格的工作纪律时,他们才会成为工程师:进行全面且逻辑严密的推理,考虑约束与权衡,识别风险与暴露面,并承担切实的责任。
未来,人们将不再从事工程中的行政性工作,而会拥抱随着工程要求不断提高而出现的新角色。这些角色将从工艺精神中拆分出来,同时清楚界定每个人的职责。有人负责制作原型,有人负责构建,有人负责清理,有人负责发展,也有人负责维护。
在人类这一侧,人们同样掌握着系统的另一重边界,沿另一个方向提升 Alpha:选择什么值得做,定义应当在什么约束下完成,判断现有证据是否足以支持继续推进,并照料最终结果。无论是一个团队还是一百个团队,这都是只有人类才能守住的边界。
责任将推动工厂规模化。与注意力和品味一样,责任也是让一切得以运转的三组二元关系之一。没有责任,就没有规则;没有对质疑者的回应;没有权衡;没有风险;也没有安全网。如果没有人为某项决策的后果负责,那么高度自主性带来的只能是混乱。
一项优势的半衰期只有一次发布,而个人印记的半衰期却是一整段职业生涯。个人印记意味着你把名字署在工作成果上,并确信自己能够为交付的内容背书。技能为你带来杠杆,责任则将杠杆转化为信任。
只有人能够做出选择。只有人会承受后果。可以要求 AI 智能体在策略范围内安全地选择、路由、合并和升级问题,但它们无法承受后果。
或许,每个代码库都应该附带某种责任契约,明确说明:接受变更时确认理解了哪些检查项,决策依据了哪些证据,谁对这项变更负责,以及变更被阻止后系统处于什么状态。就像:
你的注意力与品味
你的证据、结论与所有权
你的 Alpha、衰减与品味
在典型的 AI 智能体工作流中,高度自主性的艺术,在于知道何时委托、何时检查、何时停止,以及何时为流程的结果负责。自主性阶梯由低到高依次是:标记潜在问题、调查问题、针对问题执行操作、诊断问题、提出解决方案、推荐修复方案,以及解决问题。自主性阶梯上的高级台阶之一是辨别力:发现了问题,判断它不值得修复,然后继续前进。
对于希望实现规模化的工厂而言,遗留系统才是真正的前沿阵地。所有那些聪明的小创新目前可能还显得微不足道,但生产环境的复杂程度完全是另一回事。在构建全新系统时,由于拥有完全控制权,规划并实现充分的背压机制要容易得多。然而,当你要把智能 AI 智能体加入遗留系统时,情况就截然不同了。
遗留系统包含生产环境行为的全部内容、客户对未来的期望、迁移历史、发布与预算周期的持续时长、未明说的假设、边界情况、数据中的怪异现象、运行手册中的操作流程,以及在缺乏照料系统的意愿时不断累积的所有伤疤。
要成为遗留系统的守护者,就必须践行一种持久的工程方式。必须投入工作,将隐性知识转化为显式约束,使其在不同团队之间以及代际更替过程中保持一致;将这些知识正式转化为测试流程和功能规格,并把它们与客观证据关联起来。与此同时,还要通过棘轮效应,将每一次失败转化为更多经验。因为如果系统得不到一如既往的照料,一切都会轰然崩塌。
随着规模扩大,工作会变得更加有趣。因为当其他一切都构建完成后,人们会想要创造新的东西。他们会希望运用在自身技艺中培养出的 Alpha 与品味,设计可以嫁接到软件工厂上的新循环。或者,他们会想要构建全新的系统,将软件工厂的全部知识融入一次优雅、善意且遵循原则的努力之中。他们会想要设计并实现新的证据形式,使其达到新系统所需的验证级别。他们会想要照料那些如今已经复杂到需要专门关注的遗留系统。他们会想要设计并管理新的背压机制。他们会想要设计新的 AI 智能体。他们还会想要构建自主性。
而在此过程中,他们会逐渐认识到,这一切都是真正的工作。这是一件好事。
自动化会制造瓶颈,制造生产过程中值得被负责的瓶颈。因为自动化让我们能够控制工业级规模,但工业级规模也会催生新的瓶颈。瓶颈将从“我们能构建它吗?”转变为“它应该存在吗?我们能为它负责吗?”
我建议的是一个实用的运营模型,用于扩展 AI 智能体工程。有内循环和外循环。内循环是工作完成的地方。循环应设计得尽可能独立。将所有质量保证和验证放在循环内部。一旦你设计并验证了循环本身,剩下要做的唯一事情就是授予自主权——建立一个反压机制来控制循环的运行速率及其操作范围。同时要把人类放在他们应有的位置上,做出关键决策。不要把理解视为一个交接或发布门,而是把它作为人类准备贡献见解的决策点。对于每个最终反馈到生产中、被新团队和工程师使用的工件,都要留下更好的产物。
构建工厂;保持运行;使工作清晰、可验证、有归属。
AI 智能体可以编写代码。但在交付给用户之前,需要有人说明为什么它应该存在、为什么它足够安全可以纳入生产、以及当它出错时会如何处理。
这就是外循环的 AI 智能体工程——这就是当下的工作。
Pangram 已将本文评为 100% 人类撰写:pangram.com/history/ae6caccc-b70f-4336-a019-5c3411516871