AI 工作流不是单一超级 Agent,也不是随机 Agent 蜂群,而应采用层级分明、权责清晰的「小 AI 组织」结构,顶层必须由人类承担最终责任。
AI 在工作中的有用未来不太可能是一个单一的自主超级智能体。也不会是一群可互换的模型,同时都在写代码或调用工具。这两种图景都跳过了最困难的部分:责任。
更有意思的模式是一个小型 AI 组织。它有层级、有受限的权限、有明确的交接流程,且有一位仍然承担后果的人类。这并没有让系统变得不那么有雄心。它让这种雄心变得足够清晰、可以运作。
公司类比在某种程度上是有用的。一个好的组织会分工、给人员明确的授权,并在冒险决策前要求证据。AI 系统需要同样的纪律。但模型不是员工。它们不具备判断力、法律责任、预算或声誉。这个类比是用于结构设计的,而不是用于转移责任的。
舰队需要层级,而不是人群
顶层是人类:设定优先级、接受风险、批准公开或生产环境的变更,以及决定什么值得做。在其下方,一个 AI 负责人可以拥有一个边界明确的工作项:将结果转化为计划、分拆机械性工作、整合结果,并拒绝不符合验收标准的证据。
工作者不会收到"让系统变得更好"这样的指令。他们收到的是一个数据包:一个具体的问题或模块、允许的环境、预期的输出、一个预算和一个停止条件。工作者报告是决策的输入,而不是决策正确的证明。
Human: priority, budget, risk acceptance, public/production authority
└─ AI lead: owns one work item and final integration
├─ evidence worker: read and compare
├─ implementation worker: change an isolated scope and test it
├─ test lead: map acceptance to PASS / FAIL / UNKNOWN
└─ independent reviewer: challenge architecture or release evidence
目的不是仪式性的层级制度。而是为了避免两种昂贵的混淆形式:多个会话修改同一个东西,以及没有人明确负责判定某件事已经完成。
所有权是一份记录,而不是聊天消息
多智能体工作有一个平淡的分布式系统问题:两个有能力的工作者可能基于对同一任务的不同理解而行动。一条写着"我已经处理了"的消息是不够的。一个工单标签对规划有用,但它可能偏离现实。
对于活跃的工作,我需要一个持久的、原子化的声明。它标识当前工作项的所有者,并且可以被每个参与者观察到。它区别于状态更新,也区别于一般的待办列表。
一个旧的声明是检查状态的理由,而不是允许计时器自动将工作转交给其他人的许可。原始所有者可能正在等待测试、审批或故意的上下文交接。接替者需要一个明确的转移、一个新所有者、和一个新的数据包。这个小小的停顿避免了同一工作出现两个合理但不兼容的版本。
三种 AI,三种不同的权限
把每个模型都称为智能体是很诱人的。但这掩盖了一个重要的区别:规划、测量和在世界范围内行动并不是同一种能力。
ML 通常是安静的中间层。一个视觉模型可以识别一个物体;分类器可以给文档打分;预测模型可以估计一个范围。这些输出是带有误差范围的测量结果,而不是小管理者。认知智能体可能会把它们放入上下文中,但不应该把概率伪装成决策。
物理 AI 再次改变了 stakes。一个机器人、车辆、工业控制器或其他执行器会影响物理环境,在那里一个错误的命令可能会耗费时间、材料、金钱或安全。组织模式仍然有帮助,但控制必须变得更强大:受限命令、传感器反馈、可审计性、确定性联锁,以及在影响重大时需要人类批准。
权限应该存在于工具 harness 中
"只读"不是一种性格特征。它是一个技术属性。
一个研究工作者在只访问一个小型的本地数据包时就可以有用:源文件、测试输出和文档。它可以定位一个契约、比较两个定义、并识别一个缺失的断言。它不需要 shell 访问权限、写访问权限、网络工具、与人员通信的权利、或产生无界限的更多智能体链的能力。
这个边界比 prompt 中的礼貌指令更好。它减少了工作者可能意外改变的东西,并使其证据更容易解释。这不是在声称完美安全;而是一种缩小爆炸半径并使违规行为可见的方法。
证据需要一个容纳不确定性的地方
流畅的 prose 是决断性智能体报告的错误接口。每个实质性声明都应该可以追溯到一个源路径和行号、一个测试命令、或一个运行标识符。最终的裁决应该是明确的:PASS、FAIL 或 UNKNOWN。
UNKNOWN 尤其有价值。它意味着证据缺失、过时、与错误的修订版本关联、或确实含糊不清。它防止系统因为摘要听起来自信就把缺乏证据变成绿灯。
部署后稳定的检查应该是脚本、测试套件和具有已知语义的监控。AI 智能体可以将这些 artifacts 连接回验收标准。它不应该在生产系统上不断重试直到答案变得方便。
容量是治理的一部分
在接受另一个可写的工作流之前,负责人需要知道可用的容量、重置时间线、以及审查返回结果所需的整合储备。如果这些不匹配,正确的行动可能是缩小范围或收集只读证据,使下一次实现成本更低。切换提供商或模型名称不会自动创建一个独立的工程组织。
实用的未来是分层的杠杆
超越当今聊天界面的有趣一步不是无约束的自主性。它是一个分层系统,其中语言模型帮助计划和协调、ML 模型提供狭窄的测量、物理系统只被赋予其后果所证明合理的权限。
人类仍然对重要的决策负责。AI 组织并不取代这种责任。它使其下的工作更容易观察:谁拥有它、存在什么证据、系统被允许做什么、以及它必须在哪里停止。