指出多数所谓 Agent 不过是模型调用的包装。真正的 Agentic 需具备四大特征:目标导向、工具调用、自我评估和长期记忆,并分析了每个环节的典型失效模式。
大多数作为 Agent 推出的产品,不过是在模型调用外面包了一层更漂亮的壳。这不是对产品的批评,而是一个定义问题——而这个定义之所以重要,是因为让系统真正具备 Agent 能力的四个要素,同时也是它最容易出问题的四个地方。
标准的语言模型调用是无状态的、一次性的。你发送一个提示词,得到一个响应,交互就结束了。模型不会决定接下来发生什么,也不会评估自己的答案是否足够好。这两件事都由你来做,或者由你的应用来做。
Agent 反转了这种关系。同一个模型置身于一个控制循环中:输入一个目标,模型选择一个动作,工具执行,模型读取结果,调整计划,然后继续,直到目标达成或者它得出结论认为无法到达。模型本身没有任何变化。循环本身就是整个产品。
这就是为什么换用一个更强的模型很少能解决一个表现不佳的 Agent。问题几乎从来不在生成这一步。
有四个要素区分了一个 Agent 系统和普通调用,值得你诚实地对照自己的系统进行检查。
Goal directedness(目标导向)。它接收的是一个目标——部署这个修复、研究这些竞品、解决这张工单——而不是一个需要回答的问题。
Tool use(工具使用)。它能够执行超越生成文本的操作:调用 API、查询数据库、读取文件、运行代码、发送消息。
Planning autonomy(规划自主性)。它自己决定步骤的顺序,而不是由开发者预先规定每一个步骤。
Self correction(自我修正)。它评估自己的输出,当发现某一步失败或返回结果不完整时,会注意到这一点并以不同的方式重试。
并非每个系统都需要在这四个要素上都达到高强度。一个四个都不具备的系统只是模型调用。具备前三个但没有第四个的系统是生产环境中最常见的形态,而且是最昂贵的形态,因为它会自信地失败,而循环中没有任何东西注意到。
第一个断裂点是记忆层。一个无法回忆自己已经尝试过什么的 Agent,会在下次运行时重新推导同样的失败计划,而你为此付了两次钱。更长的上下文窗口解决不了这个问题,只是把遗忘移到了缓冲区中间——而那里恰好是检索准确率最差的位置。
第二个是成功信号。把一项工作交给 Agent,只有当这项工作有明确的成功定义时才是划算的交易。排名审计、定时报告和工单分类有这样的定义。定位和战略则没有,而给 Agent 分配这些任务产出的输出,团队里没有任何人能评估。
第三个是成本形态。一个无法判断何时完成的循环会一直运行下去,而账单随迭代次数而非请求次数增长。大多数团队是在第一个月之后才发现这一点,而不是之前。
如果你想要更详细的版本——循环、核心模式、记忆层以及生产环境的实际成本——可以阅读 Agentic AI: How Autonomous AI Systems Work。
简短的结论:Agent 不是更聪明的提示词,而是一个带有记忆和停止条件的循环。把这两件事做对了,你选择的模型就远没有你想象的那么重要。