区分真正的Agent与普通聊天机器人,阐述Agentic AI四个支柱:规划(任务分解)、工具使用、记忆和适应性,以及LLM在其中的定位。
"AI agent"是 2025 年被滥用最严重的词。半数被称为 agent 的东西,不过是一层 prompt 套了件外套罢了。以下是真正区分 agent 与聊天机器人的要素。
这个词已经被拉伸到无所不包,因此也便一无所有。但在喧嚣之下,确实存在一个真实有用的区分——如果你在用 LLM 构建应用,值得把概念理清楚。
一次普通的 LLM 调用是条件反射:输入文本,输出文本,不记得上一轮对话,无法对世界施加影响。问完,答完,结束。
Agent 则将这种条件反射包装在一个循环中,并赋予它各种能力。标志性动作是:agent 不会仅仅回应——它会决定下一步做什么,执行它,观察结果,然后重复直到目标达成。它能将任务拆解成步骤,使用工具,具备记忆能力,并能根据发生的情况调整行为。LLM 变成了一个更大系统的推理核心,而非整个系统本身。
拆解开来,"agentic"行为建立在四根支柱之上:
规划(Planning)。给定一个目标,agent 会将它分解为有序步骤,而非试图一步到位。"研究一下然后写个摘要"会变成:搜索、阅读、提取、综合、写作。拆解能力使得 agent 能处理超出单个 prompt 容量范围的任务。
工具使用(Tool use)。agent 可以调用函数——搜索网页、运行代码、查询数据库、请求 API。这是从事"说"到"做"的桥梁。通常通过 structured/function calling 实现:模型输出一个结构化请求,你的系统执行它,结果返回到循环中。
记忆(Memory)。上下文窗口会遗忘。一个真正的 agent 需要短期记忆(本次会话中发生了什么)和长期记忆(跨会话学到的东西),通常由真实的数据存储支撑。没有记忆,每次交互都从零开始。
编排(Orchestration)。需要有某个东西在正确的时机将每个请求路由到正确的能力,组装上下文,并判断目标何时达成。这个协调器才是真正的"大脑",也是大部分工程所在之处。
构建 agent 的 naive 方式是用一个巨大的 prompt 试图完成一切。这不可扩展——一个行为要测试、调试或改进,必然会干扰到其他行为。
经得起考验的方式是组合:构建专注、单一职责的组件——规划器、记忆管理器、检索引擎、工具路由器、安全检查——并由一个核心来编排它们。每个部件都可以独立测试和替换。这不过是将良好的系统设计应用到 AI 上,也是我构建的大多数 AI 系统的理念。
一个能够行动的 agent 也是一个能够错误行动的 agent——调用错误的工具、死循环、采取破坏性步骤。真正的 agentic 系统需要护栏:有限循环、对后果性行动的权限检查、输出验证。能力和安全必须同步增长,否则整个系统就是个隐患。
我构建的 agent 明确地作为一组可组合的引擎,而非一个 prompt。在"Saturday MK1: an AI assistant that's a system, not a prompt"中,一个中央核心将每个请求路由到它所需的引擎——一个将目标分解的战略规划器、一个用于检索的知识库、一个记忆编排器、一个推理路由器,外加安全和威胁引擎。上述每根支柱都表现为各自独立、可测试的命名子系统。
Agent 不是更聪明的聊天机器人。它是一种架构——围绕推理核心的规划、工具、记忆和编排。把架构做对,智能才有立足之地。更多关于我如何构建它的内容见 www.divyakush.com。
Divyakush Punjabi · Full-Stack & AI Engineer Portfolio · GitHub · LinkedIn