系统梳理当前AI Agent的四大能力维度(自主决策、工具调用、多步执行、持久记忆),并按编程专用、调研、工作流自动化、通用操作、多智能体框架等类型对比选型要点。
"AI agent" 从会议演讲中的抽象概念到主流产品功能,其速度几乎超过了该领域任何一个其他术语。ChatGPT 有 agent,Claude 有 agent,你的项目管理工具现在大概也有一个了。但这个词涵盖的范围太广——从简单的工具调用包装器到在循环中运行数小时的完全自主编码系统——如果不加以限定,它几乎毫无意义。
一个经得起推敲的工作定义:AI agent 接收一个目标,将其分解为多个步骤,通过工具(搜索、代码执行、文件访问、API 调用)执行这些步骤,并持续迭代直到目标达成。重点在于循环——agent 不只是响应,它会行动并修正。这个循环就是区分 agent 与传统聊天机器人的能力鸿沟。
现在的空间涵盖了专用的编码 agent、研究 agent、工作流自动化 agent、通用 operator 风格 agent,以及多个 specialist 相互交接工作的多 agent 框架。此处的定价和基准变化非常快,具体的数字很快就会过时——所以本指南聚焦于稳定的东西:架构、自主等级和适用性。
聊天机器人一次处理输入并生成输出。Agent 则运行:
Agent 在这个循环的自主程度上差异很大。有些需要在每一步之前获得人工批准("人在循环中");有些则长时间无人值守运行。在为用例评估 agent 时,自主等级是最重要的维度之一——更高的自主性意味着更强的能力,但也意味着错误累积而无法纠正的风险更大。
编码 agent 在真实执行环境中编写、运行、调试和迭代代码——它们运行代码并修复问题,而不是仅仅建议修复方案。代表:Claude Code、Devin、SWE-agent、OpenHands。自主性从中到高;大多数将删除文件或推送到 main 等高风险操作拦在批准之后。最佳适用:团队有重复的实现工作、bug 修复和测试生成。
研究和信息 agent 从多个来源搜索、综合并产生结构化输出,在它们之间进行推理而不仅仅是检索。代表:Perplexity Deep Research、ChatGPT Deep Research、GitHub Copilot Deep Research。自主性从低到中——搜索、阅读、综合,然后人工审核。最佳适用:文献综述、竞品分析、尽职调查。
工作流自动化 agent 连接到业务工具——Slack、Gmail、Notion、Salesforce——并自动化由事件触发的多步骤工作流。代表:Zapier AI、n8n(配 AI 节点)、Copilot Studio agents。在定义好的规范内具有高自主性。最佳适用:涉及多个应用的重复性流程——线索路由、会议跟进、数据管道维护。
通用 operator 风格 agent 构建在前沿模型之上,以灵活的工具集处理范围广泛的任务——通才而非专才。代表:带工具的 ChatGPT、带 MCP 的 Claude、带 Workspace 扩展的 Gemini。自主性可根据配置而定,通常在影响重大的操作上有门槛。
多 agent 编排框架 在基础设施层面运行:规划 agent 将大型任务分解为子任务并委托给各 specialist——程序员、研究员、写手。代表:LangGraph、AutoGen、CrewAI。原则上具有很高的自主性,但随着复杂度上升可靠性下降。最佳适用:构建 AI 产品的团队,一个模型的上下文无法覆盖整个任务。
Claude Code 是一个终端原生的编码 agent,它读取文件、编写代码、运行 shell 命令并在循环中观察结果。它的优势在于处理非显而易见问题时的推理质量——调试竞态条件、重构模块、根据描述构建功能——真正的推理胜过模式匹配。它通过 MCP 扩展工具访问,如果你正在配置任何 agent 的工具层,值得了解。取舍点:仅 CLI,无 GUI。
ChatGPT 的 agent 能力 有两种形式——工具增强的对话(搜索、代码解释器、文件访问)和用于 UI 导航的 Operator 模式。它的 Deep Research 模式能生成强有力的带引用的长篇报告。弱点:默认情况下跨会话无持久记忆,在复杂多步骤任务上工具调用不如专用编码 agent 可靠。
Perplexity Deep Research 是一个只读的综合 agent——它搜索多个来源、阅读它们并生成带引用的报告。它比手动搜索和阅读更能胜任竞品分析或事实收集,但不会写代码、执行工作流或在生成报告之外采取行动。
Devin 是第一个广受关注的完全自主软件工程 agent,处理定义的实现任务——根据规格书实现功能、修复 bug、写测试——配有 GUI 实时显示其终端、浏览器和编辑器。诚实的警示:在开放式任务上的独立评估显示,结果比早期宣称的可变性更大。它在范围明确、验收标准清晰的任务上表现最佳。
Zapier AI 让非技术用户能够构建 agent,监视触发器(新邮件、表单提交、Slack 消息)并跨数千个已连接应用运行工作流,以对话方式设置。其优势在于集成的广度;其局限性在于一旦配置逻辑就变得僵化,无法通过歧义进行推理。
OpenHands 和 SWE-agent 是开源选项,适用于希望避免 SaaS 定价或不想将代码发送到第三方 API 的团队——代价是设置复杂度和需要自备模型 API。
对于编码 agent,具体可参见详细的编码助手对比;对于驱动这些 agent 的模型,可参见如何选择 AI 模型。
GOAL: [对"完成"的可观测定义]
CONSTRAINTS: [agent 不应该做什么]
RESOURCES: [它拥有的工具和访问权限]
ON FAILURE: [某步骤失败时怎么做——重试、标记还是停止]
错误累积。 Agent 自主运行时间越长,早期的小错误累积得越多——一个在第 2 步误读规格书的编码 agent,到第 20 步可能已经写出了数百行错误的代码。
工具幻觉。 Agent 可能调用错误的工具、误读输出,或在工具静默失败时虚构一个结果——比聊天机器人幻觉文本的后果更严重。
上下文限制。 即使有很大的上下文窗口,长时间的 agent 会话也会降级——随着窗口填满,agent 会重复前面的步骤或失去对先前决策的追踪。
对后果没有固有的判断力。 Agent 不知道删除生产数据库与删除测试文件不同,除非明确告知。对于任何具有实际外部影响的事情,人工监督仍然必不可少。
对于单轮任务——回答一个问题、起草一段文字——聊天机器人更便宜、更快、更可预测。把 agent 留给真正需要多步骤、工具使用或迭代的任务。
Agent 和聊天机器人的核心区别是什么? 聊天机器人以单次交互响应提示。Agent 则运行一个循环——观察、规划、执行、重复——使用工具直到目标达成。Agent 做事情,而不仅仅是描述它们。
哪个 agent 最适合编码任务? Claude Code 和 Devin 是最强的专用选项。Claude Code 在复杂多文件推理上往往胜出;Devin 提供更精致的 GUI 且无需终端。对于较轻量的 IDE 内帮助,编码助手比完整 agent 更适合。
AI agent 用于业务工作流安全吗? 有护栏的情况下是安全的。最佳实践是在影响重大的操作上保持人在循环中——agent 提议,你批准。把完全自主权留给低风险、可逆的任务,并把 agent 的输出当作来自一个能干但会犯错的初级同事的工作。
最初发表于 my-blog.org。