深度分析 LLM 迭代到 Agent 系统的发展路径与核心设计问题。为 Agent 开发者提供系统性的思路参考。
被 LLM、RAG 和 AI Agent 搞得困惑?我们用一个常见的简历筛选示例,分解 AI 系统设计的整个谱系,展示每个层级的能力跃升(及复杂性)。
AI Agent 是热门话题,但并非每个 AI 系统都需要 Agent。
虽然 Agent 承诺自主性和决策能力,但对许多现实应用来说,更简单且成本更低的方案往往更胜任。关键在于为当前问题选择恰当的架构。
本文将探讨大语言模型(LLM)的最新发展,并讨论 AI 系统的核心概念。
我们在各种复杂度的项目中使用过 LLM,从零样本提示到思维链推理,从基于 RAG 的架构到复杂的工作流和自主 Agent。
这是一个新兴领域,术语在演进。不同概念之间的边界仍在被定义,分类也在不断调整。随着领域发展,新的框架和实践不断涌现,以构建更可靠的 AI 系统。
为了演示这些不同的系统,我们将通过一个熟悉的用例——简历筛选应用——来揭示每个层级意想不到的能力飞跃(及复杂性)。
纯 LLM 本质上是互联网的有损压缩,是其训练数据中知识的快照。它擅长涉及这些存储知识的任务:总结小说、撰写关于全球变暖的文章、向 5 岁小孩解释相对论,或创作俳句。
然而,没有额外能力,LLM 无法提供实时信息,如纽约市当前的温度。这将纯 LLM 与 ChatGPT 这类聊天应用区分开来,后者用实时搜索和额外工具增强了核心 LLM。
不过,并非所有增强都需要外部语境。有几种提示技术,包括上下文学习和少样本学习,可以帮助 LLM 无需上下文检索即可处理特定问题。
要检查简历是否符合职位描述,可以使用带有单样本提示和上下文学习的 LLM,将其分类为"通过"或"未通过"。
检索方法通过提供相关语境来增强 LLM,使其更加即时、精准和实用。你可以授予 LLM 访问内部数据的权限,用于处理和操作。这些语境让 LLM 能提取信息、生成摘要和创建回复。RAG 也可以通过最新的数据检索纳入实时信息。
简历筛选应用可以通过检索内部公司数据(如工程手册、政策和过往简历)来改进,以丰富语境并做出更好的分类决策。
检索通常使用向量化、向量数据库和语义搜索等工具。
LLM 可以通过遵循定义明确的路径来自动化业务流程。它们最适合一致、结构良好的任务。
工具使用支持工作流自动化。通过连接到 API(无论是计算器、日历、邮件服务还是搜索引擎),LLM 可以利用可靠的外部工具,而不是依赖其内部的非确定性能力。
一个 AI 工作流可以连接到招聘门户以获取简历和职位描述 → 根据经验、教育和技能评估资格 → 发送适当的电子邮件回复(拒绝或面试邀请)。
对于这个简历扫描工作流,LLM 需要访问数据库、邮件 API 和日历 API。它遵循预定义的步骤来自动化该流程。
AI Agent 是能够独立推理和决策的系统。它们将任务分解为步骤,根据需要使用外部工具,评估结果,并确定后续行动:是存储结果、请求人工输入还是进行下一步。
这表示工具使用和 AI 工作流之上的另一层抽象,实现了规划和决策的自动化。
虽然 AI 工作流需要明确的用户触发(如点击按钮)并遵循编程定义的路径,但 AI Agent 可以独立启动工作流,并动态确定它们的序列和组合。
一个 AI Agent 可以管理整个招聘流程,包括解析简历、通过聊天或邮件协调可用性、安排面试和处理日程变更。
这个综合任务要求 LLM 访问数据库、邮件和日历 API,以及聊天和通知系统。
从简单、可组合的模式开始,根据需要增加复杂性。对某些系统来说,仅检索就足够了。在我们的简历筛选示例中,当标准和行动明确时,直接的工作流效果很好。只有在需要更多自主性以减少人工干预时,才考虑采用 Agent 方法。
LLM 的非确定性本质使构建依赖系统变得具有挑战性。虽然创建概念验证很快,但扩展到生产往往会暴露复杂问题。先在沙箱环境中开始,实施一致的测试方法,并为可靠性建立防护栏。
作为 CodeLink 的 CTO,KA 通过好奇心驱动的领导力培养创新和个人发展。他擅长建立和领导工程团队,鼓励持续学习和发展。目前,KA 正在开发机器学习模型以应对实际挑战,旨在创造有社会影响的解决方案。他的领导营造了一个充满尊重和协作的积极团队环境。