企业级 Agent AI 系统的基础设施规划
详述企业部署生产级 Agent 时的系统架构、资源配置和数据访问要求。对实战程序员的指导价值高。
详述企业部署生产级 Agent 时的系统架构、资源配置和数据访问要求。对实战程序员的指导价值高。
对于企业而言,Agentic AI 的前景远不只是一个更好的聊天机器人。它是跨越人员、业务流程、数据和系统,端到端地执行业务任务的软件 Agent。最适合运行 Agent 的平台需要具备适当的 CPU 容量、弹性数据访问、策略感知的工具使用、可观测性、内存管理,以及可预测地规划和扩展 Agent 的能力。
为了更好地理解这些依赖关系,Intel 进行了数千次 Agentic AI 工作负载实验。我们的初步发现为企业领导者提供了五个实用经验:
Agentic AI 远不只是 LLM 推理。它的企业价值取决于完整的系统、任务编排、数据访问、工具执行、延迟管理、治理和可扩展的基础设施。Agent 是一个目标驱动的自动化企业工作流程:它规划多步骤任务,调用工具,读取结果,并在出现故障时重试。因此,企业 Agent 不仅仅是一个推理问题;它们是系统问题。
大多数 Agentic AI 指标都专注于评估使用的 LLM。平台团队还需要了解任务需要多长时间、一个 Agent 群体可以支持多少 Agent、最终用户在执行过程中的体验如何,以及当更多 Agent 同时工作时成本如何变化。
更有用的企业视角应该关注六个指标:
Agent 密度(每个 vCPU 的 Agent 数量)
这些指标一起回答了企业 AI 运维人员关心的问题:系统性能是否符合预期?系统可以支持多少个 Agent?它应该如何扩展以支持更多 Agent?
为了更深入地了解 Agentic AI 工作负载性能,Intel 扩展了 Terminal-Bench,这是一个用于评估 AI Agent 的开源基准测试工具,具有分析、遥测和重放功能。这使得了解 Agent 在 LLM 推理之外花费的时间成为可能。
基准测试扩展使用了 LLM 响应的确定性记录-重放来将 Agent 性能与 LLM 可变性分开。LLM 响应被记录一次,然后在所有运行中以相同的方式重放,减少了运行间的差异,为比较创建了更可靠的基础。
所使用的 Terminal-Bench 任务组合被有意设计得很广泛。它包括编译、测试、数据库操作、布尔逻辑、解释、光线追踪、压缩、线性代数、视频转码和机器学习训练。这种广泛的多样性使得研究结果更加贴近真实的企业环境。
部署 Agentic AI 应该分三个阶段进行:
按 Agent 密度而非 Agent 数量进行规划: 第一条规模调整规则是按可用计算资源对 Agent 数量进行归一化。以每个 vCPU 的 Agent 数量衡量的 Agent 密度是饱和度的主要信号。例如,8-vCPU 系统上的 10 个 Agent 和 16-vCPU 系统上的 20 个 Agent 在密度相同的情况下表现相似。这为架构师提供了一种可移植的方式来比较不同实例大小和处理器代数之间的容量。
正确的密度还取决于业务目标。交互式 Copilot 和面向用户的助手应该倾向于较低的密度,因为响应时间很重要。IT 工作流等批处理工作负载通常可以以更高的密度运行。这为团队提供了一种围绕服务级别目标和总体拥有成本调整 Agent 群体的实用方式。
Agentic AI 需要一种新形式的可观测性: 平均计算(CPU)利用率是 Agentic 工作负载的一个较弱的主要性能监控信号。Agent 经常在等待模型响应和执行短时间的计算密集型工作之间切换。由于这种"突发"模式,即使这些突发创建了队列并减慢了用户体验,平均利用率看起来也可能是可以接受的。任务延迟(P95)是一个更好的主要指标。它显示工作流何时开始等待,甚至在平均任务持续时间明显降低之前。一个实用的操作模式是首先对 P95 延迟进行告警,然后通过查看持续的任务持续时间来确认问题。
默认情况下采用横向扩展: 横向扩展添加更多系统,增加总的 Agent 容量,而纵向扩展为具有更多计算突发的 Agent 向单个系统添加核心或内存。
我们的测试数据表明,横向扩展通常是更好的默认选择。这与 Agent 通常是半独立的且每个 Agent 的突发相对较小的事实相符,它提高了整体性能,支持高可用性,通常降低成本,并使得在平台增长时更容易保持目标的每个 vCPU 的 Agent 数比率。
当 Agent 需要更重的并行计算、共享状态限制分区、内存位置很重要或存在许可证约束时,采用纵向扩展。
考虑业务含义: Agentic AI 将首先在哪里创造业务价值?获得生产级结果的组织正在围绕已经有明确规则和可测量服务级别的工作流包装自动化层:代码创建、回归测试场、工单分类、市场分析和安全审查。
因此,Agentic AI 的理想企业人物不是追求新颖的实验用户;而是必须改进周期时间和生产力、保护服务质量、执行策略并在考虑成本的情况下扩大采用的责任人。
Agentic AI 的价值来自于帮助企业在团队、系统、数据和流程中完成真正的工作。对于企业而言,优先事项不仅仅是更好的模型性能;而是创建一个可靠的环境,其中 AI Agent 可以支持业务工作流、提高生产力、在治理要求范围内运行,并随着采用的增长而扩展。
在实践中,Agentic AI 的成功取决于正确的基础来提供一致的结果、管理成本、保持控制,并自信地从试点阶段过渡到生产阶段。
本内容由 Intel 制作。未由 MIT Technology Review 编辑部撰写。