分析企业级 AI 采用需要从 LLM 转向 Agent 架构设计,讨论可扩展的企业 AI 应用模式和架构思路。
向导在人类历史长河中始终发挥着重要作用。史前文明就已懂得利用太阳和月亮,在广袤陆地与浩瀚海洋上辨别方向。随着时间推移,人们在一次次旅途中绘制出地图,从而更好地规划路线,更快地抵达曾经去过的目的地。几个世纪后,指南针的出现进一步提升了航海者探索未知目的地的准确性。如今,GPS 导航应用则指引着我们的每一段旅程。
在当今的 Agentic AI 世界中,AI Agent 无疑具备推动 AI 规模化落地、重塑各行各业的潜力。然而,要真正释放这种潜力,还需要一种智能向导——Agent logic。它能够提升 Agent 的质量和成本效益,并最终赢得终端用户的信任。
许多研究指出,绝大多数 AI 试点项目都以失败告终;另一些研究则强调,要实现规模化应用,AI 必须深入企业工作流的核心。[1] [2] 为了更好地理解这一现象及上述判断,我们有必要分析企业工作流的特征。这些工作流通常:
考虑到上述特征,Agent 要想有效运行,自然需要更大的模型上下文。当前最先进的前沿 LLM 的确具备这样的上下文能力,但代价是什么?更多的幻觉?更高的 token 消耗?进一步说,我们能否为 LLM 配备一种智能向导——类似 GPS——使 Agentic AI 能够在工作流核心执行任务,从而获得更理想的结果?
为了验证这些假设,我们针对 IBM 产品设计并构建了配备相关 Agent logic 的 Agent,同时充分考虑上述特征。这些产品面向企业关键任务工作负载的软件交付生命周期,解决各阶段领域专家所面临的一些最具挑战性的任务,包括:
在详细分析这些领域之前,我们先定义 Agent logic 的特征。Agent logic 是知识图谱、算法、程序分析库等软件原语。它们运行在 Agentic 层,也就是 Agent harness 内部,能够有意识地引导 LLM 朝企业工作流的方向前进,从而缩小上下文空间。通过这种方式,它们往往能够以更低的成本带来更出色的结果。下面,我们将分析 Agent logic 如何在上述四个领域中实现这些效果。
IBM watsonx Code Assistant for Z(WCA4Z)利用 AI 和自动化技术加速大型机应用的开发与现代化。它配备了用于理解应用的 App Insights Agent,而应用理解正是在 IBM 大型机上运行关键任务工作负载的企业客户最关注的领域之一。
该 Agent 会对整个应用执行深度静态分析,并将预先建立索引的表示存储在一个数据库 schema 中。这个 schema 横跨数百张相互关联、语义复杂的表,使 Agent 能够检索准确、结构化且已经存在的信息,从而提高回答准确率、减少 token 使用量,并最大限度减少与语言模型之间的往返交互。本例使用的语言模型是 Mistral Medium 250B。
将这种方法应用于多个关键任务遗留系统时——规模最大可达 100 万行代码和 1,000 个程序——其应用理解性能略优于仅使用前沿 LLM 的基线方案,而 token 消耗约低 30 倍。
Aster 是 IBM 的专有程序分析及数据预处理、后处理库,用于通过 Agent 生成单元测试、集成测试、API 测试和基于变更的测试。对多个开发者社区的分析表明,与各种开源工具或开发者自行编写的测试相比,Aster 获得了更高的开发者评分。
此外,与同类开源工具相比,Aster 在集成测试的行覆盖率、分支覆盖率和方法覆盖率基准上表现更优;与 zero-shot LLM 和 Coding Agent 相比,它在单元测试上也表现更好。所有测试均基于开源应用完成。
基于这些结果,我们一直在 75 个以上的 IBM CIO Java 应用中以预生产模式运行 Aster。这些应用的规模最大超过 560 个 class、67,000 行代码,使用的模型是 Devstral 24B。迄今为止,稳态结果显示,行覆盖率、分支覆盖率和方法覆盖率提升了 20%~45%。在其中一部分应用上,Aster 的表现优于最先进的 Coding Agent,同时 token 消耗低了一个数量级,最高可降低 15 倍。
之所以能够取得这些结果,是因为程序分析的输出被用于编写 prompt 并让 LLM 聚焦,同时由多个 sub-agent 提升覆盖率、修复运行时错误和编译错误。这种组合能够以显著更低的成本带来更出色的结果。
对于前述第 1、2 类应用相关用例,LLM 上下文被“限制”在应用源代码中;但在已部署基础设施上对应用进行运行时管理时,底层的完整 IT 技术栈也会参与其中。
在这里,我们定义了一个知识图谱(KG)。它涵盖微服务、数据库/中间件服务、MELT 等实体,并结合领域专家内隐的“部落知识”。有了这样的图谱,再将 LLM 限定在局部有界推理范围内处理非确定性结果,系统便可以采用可观测性驱动的方法,缩小横跨 IT 技术栈以及底层应用源代码(如果相关)的上下文空间,用于事故根因分析及其他用例。
借助这种方法以及与 Instana 等效的数据模型,IBM 专有的 Instana “I3” Agent,即 Intelligent Incident Investigation(智能事故调查)Agent [8],在使用 ITBench [9] 衡量时,相比采用 GPT-5.1 的 ReAct Agent,性能最高提升了 4.0 倍。
使用 Gemini 3 Flash 后,ReAct Agent 的性能有所改善,与 I3 Agent 的差距缩小到低 17%,但 token 消耗增加了 1.6 倍。
我们还将这种方法扩展到了源代码领域,构建了用于代码分析和 bug 修复的 Agent:代码分析会利用程序依赖图,bug 修复则利用 inference scaling。这些 Agent 同样在 ITBench 上进行了测试。结果表明,使用 Gemini 2.5 Flash 的源代码分析 Agent 和 bug 修复 Agent 均优于最先进的 Coding Agent:在找到责任微服务方面,性能提升 3.0 倍;在修复 bug 方面,性能提升 1.6 倍;与此同时,token 消耗分别降低了 3.7 倍和 5.9 倍。
这一 multi-agent system 已在 IBM Think 大会上作为新发布的 IBM Concert Platform 的一部分正式公布,用于推动 IT Operations 左移;IBM CIO 也正在内部试点该系统。[10]
企业面临的合规要求日益复杂且碎片化,迫使团队花费大量时间手动创建控制措施、评估和修复计划。由于缺乏集中式知识,修复方案也需要人工编写,这会带来出错和产生安全缺口的风险。
合规工作复杂且包含多个步骤,因此需要多个专业 Agent 按照政策要求协同实现自动化,而不能依赖人工操作或简单的 AI prompt。
我们的 multi-agent system 通过算法将复杂任务拆解为相互协调的步骤,利用自适应规划、动态分解和工作流排序,并结合持续反馈,迭代识别修复措施、扩展评估范围,从而实现合规自动化。
同样以 ITBench 衡量,该系统的性能比采用固定规划策略的上一代 Agent(Claude 4 Sonnet)高出 1.3~2.0 倍。这种方法把合规转变为一个持续接受引导、能够自我纠正的过程,并显著改善了结果,尤其是在复杂场景中,可将成功率从个位数提升至最高 80% 以上(Claude 4 Sonnet)。
这一 multi-agent system 及超过 16,000 条数字化控制映射,已作为 IBM Sovereign Core 的一部分在 IBM Think 大会上发布。它与监控和漂移检测能力集成,可自动生成证据,并确保审计证据始终安全地处于客户控制之下。[12]
上述示例说明了 Agent logic 如何缩小 LLM 上下文,并引导 LLM 以高性能、低成本的方式穿行于工作流核心。此外,我们还将类似方法应用于两个案例研究:一个是在医疗健康领域使用可配置通用 Agent 及其 runtime(CUGA),另一个是与 IBM Global Real Estate 合作开展的物理资产基于状态的维护。
下面的健康保险客户服务案例,以一种紧凑的方式说明了为什么在受监管环境中,Agentic system 的表现优于只使用 LLM 的对话模型。
CUGA(Configurable Generalist Agent,可配置通用 Agent)的政策系统采用 policy-as-code 实现 Agent 治理。这些政策独立于模型 prompt,在 runtime 中强制执行,并且不需要 fine-tuning。
实验表明,这套 Agent 政策系统显著缩小了任务正确性方面的差距。它能够在所有模型家族中强制执行结构化工作流、安全的意图处理、可靠的工具使用以及受控的输出格式。测试模型包括 Claude Opus – 4.5、GPT OSS 120B 和 GPT – 4.1,准确率提升幅度为 15%~26%。
系统通过最小权限披露、明确的合规规则和人工升级路径来实施权限控制。智能操作可以由 Agent 提出,但权限必须通过政策和监督机制来行使。推理可以自主进行,决策权则受到约束。
CUGA 也是 IBM Think 大会上发布的 Sovereign Core 的关键组件。
企业维护系统会收集海量资产数据,却无法有效地将这些数据整合起来。因此,专家不得不手动拼接碎片化的信号,在缺乏统一、基于证据的洞察时做出决策。
我们最近发布的 Maximo Condition Insights Agent [16] 会分析跨越数千项资产和多个地点的大规模资产数据,包括传感器、工单、故障模式和事件分析。它利用结构化证据和验证循环,可靠地识别问题、确定行动优先级,并通过一致且可追溯的洞察为决策提供支持。
我们已经与 IBM Global Real Estate(GRE)在内部试点了该 Agent,使用的模型是 GPT OSS 120B。它将资产分析时间从 15~20 分钟缩短至 15~30 秒,提升幅度达到 97%;资产审查覆盖率则从约 1% 提高到约 30%,覆盖 120 多个站点和 6,000 项物理资产。
根据 AssetOpsBench 的评测结果,Condition Insights Agent 将缺乏依据的陈述减少了 57%,冗余程度降低了 35%,规则遵从性提高了 30%,矛盾率维持在接近于零的水平,token 使用量平均降低了 77%,同时还略微提高了诊断的具体程度。
该 Agent 配备了有向无环图,能够提供结构工程和运营上下文,从而减少朴素 prompt 下缺乏依据的推理。与此同时,能够感知约束的 prompt 显著提升了规则遵从性、减少了冗余并降低了整体 token 消耗,而且不会引入不稳定性。
几个世纪以来,人类一直受益于各种向导,它们简化并改善了我们的生活。随着技术不断演进,我们使用的向导也在持续进化,使我们能够完成更多事情,并进一步缩小这个“地球村”。
如今,Agentic AI 时代已经到来。当我们试图借助规模经济进一步推动社会发展时,也应延续这一趋势,充分利用 Agent logic 简化模型上下文,并以智能方式深入企业工作流的核心。只有这样,才能真正以最优运营成本实现规模化应用。
[1] 《The GenAI Divide: STATE OF AI IN BUSINESS 2025》,MIT 研究。
[2] 《From AI Projects to Profits: How Agentic AI Can Sustain Financial Returns》,IBM IBV 报告。
[3] 《Understand》,IBM Watson Code Assistant for Z,2026 年 2 月 27 日。
[4] R. Pan、R. Krishna、R. Pavuluri 等,《ASTER: Natural and Multi-Language Unit Test Generation with LLMs》,IBM Research,2025 年 4 月 30 日。
[5] R. Pan、R. Pavuluri、R. Huang 等,《SAINT: Service-Level Integration Test Generation with Program Analysis and LLM-Based Agents》,2025 年 11 月 17 日。
[6] S. Jha、R. Arora、Bhavya 等,《Think Locally, Explain Globally: Graph-Guided LLM Investigations via Local Reasoning and Belief Propagation》,2026 年 1 月 25 日。
[7] S. Cui、R. Krishna、S. Jha 等,《Agentic Structured Graph Traversal for Root Cause Analysis of Code-Related Incidents in Cloud Applications》,2025 年 12 月 26 日。
[8] IBM Instana 与 Intelligent Incident Investigation Agent。
[9] S. Jha、R. Arora、Y. Watanabe 等,《ITBench: Evaluating AI Agents across Diverse Real-World IT Automation Tasks》,2025 年 2 月 7 日。
[10] IBM Concert Platform。
[11] Y. Watanabe、T. Yanagawa、H. Kitahara、A. Sailer,《IT Compliance Automation with GenAI CISO Assessment Agent》,DZone Tutorial,2025 年 12 月 12 日。
[12] IBM Sovereign Core。
[13] S. Shlomov、A. Oved、S. Marreed 等,《From Benchmarks to Business Impact: Deploying IBM Generalist Agent in Enterprise Production》,2025 年 12 月 9 日。
[14] D. Patel、S. Lin、J. Rayfield 等,《AssetOpsBench: Benchmarking AI Agents for Task Automation in Industrial Asset Operations and Maintenance》,2025 年 6 月 4 日。
[15] Fearghal O'Donncha、Nianjun Zhou、Natalia Martinez 等,《Evidence-Driven Reasoning for Industrial Maintenance Using Heterogeneous Data》。
[16] IBM Maximo 与 Condition Insights Agent。
《Model Routing 很简单,直到它不再简单》
《ScarfBench:企业 Java Framework 迁移中的 AI Agent 基准测试》
· 注册或登录后发表评论