企业从AI实验转向生产级Agent后,遥测数据量激增推高成本,本文介绍如何通过管道设计控制AI Agent的费用。
当企业从尝试 AI 转向在生产环境中运行自主 Agent 时,一个基础设施问题正在浮现:遥测成本不断攀升。Agent 具有非确定性、迭代性,并能以机器速度生成数据,与传统应用相比,监控难度和成本预测难度都要高得多。
许多公司正在努力厘清和压缩其遥测账单。实际上,根据 Apica 委托、由 Omdia/Informa TechTarget 对 300 多名北美和西欧企业 IT 决策者进行的调查,59% 的组织已经因为监控成本而终止或推迟了 Agentic AI 的部署。
受影响最严重的 Agent 通常部署在某些高风险场景中:网络安全、合规和欺诈检测。当监控账单飙升时,部署并不一定会被工程团队叫停。更常见的情况是,财务部门在踩刹车。
Andi Mann 是 Apica 的首席产品和技术官,他最近在一个大型银行看到了这一幕。该组织无法准确界定其在 AI 项目上的支出。
Mann 告诉 The New Stack:“他们知道自己无法承受按照同样的轨迹继续下去,所以别无选择,只能取消某些 AI 项目。这是我之前就见过的模式,因为 AI 项目正在蚕食传统预算。”
“这是一种我之前就见过的模式,因为 AI 项目正在蚕食传统预算。”
这一影响是巨大的。当人力、资金和监控资源被转移到新的 AI 工作负载上时,业务的其它部分开始受到影响。Mann 说,他正在看到宕机、停机、渗透攻击和 DDoS 防护在争夺相同资源。
问题已经反映在研究中。大多数(54%)企业的遥测量在仅一年就增加了两倍,其中 43% 的增长来自 AI/ML 工作负载——这是迄今为止最大的驱动因素。随着可观测性账单攀升,企业面临解决这场危机的压力。他们报告称,在可观测性上平均花费 317 万美元,且该数字以每年 28% 的速度增长,没有明显的上限。难怪 83% 的企业将 AI 可观测性列为未来一年的首要优先事项。
他们报告称,在可观测性上平均花费 317 万美元,且该数字以每年 28% 的速度增长,没有明显的上限。难怪 83% 的企业将 AI 可观测性列为未来一年的首要优先事项。
即将到来的浪潮可能是灾难性的
对于新的云服务、数据库或应用程序,你会预期监控负担和遥测数据的增长相对可预测。但企业现在预计,在两年内遥测数据将平均增长 9.5 倍。
Mann 说:“想象一下你的信用卡或杂货账单增加了九倍多——这不是一个边际数字。这不是温和的攀升;这是一座摩天大楼,正在引发恐慌。”
“这不是温和的攀升;这是一座摩天大楼,正在引发恐慌。”
约 44% 的企业预计其遥测数据将增加 6 倍到 100 倍。
原因是 Agent 任务不同于单个应用程序请求。一个客户服务任务可能生成一个顶级追踪、若干模型调用、检索操作、工具调用、重试和循环。但如果 Agent 将工作委托给另一个 Agent,就会给追踪添加另一个分支。
每个模型可以产生 token、延迟、成本和提供商数据,而每个工具调用都会生成自己的记录,包括参数、结果、状态和下游活动。像 tool_name、agent_id 和 trace_id 这样的标识符也会产生高基数,使数据更难聚合,索引成本更高,成本在每个阶段都会累积。
这在 AI 雄心与基础设施就绪之间创造了一个令人不安的差距。尽管 35% 的企业声称已广泛部署 Agentic AI,但运营和管理这些系统是非常不同的事情。近三分之二的企业对这一转变只有一定程度的准备。与传统应用不同,Agent 可以调用多个模型和工具、重复任务,或以不可预测的方式扩展工作流程,这使得容量和监控成本都难以预测。
从极端遥测成本到上游控制层
Mann 的答案是尽早干预。“你不能继续将本质上无用的数据发送到昂贵的集中分析或存储平台,因为分析表明一切正常的数据没有意义。”他说。“尽可能早地,让管道使用数据收集器并在源头管理它们。”
传统的可观测性平台是围绕收集数据、摄取数据、存储和索引数据,然后再分析数据而构建的。这种模式适用于人工驱动仪表板查询的工作负载,但 Agentic AI 需要在遥测到达堆栈中最昂贵的部分之前做出决策。
管道优先架构可以对重复的成功事件进行采样,同时保留失败、重试、策略违规和异常慢的追踪。它可以用 Agent、会话、模型、工具、token 和估算成本数据丰富记录,编辑敏感 prompt 和标识符,并根据不同的成本和保留配置文件聚合指标和长期记录到目标位置。
一个精简的指标或采样跨度可能代表一个例行的成功工具调用,而失败的调用则保留其父追踪、错误详情、重试历史和安全上下文。目标是保留解释 Agent 行为所需的信息,同时减少冗余数据并限制被索引的内容。
Agent 还需要毫秒级上下文来支持自主决策。在源头附近处理遥测数据,使组织能够快速检测重试风暴、过度工具循环或异常 token 消耗,而不是等待数据被集中摄取和索引。
如果没有上游控制,企业面临的风险是将碎片化、不必要的遥测数据输入到对每增加一 GB、每个索引和每条保留记录都收费的平台。
将赢家和取消项目区分开来的架构
重新思考遥测管道的回报是显而易见的。拥有遥测管道的企业为 Agentic AI 数据增长做好准备的可能性高出 50%。在成熟的 Agentic AI 组织中,管道采用率是它们与众不同的关键:这些组织避免遭受阻碍同行运营成本挑战的可能性高出 80%。
企业可以将可观测性平台视为全能目的地,也可以在遥测数据到达之前就做出决策。
答案是将智能移到上游。与其将可观测性平台视为全能目的地,企业可以在遥测数据到达之前就做出决策——过滤噪音、丰富重要内容、根据数据的价值和目的进行路由。这意味着更少的数据冲击昂贵的存储和分析系统,而确实通过的信息更有用且能实时获取。
至关重要的是,这并不是要拆除企业已经依赖的可观测性平台。而是在它们前面放置一个更智能的控制层:决定哪些数据值得被摄取、应该去哪里、以及应该花费多少。
现有的可观测性平台仍然扮演着重要角色。“管道不能做所有事情,但可以充当第一响应者。”Mann 说。“你仍然使用大型分析平台,但要省钱、降低风险并提高合规表现。”
Apica 研究发现,例如其管道控制、指标基础和数据就绪服务,与传统可观测性平台相比可以将总拥有成本降低 40%。当然,实际节省取决于遥测量、保留策略、采样规则、路由决策、现有合同以及在摄取之前可以处理的数据比例。
现在重新思考架构的窗口期。68% 的企业计划在未来六个月内评估其可观测性堆栈的变更,而近四分之一的企业表示现有供应商关系在这些决策中不会是一个重要因素。可观测性的下一阶段将由处理 Agentic AI 对基础设施造成的影响的能力来决定。
这意味着管道不能再被视为将遥测从 A 点移动到 B 点的管道。它正在成为日益自主、数据密集型环境的控制层。
建立符合 Agentic 要求的基础设施的组织将能更好地降低可观测性成本并改善风险表现。Mann 不认为平台工程和 SRE 团队有多少选择。“这已经成为一个董事会级别的决策。”他说。“归根结底,这是一个关于你能让你的业务变得多智能的选择。”
下载 Omdia 研究报告:“Agentic AI 遥测危机:你准备好迎接即将到来的事情了吗?”