AT&T 通过模型路由将 AI 编程任务成本降低 56%,质量仅下降 2%;计划未来 60-70% 查询由开源模型承担,对企业 AI 成本控制有参考意义。
AT&T 通过弃用 ChatGPT 将 AI 支出削减了 56%。据 PYMNTS 报道。信号已收到:企业 AI 那种对顶级模型不计代价投入的时代已经结束,而"兼顾成本与效益"的 AI 堆栈蓝图并非来自硅谷实验室,而是来自这家电信巨头的内部运营团队。
这份报道中最重要的数字不是 56% 的削减幅度,而是 2% 的性能质量下降。这个数字给企业采购者提供了一个强有力的新基准:"够用就好"现在是一个可量化、可接受的战略权衡。
AT&T 副总裁 Mark Austin 的内部指令很明确:通过积极将工作转移到更便宜的替代方案,保持对 premium Anthropic 和 OpenAI 模型的支出持平。公司计划在未来几年将开源模型支撑的员工查询比例从目前的 40% 提升至 60% 至 70%。对于那些眼睁睁看着智能体和按 token 计费把预算撑爆的公司来说,这一转变意味着可以理直气壮地把经济效益置于面子之上。
开源模型的能力总体上一直比前沿模型落后六到十个月,但差距正在缩小,而且开源模型"与旧版 Anthropic 和 OpenAI 模型相比毫不逊色,甚至更好"。
这是核心论据。Austin 的声明承认了前沿模型的技术领先,但认为这对许多企业任务而言不那么重要。含义很直接:如果你的业务流程能接受一个落后前沿六个月但便宜超过一半的模型,那从根本上就把购买决策从"哪个模型最好?"重构为"哪个模型在这个价位上最适合这项工作?"对于想要管控 AI 成本的财务团队来说,这提供了一种具体策略来终结 PYMNTS 所称的"token 最大化"时代——即对模型使用不加约束的时代,正如我们在之前关于财务团队不再对 AI 成本蒙眼飞行的报道中所述。
这一战术切换由模型路由器实现,比如 AT&T 部署的 LiteLLM 工具。可以把它们想象成 AI prompts 的空中交通管制系统。它们分析传入的员工查询,评估其复杂度,然后决定能够处理该任务的最具成本效益的模型。一个简单的代码调试请求可能会被路由到 Meta 的 Llama 或 Google 的 Gemma 模型,而不是 premium Claude 或 GPT 实例。
以下是实际工作流程:
第一步:员工向内部 AI 网关提交一个 prompt。第二步:路由器分析 prompt 的意图和可能的计算需求。第三步:它将任务匹配到预定义的策略:如果任务复杂度低且量大,就发送到开源模型;如果是高风险或高度复杂的任务,就发送到付费的前沿模型。
这个软件不只是挑选模型。它在成千上万次日常查询中执行成本-性能策略。AT&T 将开源使用率提升至 70% 的内部目标,将完全取决于这些路由器在任务分类上变得更加智能。风险很小——就是报告中所提到的 2% 性能下降——但经济收益巨大。对于工程师来说,工作从调优单个模型转变为编排一组模型。
AT&T 的举动是对开源权重模型商业可行性的重大背书。公司点名了 Meta 的 Llama、Google 的 Gemma 和 Nvidia 的 Nemotron。通过声明这些模型正在被评估用于其 60-70% 的工作负载,AT&T 提供了一个其他风险厌恶型企业可以追随的可信、大规模使用案例。它让"开源优先"的方法在高容量、非关键任务上合法化。
关键的是,AT&T 在评估风险的同时避开了中国公司 DeepSeek 和 Moonshot 的模型。这是一个鲜明的提醒:AI 供应链正在变得和半导体行业一样政治化。模型路由器不仅仅是成本工具;它还是合规和安全层,确保敏感的 网络和客户数据不会流向受制裁或地缘政治敏感模型提供商。这创造了一个双轨市场:西方企业级开源模型与其他可能更便宜但风险更高的选项。
如果 AT&T 的策略成为一种蓝图,前沿 AI 实验室的商业模式将面临新的、现实的挑战。它们 premium 定价的理由是清晰可辨的性能差距。但如果大多数企业 AI 工作可以由落后六个月且便宜得多的模型"足够好地"完成,竞争格局就变了。
这不会消除对前沿模型的需求。但会彻底改变需求结构。Anthropic 和 OpenAI 变成专科医生,只服务于一小部分高风险、高创新任务,而开源模型处理大部分运营工作。这可能迫使重新思考定价层级,或者推动这些实验室提供自己的"轻量"或专业低成本模型来竞争。这一策略呼应了我们之前报道中看到的向更专业、更具成本效益 AI 基础设施转型的趋势——当时 Groq 在转型后将估值减半,反映了市场对价值的全面重新校准。
AT&T 的举动为任何正在内部扩展 AI 的公司提供了一份清晰的行动清单。
首先,审计你的查询。按复杂度、敏感度和容量对查询进行分类。你的工作负载中有多少是真正"高级"的工作?
其次,开始运行并行基准测试。用前沿模型和开源模型(如 Llama 3 或 Gemma 2)测试你的常见查询,以衡量真实的性能差异。如果 80% 任务的差异可以忽略,经济案例不言自明。
第三,探索路由中间件。LiteLLM 等供应商将成为一个新的关键软件类别。新的锁定风险不是你的模型提供商,而是你的模型路由器平台。
XOOMAR 的分析?AT&T 的 56% 削减只是开始。真正的信号是企业 AI 正在从单一订阅模式重新架构为动态的多模型编排。未来六个月将看到中间件初创公司的涌入、内部成本治理团队的增加,以及更多 CFO 追问:"这件事我们真的需要最贵的模型吗?"第一次,他们将有了一个经过验证、有数据支撑的答案:"大概不需要。"
为 CFO 提供了一个具体蓝图,通过优先考虑"够用就好"的性能而非尖端模型来控制 AI 支出。
发出行业重大转变的信号:企业 AI 采纳将由成本效率而非声誉或顶级能力驱动。
给企业采购者提供了量化依据(56% 成本节省 vs. 2% 性能下降),来压低 premium AI 模型的定价。
最初发表于 XOOMAR。更多新闻和分析,请访问 XOOMAR。