Google Agentic Data Cloud 负责人深度分析 Agent 开发中的 token 消耗成本、基础设施选型以及 AI 优先团队的规模化路径。
在本期节目中,Stack Overflow 平台工程总监 Peter O'Connor 继续与 Andi Gutmans 对话,这次深入探讨的是:当你要同时运行数十乃至数百个 AI 智能体,而不是几个点击按钮的人类时,一切都发生了怎样的变化。Andi 解释了他为什么认为模型本身已不再是瓶颈。在他看来,更难的问题是弄清楚——以最低的成本获得可靠结果,到底需要多少上下文;以及为什么"把 token 用满"根本就是一个错误的目标。他还分享了一个周末原型如何改变了降低新想法风险的计算方式,以及平台工程团队需要构建什么,才能把"AI 智能体"视为一个独立的角色来看待。
分析了为什么成本治理在 AI 智能体规模下更为重要——在那里,一个员工可能负责几十个全天候运行的 AI 智能体。
探讨了 Google"同时爬坡模型与数据"的方法,以及 Andi 为什么对那些声称已经解决上下文问题的供应商持怀疑态度。
探索了平台工程团队需要构建哪些新的工具和可观测性平台,才能把"AI 智能体"作为与开发者、数据科学家和业务用户并列的角色来服务。
以 Andi 给正在攻读计算机科学学位的人的建议收尾:基础仍然重要,AI 智能体 fluency 现已必不可少,而商业判断力可能与前两者同等重要。
在 LinkedIn 上与 Andi Gutmans 互动。
在 LinkedIn 上与 Peter O'Connor 互动。
大家好,欢迎回到《代码领袖》节目。这是 Stack Overflow 播客中的一个环节,我们邀请资深工程领袖一起探讨他们正在做的工作、如何打造优秀的团队,以及当前市场面临的最大挑战。我叫 Eira May,是 Stack Overflow 的 B2B 编辑,今天是我们与 Stack Overflow 平台工程总监 Peter O'Connor 以及 Google AI 智能体数据云负责人 Andi Gutmans 访谈的第二部分。希望大家喜欢他们对话的下半场。
你们讨论了 token 效率,这最近成了一个非常、非常热门的话题。你认为……我同意,我不认为模型还需要变得更好。我认为人们仍在讨论 Opus 4.6,有多惊艳。所以你觉得模型接下来会往哪里走?真的还会有改进吗?你觉得现在更多是在内部进行优化吗?我们会一直使用前沿模型吗?你认为模型行业的下一步是什么?
我觉得,模型肯定会继续变得更好,而且我们看到 DeepMind 出的每一个模型、其他厂商出的模型,都在持续进步。所以我不是说它们不应该变好,也不是说它们不会变好。但我想说的是,对于我们今天试图实现自动化的很多任务而言,我们现有的很多模型实际上已经足够好了。现在,我更多地把这个问题视为一个"整个系统"的问题。这不仅仅关乎模型本身,对吧?是模型、是 harness、是上下文、是个性化。我的思考方式是:你需要的是能以最低成本完成任务的最低复杂度模型。所以这与具体用例高度相关,对吧?在某些用例中,可能只是一个超轻量级的模型。
我是说,像 Gemini 3.5 Flash 就很棒,成本超低,对吧?但也有些场景你会想用 Gemini Pro。所以我认为我们会越来越擅长弄清楚什么时候用什么模型,如何确保我们只把上下文限制在重要的内容上。这样我们实际上需要处理的 token 就更少,而且模型会有更准确的轨迹。所以你的推理循环也会减少,这同样会降低 token 数量。所以我认为很多 prompt 正在转向这个"整个系统"的问题。这就是我认为 Google 非常幸运的地方,因为我们实际上是唯一同时拥有内部模型开发能力和差异化数据平台、且深刻理解信息的超大规模云服务商。这就给了我们与 DeepMind 合作的机会——模型和数据平台一起爬坡,真正思考"以最低成本驱动你所需结果所需的最少上下文"这个问题。
是的,这非常有价值。我想我同意你关于数据如何融入的观点。在我们思考这个问题如何运作时,系统化是一个非常聪明的思想实验。我有一天和一个朋友聊天,我说最近让我担忧的一件事是,当我在这些 harness 中看到人们谈论 AI 智能体和模型越来越好的时候。我一直在想——找不到更好的词——钻头。我想要确保我得到一个模型。这套钻机系统对我很重要。我不需要你只是造一把更好的钻机,让钻头打孔打得更好,但现在钻机还能混合、夹东西、切割木头。如果它们变得太专业化,那就成大问题了。所以我真的很喜欢这种系统化的视角。
当你思考数据和技能以及上下文时,你在说的是"完成任务所需的最少可行上下文",这很好。但你如何衡量这个?你如何处理这样的问题空间——就像,是的,这是你需要的知识范围。为什么?因为这是我全部的了解,但实际上你只需要这些。你在思考如何更好地界定这个问题的边界?
所以这实际上是一个很难的问题。这就是为什么当有些厂商说"好吧,我有这个目录,我在丰富所有这些数据。这会让模型变得更好"时,我会有些怀疑。你实际上需要让模型和知识一起爬坡,而且真的需要有正确级别的 evals,才能真正理解上下文的哪一部分实际上在起作用。因为你是在为 AI 智能体优化,而不是为人类优化。我认为我看到的是很多公司正在用传统方式处理这个问题,就是——哦,我要让人类构建一个经过策划的本体论,这样我的 AI 智能体就会变得更好。但现实是这只是理论,不是实践。所以我们正在用一种我认为更偏向 AI 优先的思路来处理这个问题——我们的客户是 AI 智能体。
我们如何确保 AI 智能体获得正确的结果?这需要在 eval 侧做大量工作,真正理解轨迹,与 DeepMind 这样的模型构建者合作,确保如果有什么需要改变在模型里改变,就改变在模型里。否则,就改变在我们的上下文中。我们把 Google 的所有差异化能力都带到了那里,在丰富层面、在搜索层面。搜索是一件大事——也就是你如何知道哪些上下文实际上重要。大多数供应商不谈这个。我把它列为解决这个问题的至少前三大挑战之一。所以这是一个重大而困难的问题。任何说自己已经完全解决的供应商都不够准确。我们还没有完全解决,但我真的认为我们走在正确的道路上,能够真正优化这些维度。
听到你还没有解决它,我真的非常欣慰,因为我们在内部有自己的 B2B SaaS 产品即将推出,叫 Stack Internal。我们的立场是,上下文问题很困难。我们想做的是让 AI 智能体解决你的很多问题,然后在必要时让人工介入,对吧?因为我们知道 AI 智能体可以成为权威,这会帮助你今天实现业务目标。
听到这个我太高兴了。
是的。顺便说一句,我们已经看到,人类的直觉在什么有帮助这件事上并不总是有效——这就是为什么你需要一种更系统的方法来把它梳理出来。
是的,当然。人类有时会相信一些并非真实的事情,但我们是会犯错的。
我们也会产生幻觉。
是的,我们会。有时候我们真的很擅长这个。如果 token 变得昂贵,我们想让这些上下文窗口恰到好处,我们必须引入所有这些数据,我们必须做 AI 智能体本体论创建和映射,我们如何生成一个理解系统,比如投资回报率?我需要在数据平台上投入多少与确保我的 harness 是正确的、确保我的技能是正确的相比?这件事在你的思考范围内吗?你在考虑这个吗?
是的。我的意思是,这话可能有点王婆卖瓜,但确实有点自卖自夸的意思。我认为这正是我们拥有全栈能力的部分好处所在。我们有 GPU、有模型、有数据平台。所以我们的目标是确保这一切都整合在一起并经过优化,这样客户就能很轻松地获得他们需要的结果。我们也是开放的,所以也会与第三方模型合作。但现实情况是,对大多数企业来说,自己解决这个问题太难了。他们确实需要与相关供应商合作。我认为 Google 在这方面做得很好——与能够整合全栈的供应商合作,然后确保这个栈具有极高的成本效益。对我们来说,非常明确的是,这不仅仅是获得最佳结果,还必须成为行业中成本效益最高的,对吧?因此我们也在持续努力降低成功使用 AI 的成本。我认为我们的客户已经感受到了这一点。
是的。是的。你在这里多次提到成本。成本在各细分市场都很重要吗?我听说过吗?是从 Epic 企业到小企业都是这样,还是你主要在哪里看到了这种需求?
我的意思是,我认为成本现在对每个人都很重要,因为当你考虑人类规模时,人类每天只能点击那么多次按钮。所以你可以或多或少地预测负载和成本。但现实是,当我们达到 AI 智能体规模时,将有 50 个 AI 智能体为你工作。你可能有一些员工每人配有 100 个自己的 AI 智能体。我们在一个企业环境中可能有数百万个 AI 智能体。而 AI 智能体可以 24/7 不间断工作。它们不需要睡觉。它们点击按钮的速度比我们快得多,对吧?因此,如果不真正管理 AI 的使用、AI 智能体的使用,确实存在陷入成本螺旋的风险,你要确切知道这些努力的 ROI 是什么。
当然,你也在与帮助优化性价比曲线的供应商合作,对吧?所以要持续确保不仅仅是模型变得越来越有成本效益,就像我之前说的,而是整个系统,对吧?因为这涉及模型、涉及 Harness、涉及它们调用的工具,通常还有数据平台,对吧,它们调用的工具。你如何确保这些能够以非线性方式扩展?
是的。不,我的首席财务官会完全同意你的观点。预测一直很难。我认为 AI 还背负着另一个我们没有太多讨论的问题,那就是没有人介意花钱如果它有价值,但 AI 似乎比其他工具的成本高得多,这让它处于不利地位。但我采访过的一些人,我问了一些很有意思的问题,比如"嘿,你们用 JIRA 吗?"他们说"是的,我们有 JIRA,有 Confluence。"我说"好吧,你怎么知道你花的钱实际上有 ROI?你得到 ROI 了吗?"他们很多人说不出个所以然,对吧?我不怪他们。嘿,我正在建一栋楼,我需要建一栋楼。无所谓它长什么样。但 AI 已经被贴上了负面标签,所以……
说实话,我认为我们的客户非常聪明,他们不会在不能带来 ROI 的东西上投入大量资金。所以他们绝对在关注 ROI,无论是客户支持,真正思考他们能处理多少工单,能否带来更好的成果?他们如何考虑这方面的人员配置?我们有 Deutsche Telekom 实现网络运营自动化,能够更主动地管理网络并对其进行优化,实现主动维护。所以当我审视我们的客户群时,他们确实非常有意识地采用 AI 和进行投资。至少我所看到的是,客户从 AI 中获得了大量收益,这意味着它不仅仅是额外成本。
他们能够完成更多工作,能够推动营收增长。在某些情况下,他们能够变得更加成本效益。我们大量将其用于 SRE 作为例子,我们正在为客户带来更好的成果或更高的客户满意度。所以我认为我们现在已经到了一个节点,客户让自己对投资负责以确保投资有回报,这就是为什么"token 最大化"这个概念行不通的原因,因为它不关乎有多少 token,而是关乎我是否获得了与之前相比有差异化的成果?我投资获得这些成果的 ROI 是什么?
是的。是的。哦天,真痛。我记得我的学习历程。我记得开始时有 10 到 12 个子 AI 智能体审查规格和任务,然后在实施后再做一遍。我说,如果我做一到两个,效果是一样的。那我为什么要这样做?
我举一个例子。我有一个想法,我觉得我的团队可以看看。我实际上已经有好几年没写生产代码了,你能想象。所以在过去,这可能会是一个漫长的对话。也许我会抽出一个工程师花三四个月构建一个原型。而我刚刚在周末就构建了一个原型,对吧,只是为了向团队展示"嘿,看看这可能达到什么效果,这是可以做到的。"对吧?而且这也会降低风险,因为你可以非常早在前期就排除一些设计风险。
现在我构建的不是生产代码。我们有比我优秀得多的人来确保它是高质量的生产代码。但我认为,即使从实验的角度来看,能够非常快速地查看事物,这对客户来说就是一个巨大的节省。想想那些糟糕的判断失误,你在这种情况下能跳过多少?而不是等上六个月,到那时才发现你走错了路,已经太晚了。所以我认为,即使在寻路阶段,AI 在更早获得这些洞察方面就有巨大的好处。
是的。是的,完全同意。实验成本现在如此便宜。让我们多做一些实验。如果我不给我的平台团队带来一个好问题,我会觉得过意不去。所以我一直在思考平台如何能够更好地支持 AI adoption 并帮助实现这些成果。我想听听你的观点,我一直认为平台化非常像是这样,好吧,内部开发者是我们的产品。内部……说实话,我会把营销当作一个问题。他们都是人。你认为这些公司需要在内部构建哪些工具,以确保那些团队负责人、那些未来的 AI 智能体团队负责人能够成功?在平台世界里有什么新东西?
所以首先,我认为这是一个很好的问题。我认为 AI 智能体是一个我们需要服务的角色。就像我们必须服务业务用户、数据科学家和数据工程师一样。现在有了这个叫 AI 智能体的新角色。当然,那个角色是代表某人工作的,但我认为这非常重要。我认为有多个维度。即使你想想我们为让人类工作所做的事,举个例子,YouTube 跑在 MySQL 上,对吧?然后在某个时刻这无法扩展了。然后 YouTube 构建了一个测试并开源了,那是一种抛弃 MySQL 的方式。但它仍然没有消除一个事实,即人类在如何使用平台方面太容易出错。当 Google 说"你知道吗?让我们构建一个将所有权交给数据系统而不是开发者的数据系统"时,正是那个时候。然后那就是我们构建 Spanner 的时候,对吧?
所以在某种程度上,同样的直觉对 AI 智能体也适用,因为现在我们可以把 Spanner 扔给一个 AI 智能体,如果它需要扩展,它就能工作,因为我们为无限可扩展性构建了这一切,也是为工程师。所以我在这里思考同样的事情,我们如何为这个 AI 智能体时代构建基础设施和最佳实践?所以无论是人类操作员还是编排者以及 AI 智能体,对吧,都有他们需要的平台。所以很多关注点是我提到的信任,对吧?我们需要构建正确的技能来拥有正确的最佳实践,对吧?我们需要确保我们有正确的安全治理模型。我们需要确保操作员也了解成本方面,并确保他们遵循这些。
所以在 AI 智能体和产品层面有一个完整的可观测性建设。因此我认为,我们为人类开发构建的传统赋能工具——虽然不能一一对应——但大体上那些分类是通用的,比如安全治理是一大类,成本是一大类,可用性和规模化也是一大类,对吧?过去我们在这些方面的一些投入可以迁移到这个新世界。而在某些领域我们必须创新,这就是我们正在走的路——确保 AI 智能体作为一个角色能够得到和开发者或数据科学家一样的良好服务,后者是我们今天也需要服务的对象。
是的。我还想说,我们实际上也在服务更多的人。在商业世界里,你服务的对象不再是开发者了。你在服务……现在每个人都可以参与了,我觉得这很棒。不再有门槛,或者说门槛变低了。
是的。顺便说一句,边界模糊的方式和我之前提到 PHP 与 Web 开发的情形一样——突然之间非开发者也在构建 Web 应用了。我认为这里的边界也在模糊,因为当我们在构建数据科学、数据工程相关的智能体体验时,我们会觉得"业务用户也可以用这个。他们实际上不需要了解我们如何获取数据、如何训练模型、如何部署的所有细节。"对。所以现实是,现在跨人类角色的边界也是模糊的,因为你正在进入一个以意图驱动成果的阶段。只要你理解了你的意图和你想要达到的成果,并且你有正确的控制和管理来确保你在正确的道路上取得进展,我们就可以在企业中启用比过去多得多的角色和个人。
目标是要有正确的想法,对吧?我们希望正确的想法能够转化为业务成果。因此它们来自哪里不应该重要。
所以,当我们需要一个工程师的时候,因为他们能更好地编排,好啊。
就像你说的,你把任务交接出去,我们就能完成。所以我认为这是合理的。最后一件事,关于平台的事情,我很想听听你的建议。我一直在思考,我们内部有一个专门的团队负责开发者平台。他们做工具。我从来没有让数据工程师或数据科学家加入那个团队。我想知道,你会建议我开始考虑把这部分也纳入开发者平台层吗?你怎么看?
这是个很好的问题,因为我们也在梳理这种整体体验的路上。但我确实认为,确保你有数据科学家和数据工程师是非常有价值的。你可能不需要很多,因为我认为当我们构建这些智能体体验时,我们真的可以赋能他们。但数据工程很关键,对吧?真的要确保把正确的数据放到正确的位置。它是高质量的,有治理的,已经准备好被激活用于分析和 AI。然后我认为在数据科学方面,虽然我们谈论了很多 AI,但很多事情仍然非常受益于机器学习,比如欺诈检测、预测等等。所以我确实认为这有帮助。同样,我们构建的工具,理论上你可以说业务用户实际上可以在没有数据科学家和数据工程师的情况下成功,但这其实是一个放大问题,对吧?
你有那种判断力吗?他们能够以同样的方式理解如何达到正确的成果吗——就像我发现我的智能体走上错误道路时那样?确保你仍然有那种判断力,以及能够帮助组织达到预期成果的人。所以我认为这是个很好的主意。是的,我会招聘。
好吧,好吧。我得做个好决定。非常感谢。数据科学,你让数据科学或机器学习工程师加入成功的项目,就像是汽油一样,对吧?它只会让项目持续运转,我很喜欢这样。但这需要有意图。你必须能够承诺于它,所以。我想最后我想说的一件事是,如果我要建议一个今天刚入行的初级工程师,或者一个刚在大学、觉得计算机科学是他们想去方向的人,你有什么建议?他们的学习和经验应该瞄准什么,才能为即将到来的世界做好准备?
是啊,是啊。我想大概有两点。一是传统的计算机科学基础仍然非常重要。事实上你看到钟摆在硬件这边回摇了,在这么多年软件为王之后。所以我会说,无论是在数学方面,还是系统架构方面,或者你想到的各个方面,我确实认为那些实际上继续非常重要。所以我认为认识到计算机科学不仅仅是写代码非常重要,它实际上是理解技术如何构建系统的。因此我认为继续拥有这种能力非常重要。第二点,就像我之前提到的,是真正深入了解如何做智能体编码,如何推动智能体成果,对吧,并真正确保你在锻炼那种超能力,因为雇主们将会寻找真正能够产生 10 倍影响力的人。
所以我认为这是基础和的组合,非常重要,因为否则你就会在项目和成果中失去你的判断力。但第二点是确保你真正精通如何使用 AI。然后大概第三点是确保你理解业务问题。我认为我们正在更多地走向一个方向,现在我们可以真正给出一个高级的业务问题,然后让 AI 智能体代表我们去工作。这几乎就像以前很多计算机科学的人去读的第二个学位 MBA 一样。你可以这样想,"嘿,MBA 实际上现在更重要了,对吧?"或者至少是对业务问题非常感兴趣这种概念,因为作为一个个体,你现在有能力比过去对业务产生更大的影响,因为你可以让所有这些 AI 智能体代表你工作。
你又让我在这次访谈中感觉好多了。我强烈提倡这一点。对我来说,我认为广泛的教育很重要。我不会说你必须有人文教育。我认为教育的广度是有价值的。听到你说计算机科学学位仍然重要,我很欣慰。right? 我之所以非常了解 AI 世界,只是因为我有了那些原则,对吧?我不必想,"哦,