汇总AI Agent从实验到生产的关键最佳实践,对正在部署AI系统的工程师有高参考价值。
"客户看着微软的 Copilot 想,'哦天哪,Clippy 2.0 来了!'" – Salesforce CEO Marc Benioff
"Copilot?把它想象成健身房历练十年后的 Clippy。" – 微软 CEO Satya Nadella
如果你不知道 Clippy 是什么(或者更幸运地从未遇见过它),那算你走运。这款 1996 年引入微软 Office 的臭名昭著的数字回形针,会向用户提供不请自来的建议,瞬间成为全球最被讨厌的虚拟助手。那我们为什么要翻出这个 1996 年被人吐槽、最终在 2007 年关闭的虚拟助手呢?因为历史不会重演,但经常压韵。
随着 AI 智能体热潮的兴起(以及 Gartner 预测超 40% 的基于智能体的 AI 项目会在 2027 年前被放弃),我们问自己:大型企业在生产环境中部署 AI 智能体需要什么?怎样才能让 AI 智能体和 Copilot 真正被员工喜爱和使用(不像臭名昭著的 Clippy)?
为此,我们调研了欧洲 30 多位顶级 AI 智能体创业公司创始人,采访了 40 多位从业者,不仅构建了 AI 智能体现状的全景,还基于成功的 AI 智能体创业公司的通用实践创建了一份操作手册。我们也会分享来自调查的原始、无保留的评论。以下是我们学到的一些要点:
AI 智能体创始人在生产环境中部署 AI 智能体时遇到的最大挑战实际上不是技术问题,而是:
工作流集成和人-智能体界面(60% 的创业公司)
员工抵触和其他非技术因素(50%)
数据隐私和安全(50%)
因此,最成功的部署策略采用"小步快走"方法,从低风险但中等影响、易于验证的任务开始,快速展示明确的投资回报率。如果是在自动化员工讨厌的任务,并将其定位为增强(而非替代)人类的辅助工具,效果会更好。
显著的 62% 的 AI 智能体创业公司已经从业务部门或核心预算中获取资金,证明这项技术正在超越实验阶段。
虽然定价策略在不断演变,混合模式和按任务计费最常见(各占 23%),而"圣杯"级的基于结果的定价目前仅被 3% 采用,因为不同客户重视不同结果,难以归因、度量和监控这些结果,这使得定价难以预测。
由于生态系统仍在初期阶段,大多数(52%)创业公司完全或主要在内部构建其 AI 智能体基础设施。
创业公司重视可靠性,超过 90% 报告其解决方案达到至少 70% 的准确率。虽然医疗健康创业公司报告最高的准确率水平(不足为奇),但在任务简单、低风险、输出易于验证的场景,或高自动化量弥补较低准确率的情况,或 AI 实现全新、之前不可能的能力时,中等准确率是可以接受的。
基于我们的调查结果和与企业从业者的访谈,我们概述了成功的 AI 智能体部署驱动因素的观察意见,涵盖从战略性用例推出到我们所谓的 3E 框架(教育、娱乐和预期管理)的方方面面。你是在这个领域构建的 AI 智能体创业公司,想克服企业部署的各种挑战?直接跳到我们的观察意见。
如果你是在这个领域创业的创始人,请联系 Advika、Sevi 或 Mina – 我们很乐意聊天。
"名字有什么意义?我们称之为 AI 智能体的东西,起其他名字也同样炒作。"
– 莎士比亚没说过
关于 AI 智能体的定义众说纷纭,但为了本讨论的目的,我们描述其关键属性:
目标导向性:AI 智能体被分配具体任务或目标,其行为与实现这些目标保持一致。
推理能力:智能体创建计划以实现上述目标,并在规划中融入不断变化的真实世界背景;它们将主要目标或复杂问题分解为较小、易于管理的任务,并思考下一步最佳行动。
自主性:AI 智能体无需来自人类的持续输入/指示即可独立行动;它们基于周围变化的世界做出决策并采取行动(通过工具调用)。鉴于生成式 AI 驱动的智能体处于初期阶段以及围绕它们的各种可靠性问题(和企业从业者对部署完全自主系统的谨慎态度),我们对智能体的定义不要求完全自主。因此,辅助工具也包括在我们的定义范围内(只要它们满足我们列出的其他标准,如目标导向性、推理能力和通过工具使用的行动)。
持久性:智能体具有记忆,或能够记住其先前的经历并跨会话保持对长期目标的关注。这也称为状态管理。
AI 智能体通过三个 C 来镜像人类:缓存(记忆)– 像我们的记忆一样,它通过向量数据库或状态回想过去事件;命令(肌肉)– 像肌肉一样,它通过工具、插件或 MCP 函数对世界采取行动;连接(嘴巴)– 像嘴巴选择与谁交谈一样,它在运行时选择 AI 合作伙伴。这些一起给予 AI 类人的自主性:记忆、行动和交流。
— Adversa 联合创始人兼 CTO Alex Polyakov
AI 智能体不同于基础 LLM 聊天机器人,因为状态管理和工具调用是更难的工程挑战,使其部署复杂得多。进一步的演变是多智能体系统(MAS),其中智能体可以拥有共享记忆和总体目标,并在彼此间进行协调。这些 MAS 涉及具有专门能力(或更大目标的不同子组件)的个体智能体协作解决复杂问题,甚至跨越组织边界。
由于 MAS 将认知负载分散到多个智能体(每个针对特定子任务进行优化),它们在处理复杂、开放式问题时相比单智能体方法表现出优越性能。它们提高了效率,降低了成本,并提供更好的容错能力和灵活性 – 这意味着它们在整体性能中优于单智能体系统。
但为什么要使用 AI 智能体呢?为什么不用 RPA(机器人流程自动化)或其他传统自动化形式?那是因为 AI 智能体更适合需要认知能力、推理和适应性的复杂、动态和非结构化任务。与遵循严格的预定义规则的 RPA 不同,AI 智能体可以推理以实现目标,即时做出动态决策,并随着时间推移学习或改进 – 这使它们能够处理边界情况和环境变化而不会崩溃。
以前的空运和海运现货价格定价自动化解决方案都很脆弱,很少突破 50% 的自动化率。通过转变离开固定的线性流程并使智能体能够处理和检索做出决策所需的更多非结构化数据,我们可以用新的 AI 智能体能力达到 90% 以上。
— Nexcade 联合创始人兼 CEO Dan Bailey
基于规则的自动化速度快但范围窄 — 它只能作用于它已经知道的事物。安全中最棘手的问题存在于意图不明显且信号不完整的灰色地带。AI 智能体则更进一步,将分析师级别的推理应用于规则无法解决的边界情况。它汇集了自动化的规模和人类判断的细微差别,为防御者提供了对抗在模糊性中茁壮成长的攻击的优势。
— Red Sift 创始人兼 CEO Rahul Powar
KPMG 的 AI 3Q 2025 季度脉搏等某些调查注意到,AI 智能体部署几乎翻了四倍,42% 的组织现已部署了"至少某些智能体",相比两个季度前的 11% 大幅增长。虽然这听起来很有希望,但我们认为"至少某些智能体已部署"是衡量真实采用情况的不良指标。我们与从业者的对话表明,是的,大多数大型企业正在生产环境中部署 AI 智能体,但这些部署通常相当小规模。它们也主要集中在相对更成熟的领域,如客户支持、销售和营销、网络安全和技术(例如 AI 编码智能体)。
我们认为通过以下视角思考采用会更有用:
究竟有多少团队和员工正在日常工作中使用智能体式 AI:PwC 在 2025 年 5 月开展的一项调查指出,对大多数受访者(68%)而言,日常工作中与智能体交互的员工不超过一半。尽管如此,我们与从业者的交流表明,在企业尚未采用这项技术的情况下,员工会使用个人账户,从而引发“影子 AI”问题,导致合规问题泛滥。
员工在其“潜在可自动化”工作流中使用 AI 智能体的程度(仅用于极少数工作流、部分工作流,还是大多数工作流):我们之所以强调“潜在可自动化”,是因为让每一个工作流都实现自动化未必是理想选择,而且智能体式 AI 也不一定是特定任务的最佳自动化技术。虽然收集实际已自动化工作流与潜在可自动化工作流的数据颇具挑战,但 KPMG 在同一项调查中对“员工如何接受 AI 智能体?”这一问题的观察可以作为一个相对有用的替代指标:只有 10% 的受访者表示实现了“显著采用”,即员工热情地采用 AI 智能体,并将其全面集成到工作流中;45% 的受访者则表示实现了“轻度采用”,即员工开始接受 AI 智能体并将其集成到工作中(其余受访者得到的反馈则褒贬不一)。
在每个工作流中赋予 AI 智能体的自主程度(它是只能执行给定工作流中的部分任务,还是可以端到端驱动整个工作流):我们与企业从业者的交流表明,他们采取的是保守策略。即使智能体式 AI 解决方案理论上能够以 80% 的自主程度可靠运行,大多数从业者仍会倾向于增加人在回路中的参与,让解决方案以 50% 的自主程度运行。
我们调查了 30 位欧洲智能体式 AI 初创公司创始人,并采访了 40 多位企业从业者和创始人,以确定:
他们的智能体式 AI 解决方案所达到的准确率和自主程度
创始人最常采用的定价策略
智能体初创公司能够获取哪些预算(仅限创新预算,还是也包括核心业务线预算)
初创公司创始人在大型企业部署智能体式 AI 解决方案时通常遇到的挑战
创始人内部构建的智能体基础设施,以及他们使用的第三方工具
自主程度和准确率是相互关联的两个维度——毕竟,只有当 AI 智能体能够产出可靠且准确的结果时,你才会在相应程度上实现自动化。在理想的智能体世界中,我们希望准确率和自主程度都达到极高水平。这里所说的准确率,是指由智能体执行的任务最终获得成功或结果被接受的百分比(即 0 表示被人类完全推翻,10 表示未经修改就被完全接受)。
尽管我们尚未达到理想状态,但我们发现,目前超过 90% 的智能体式 AI 初创公司至少达到了 70% 的准确率,不过只有 66% 的智能体式 AI 初创公司至少达到了 70% 的自主程度。不出所料,可接受的准确率因行业和用例而异——例如,金融服务业的平均准确率为 80%,医疗行业为 90%,等等。更有意思的问题是:在什么情况下,中等准确率是可以接受的?
考虑到准确率与自主程度之间的相互作用,我们发现初创公司主要处于以下三种配置:
如果用例符合以下条件,60%~70% 的中等准确率是可以接受的:
风险较低,且产出的结果便于人类验证和修改;以及
较低的准确率能够被非常高的自动化程度充分抵消。也就是说,如果某项任务耗时很长且工作量巨大,你会选择更高程度的自动化,从而处理海量任务,并且只需关注智能体无法处理的边缘情况;或者
它是一项过去无法实现的全新能力,因此权衡结果是:与完全无法开展某项活动相比,你宁愿以 70% 的准确率开展这项活动。
这一类别主要由医疗领域的智能体初创公司构成,其典型准确率和自主程度分别为 90% 和 40%。这些公司处理的都是风险高得多的用例(例如临床试验研究、心理健康护理),准确率至关重要。正如一位创始人在谈及其智能体式 AI 解决方案超过 85% 的准确率时指出:
“这一准确率还不足以取消人工监督并实现完全自主,尤其是在临床试验这种监管标准极为严格的敏感场景中。”
该类别中的大多数初创公司,其准确率和自主程度均处于 80%~90% 的水平,通常专注于金融服务用例(例如合规),以及 AI 部署相对成熟的领域,例如客户支持、网络安全和研究。在这些场景中,我们观察到,创始人越来越多地将概率性的 LLM 与更具确定性的 AI 方法结合,以提高准确率,并由此进一步提升自主程度。
我们的客户从事硬件工程。他们的目标是针对准备制造或组装的产品,获得一份 100% 可用的蓝图。这是一门硬科学,结果只有两种:要么能在生产线上运行,要么不能。在这种场景下工作的 AI 智能体必须追求这种完美——或者至少帮助人类更接近、更快地实现这一结果。这与我们所需的某些技术(尤其是 LLM)所固有的概率性存在冲突,因此我们需要使用其他更具确定性的 AI/ML 方法来实现平衡。
Matthias Berahya-Lazarus
Cognyx 首席执行官兼联合创始人
以下是智能体初创公司主要所处的三种“准确率/自主程度”配置的可视化总结:
随着我们越来越多地将智能体部署到多步骤问题中,或者引入多智能体系统,对准确率的要求只会越来越高——例如,当你把一个准确率为 90% 的智能体与另一个准确率为 90% 的智能体串联起来,并继续这样串联下去,会发生什么?错误会在每一步不断累积。这会引发一种称为“级联故障”的现象。我们将在即将发布的研究报告中探讨这一现象,以及为什么知识图谱和神经符号 AI 才是未来的方向——敬请关注!
鉴于智能体式 AI 生态系统仍处于早期阶段,我们交流过的大多数创始人都认为,其定价策略需要随着时间推移不断演进,我们认为这一立场是合理的。例如,在自主程度较低时,“按用户”定价是合理的(因为副驾驶需要一名人类用户与之协作);但在自主程度较高时,如果一个智能体可以执行一名员工的大部分任务(并解锁新能力),那么“按智能体”定价并附加成果奖金可能更为合理。
由于 SaaS 许可证定价和基于 API 使用量的定价已广为人知,我们在此重点讨论其他定价策略及其影响:
基于成果的定价经常被誉为 AI 商业化的圣杯,因为它让客户只有在实现特定的、预先定义的业务成果时才需要付费。Intercom 就是一个很好的例子:其 Fin AI Agent 每自主成功解决一次对话,便向客户收取 0.99 美元,从而确保客户只在智能体真正交付成果时付费。这样一来,价格就与交付的业务价值保持一致,客户承担的风险也更低;而且由于它与有形产出挂钩,相比基于 token 的计算方式,客户也更容易理解,因为后者并不直观。
然而在实践中,基于成果的定价由于多种原因很难实现。首先,你需要就客户重视哪些成果达成一致;不同客户可能重视不同的成果,因此最终可能出现大量定制合同。其次,你需要解决归因问题——例如,对于销售副驾驶,很难判断赢得一个新客户的成果中,有多少应归功于 AI 智能体,又有多少应归功于人类销售代表。与此相关的还有如何衡量成果的问题,而所有这些都会让计算变得更加复杂。最后,这种定价方式可能难以预测,因为提前预测某些成果(例如节省成本的百分比)颇具挑战——也就是说,你不仅无法确定成果的规模,也无法确定成果实现的时间,因为它可能会延后。以下是一位创始人的看法:
“但问题归根结底在于,人们很难就这些成果究竟是什么达成一致。也很难就如何跟踪这些成果达成一致,而且很难大规模实施。你实际上无法通过自助服务来完成这件事,因为其中的博弈色彩太强——人们有动机不向你报告成果。”
在以下情况下,采用基于成果的定价要容易得多:
预期成果定义明确,且不同客户所期望的成果相似;
AI 智能体端到端地执行整个工作流或任务,因此更容易进行归因;以及
成果易于衡量并能实时监控(例如,Intercom 的成果是二元的——AI 智能体要么解决了问题,要么没有,而且能够很快收到反馈)。
因此,我们预计混合模式将比纯粹按成果计费的模式更加普遍:即在按 AI 智能体计费的基础上增加成果奖金,而不是只按成果收费。
从预算分配的角度来看,这种模式更容易被客户理解,也适用于必须由人类用户配合产品使用的副驾驶类产品。这种定价模式的缺点在于,它无法区分 AI 智能体解决方案的重度用户和轻度用户,导致轻度用户实际上在补贴利润率较低甚至为负的重度用户。不过,如果副驾驶产品的定价足以覆盖支持重度用户所产生的成本,那么这仍然是一个不错的起点。正如一位创始人所说:
“我们很幸运,身处一个价格锚点相当高的行业[金融服务业];如果你拥有优质产品,就能收取更高的价格。虽然使用量非常大,但要真正显著侵蚀利润率,使用量必须高得相当离谱。”
此外,如果你的 AI 智能体解决方案在自动化大量任务方面非常成功,它最终会减少原本可以出售的席位数量,因此这种模式并不适合高度自动化的解决方案。尽管如此,我们采访的大多数创始人都计划逐步转向混合定价模式,尤其是在他们让产品具备更高自主性之后。
当你要自动化某一类员工所执行的绝大多数任务时,这是一种直观的定价模式;这样一来,你相当于替代了一名人类员工,费用可以从人员编制预算中支出。它的成本也具有可预测性,并且容易被客户理解。不过,我们观察到,采用这种定价模式的创始人在产品定位上呈现出了一个有趣的特点:他们并不把产品宣传为人类员工的替代品,也不把重点放在员工当前执行的任务上,而是聚焦于 AI 智能体能够解锁、但人类员工无法实现的全新能力,这使他们可以收取更高的溢价。
这种定价模式在直觉上也很容易理解,因为它将使用量与成本直接关联起来,客户只需为实际使用的部分付费。当任务执行的频率和数量难以预测时,这种模式尤其有用。由于它与所执行的任务挂钩,因此也有助于初创公司从服务预算中获得支出。
我们看到,越来越多的创始人选择混合策略,通常包括某种基础费用,并在此基础上采用可变定价,同时设置不同档位和超额费用。也可以按 AI 智能体收费,再加上基于成果的奖金。还可以按 AI 智能体收费,同时对其使用的专用工具按量计费(这有点像人类员工要求配备 SaaS 工具来完成工作)。由此可见,混合定价模式有多种不同的实现方式。
这种模式的优点是灵活性更高,而且可以通过限制使用量来保护利润率,使初创公司能够控制成本,并降低客户无法带来利润的风险。不过,它也可能很快变得复杂,因此,帮助客户预测用量至关重要。具体方式可以是:在安装前分析现有工作量中有多少可以实现自动化,设置用量提醒和严格的使用上限,或者允许额度结转,具体取决于混合模式的实现方式。
我们向创始人提出了这样一个问题:“你们目前正在争取企业的哪些预算?”令人振奋的是,我们发现,AI 智能体初创公司主要面向业务部门预算或核心支出预算进行销售。这表明,我们正在走出纯粹的实验阶段——创新预算通常用于这一阶段——AI 智能体已经开始为真实的业务用例或核心活动创造价值。这是一种追踪 AI 智能体走向主流的绝佳方式。尽管目前的部署是“广”而非“深”,但这无疑是一个积极的信号。
我们的发现也得到了其他面向企业的调查结果的印证:
平均而言,CFO 表示,他们将当前 AI 总预算的 25% 投入了 AI 智能体。(Salesforce,2025 年 8 月对全球 261 位 CFO 的调查)
88% 的高管表示,由于 AI 智能体的发展,其公司计划在今年增加 AI 相关预算。其中超过四分之一计划将预算提高 26% 或更多。(PwC,2025 年 5 月对 300 位高级管理人员的调查)
各组织正在将 AI 投资转向核心职能。目前,核心活动占 AI 预算的 64%,非核心活动则占 36%。这种重新分配表明企业对 AI 的认识日趋成熟:它们开始意识到,与外围流程相比,将 AI 应用于核心业务运营时,才能创造最具吸引力的价值。(IBM,2025 年 6 月对全球 2,900 位高管的调查)
我们在调查中向创始人提出了这样一个问题:“为客户部署 AI 智能体时,你们遇到的最大问题是什么?请按照影响程度排序(例如,将排名第 1 分配给最大的问题)。”
排名前三的问题很有启发性:我们经常听说,与遗留技术栈集成以及处理数据质量问题非常棘手。这些问题并没有消失,只是被其他重大问题盖过了。具体而言:
将 AI 智能体集成到客户或公司现有工作流中,以及处理人与 AI 智能体之间的交互界面存在困难(60% 的受访者)
员工抵触和非技术因素(50% 的受访者)
数据隐私与安全(50% 的受访者)
这里既包括概念层面的问题(例如:为了适应 AI,我的流程、工作流乃至岗位应该如何演变?AI 智能体可以在哪些方面、以何种方式帮助我?),也包括实践层面的问题(例如:UI 应该是什么样子?)。
从概念层面来看,最终用户需要一段时间才能适应这种新范式。首先要接受并认识到,流程需