Gemini Agent 平台评估服务正式可用
Google Gemini 企业 Agent 平台的评估服务已 GA,提供 20+ 预构建指标和自适应评估标准。帮助开发者统一衡量 agent 质量。
Google Gemini 企业 Agent 平台的评估服务已 GA,提供 20+ 预构建指标和自适应评估标准。帮助开发者统一衡量 agent 质量。
Agent 的质量必须在开发过程中针对你编写的用例进行测量,在上线后针对 agent 实际执行的任务进行测量。Agent Platform 中的 Agent 和 Model 评估现已正式开放,让你能够在两个阶段都对 Agent 和 Model 进行测量和比较,使用统一的引擎和一致的指标。当你在本地实验和实时流量上使用一致的质量评分时,生产环境中出现的漂移指向的是 agent 本身的问题,而不是测量方式的问题。
指标。从 20 多个预构建指标开始,涵盖质量、安全、事实依据、agent 工具使用和轨迹等维度,以及用于总结和翻译等任务的基于参考的评分方法。自适应评分标准根据每个具体用例调整判断标准,而不是将一个僵化的 llm-as-judge prompt 生硬地应用于所有输入。你也可以定义自己的基于代码或 LLM-as-a-judge 的自定义指标,并将其存储在一个版本化、组织范围的地方,这样评分就会随时间推移保持一致和可比较。
实验。支持客户端或服务器端运行。服务器端运行会将每个工件保存在 Cloud Storage 中,因此运行过程可以被审计和复现。实验集成了 case 生成功能来引导评估数据集的初始化,集成了用户模拟器来模拟多轮对话而无需手工编写每一条回复,还集成了环境模拟器来代替 agent 调用的外部系统,这样你可以测试 agent 在失败或缓慢后端下的表现而不影响生产环境。
在线监控和 telemetry 集成。对实时生产流量的持续评估,对你已经收集的跟踪进行评分,生成随时间变化的评分图表和漂移告警,无需设置自定义数据处理管道。
你可以通过 Agent Platform SDK、agents-cli、Agent Platform Google Cloud 控制台中的"评估"部分以及 ADK 直接访问评估功能。
评估中的主要工作单位是"实验",包含一个 eval case 数据集和要运行及审查的一组指标和评分。评估服务提供了灵活的 UI 来定义指标、启动新的运行和审查结果,可以深入到单个失败案例,在那里你可以打开 agent 的完整跟踪和会话日志,看清楚到底发生了什么。
你可以在本地运行实验以进行快速迭代,或者,如果你的 agent 已经部署在启用了 telemetry 的 Agent Platform 上,你可以对现有的会话和跟踪进行评分,或者在启用用户模拟器的情况下运行 agent 以在真实用户产生跟踪之前创建跟踪。每个实验工件都透明地存储在 Cloud Storage 中,因此你可以对运行进行版本控制和审计,用于合规性和存档。
对于大规模评估任务,系统支持问题聚类:它将 eval 失败分组为可解释、可操作的集群,对标你自己的失败原因分类。如果你还没有建立失败分类体系,可以使用我们为自适应评分标准预构建的分类体系,它涵盖了 agent 常见的出错方式。
超过 20 个预构建指标随服务一起提供。基于计算的指标针对地面实况参考进行确定性评分:用于总结的 ROUGE,用于翻译的 BLEU、MetricX 和 COMET,用于提取式 QA 的精确匹配。
除此之外,自适应评分标准是一个与我们的谷歌 DeepMind 研究合作伙伴共同开发的高级 LLM-judge 指标工作流。它从 eval case 定义、开发者指令和工具声明生成特定于每个用例的通过/失败标准(评分标准),然后根据这些标准对跟踪进行评分,提供每个标准的裁定和理由。
我们设计并校准了多个变体来满足你通常想了解的关于 agent 的问题。任务成功度(Task Success)基于可观察的结果和 agent 响应中的确认来评估整个对话中的目标实现。工具使用质量(Tool Use Quality)评估工具选择、参数正确性和 schema 合规性。安全性(Safety)根据包括仇恨言论、骚扰、危险内容、明确的性材料和 PII 的内容政策对响应进行评分,返回违反的政策。轨迹质量、最终响应质量、幻觉、事实依据以及图像和视频质量指标也都可用。自然语言指南指导评分标准生成朝向你指定的标准,生成的评分标准组可在不同 agent 间审查和复用。
当预构建指标不适用时,你可以使用自己的。基于代码的指标是一个 Python 函数,可以覆盖精确文本匹配、JSON 形状检查以及任何其他可用代码表达的检查。LLM-as-a-judge 指标则使用你自己定义的标准、评分量表和判官模型。在本地运行时,你可以使用任何提供商的任何模型,服务器端评估运行支持任何 Model Garden 模型,包括所有 Gemini 和 Anthropic 模型。
无论指标如何定义,它都进入同一个版本化、组织范围的指标注册表,在离线实验和在线监控中保持不变地运行。我们正在积极扩展对更多专门任务和输入模式的支持,欢迎你的反馈。
一个在整个测试套件中都通过的 agent 仍然可能在上线一周后出现漂移,当面对没有人写过对应用例的输入时。这倒不如说是生产环境的现实——真实任务往往比任何事先列举的测试套件都要复杂得多、陌生得多。
你在开发 agent 时建立的指标应该在 agent 上线后继续运行。如果你已经通过 Cloud Trace 收集跟踪和会话,在跟踪 UI 中只需点击一下就可以直接对它们进行评估。更好的做法是设置一个在线监控器,对实时流量进行持续评分。为了避免评估每一个请求并控制成本,你可以使用内置的采样和目标过滤器。当监控器处于活跃状态时,你可以在内置仪表板上看到随时间变化的评分,甚至可以为电子邮件、Slack 或其他渠道设置漂移告警。
每个评估都需要要运行的测试用例,而全部手工编写这些用例既慢又容易遗漏那些不明显的情况。评估服务可以为你生成这些用例,它包含用例生成器、用户模拟器和环境模拟器。
用例生成器从 agent 的指令和工具定义生成合成 eval 用例,这样你就不用从空白页开始,也不会将覆盖范围局限于你手工列举的内容。对于 ADK agent,它可以与用户模拟器配合来生成难以手工构造的场景:你定义一个用户角色和一个简短的对话计划,模拟器会在整个多轮对话中扮演这个用户,这样你就可以评估真实的往来交互而无需手工编写每一条回复。
环境模拟器代替 agent 调用的外部系统。你只需指定一个工具,给出你想要的响应(模拟数据、强制错误、添加延迟等),它会在运行时拦截该调用,这样你可以测试 agent 在失败或缓慢后端下的表现而不需要接触生产环境。
Agent 和 Model 评估现已正式开放。有关支持的地区和企业安全功能,请参阅地区和安全功能表。你需要按标准费率支付 LLM-as-a-judge 和其他基于模型的指标所使用的模型调用费用,加上服务器端运行保存的工件占用的 Cloud Storage 费用。基于代码和计算指标不产生额外成本。你的数据集和跟踪始终保留在你的项目中。
评估与你已经用来构建 agent 的任何工具兼容。它是 Agent Platform SDK 的一部分,通过 REST API 提供相同的操作,支持 SDK 无法覆盖的语言和开发流程。
如果你使用命令行工作,agents-cli 提供 eval 作为与你已经用来部署 agent 和检查 telemetry 的命令相并列的一级命令(目前支持 ADK-Python agent)。你甚至可以直接从你的编码 agent 运行整个循环:一个可复用的 skill 会引导 Claude Code 和类似的工具完成整个 agent 质量反馈循环。对于基于 ADK 开发的团队,评估功能已内置在框架中——定义 eval set 并在开发过程中针对你的 agent 在本地运行,包括在 pytest 中用于 CI。当你更希望不用写代码就审查运行结果时,Evals Worksheet web UI 是上面介绍的表格工具。
运行你的第一个评估:Tutorial — Agent Platform SDK
评估端到端的 agent:Evaluate agents with the GenAI Client
从你的编码 agent 运行循环:the agent-quality flywheel
我们迫不及待地想看到你开发出的成果。