前端进阶之旅前端进阶之旅
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
首页程序员面试题库Agent 结果评估 过程评估 区别
AIAI Agent评估与调试

AI Agent 评估中结果评估与过程评估各适合什么场景

结果评估适合可明确判定产物的封闭任务,过程评估适合步骤不可逆、需追溯或涉及外部副作用的任务。

前端进阶之旅 · 一题精讲更新于 2026.09.05
AI Agent#评估与调试
先看核心答案
理解线索

用可逆性选择评估焦点

  1. 结果评估只核对最终产物是否满足预定义成功条件。
  2. 过程评估逐条检查轨迹中的决策、工具调用和中间状态。
  3. 关键区分错误是否可低成本重试且不产生不可逆副作用。

开放任务若中间步可能锁死状态,即使最终似好,也需过程证据。

核心回答

先记住这个答案

结果评估在最终输出可客观判定时最有效,如商品分类、信息抽取。过程评估在中间步骤影响最终成败、不可逆操作或需要定位失败原因时必要。关键是风险与可恢复性:若错误中间步可低成本重试,则只看结果;若产生真实副作用,则必须检查每一步。

  • 封闭、可判定产物优先结果评估。
  • 步骤不可逆或高风险时必须过程评估。
  • 混合评估按失败代价与可恢复性折中。

为什么两类评估对应不同风险结构

结果评估的前提是成功状态可判定且错误路径可回退。它把Agent视作黑盒,只看最终输出是否满足显式条件,例如分类标签正确、回答包含关键字段。这使评分成本低、可复现,适合批量回归。

过程评估的必要性来自三类机制:中间决策会永久改变外部状态;早期错误会沿轨迹累积并最终甚至掩盖真实原因;以及工具副作用无法从最终输出反推。此时必须把决策步骤本身纳入打分才能发现风险与定位问题。

一个具体场景:自动发券 Agent

构建一个自动发放优惠券的Agent:输入用户ID,Agent先查用户等级和库存,再调用发券接口。约束是接口为幂等但每天限赠一次;误发无法撤回。若结果评估仅以接口是否返回成功为判据,不核对具体券面值与等级匹配,则可能漏掉中间曾误选了高面额券并已发出。

处理采用分层评估:先做结果断言——最终必须返回成功且券面值与等级匹配;若失败则以过程检查为辅,逐条核对工具调用顺序和参数。对批量回归只跑结果评估以控成本,对每次发券需审计线上副作用时必须持久化轨迹并做过程校验。

何时只看结果会失效,以及代价

当错误步骤不可逆或接近不可逆时,只看结果会掩盖高风险行为。例如删除数据库记录后返回成功,结果看似合格,实际已造成破坏。若外部系统无回滚接口,且评估环境并不完全隔离,就不能用最终状态代表过程安全性。

完全过程评估也有代价:轨迹标注成本随步数上升,且对多路径任务会误杀等效的合法做法。应对方式是设置风险门:仅当任务包含不可逆工具、权限提升、真实资损或外部副作用时强制过程评估,否则默认结果评估,并辅以随机抽样核对关键步骤。

回答前,多想一步

容易答错的地方

认为最终成功就代表过程都对
Agent可能通过危险路径完成任务,例如反复调用删除接口后重建数据导致服务降级。结果评估无法发现此类问题,必须在含不可逆操作的环境中引入轨迹级检查。
把所有任务都做全轨迹人工评估
对简单封闭任务也逐条人工标注每步工具调用,会造成极大成本且因各步间无绝对唯一正确答案而引入低信噪比。应先判定是否需要过程级保障,再决定评估焦点。
试着用自己的话回答

面试官还会怎么问?

什么工具调用算不可逆,必须过程评估?

典型是真实扣款、物理操作、外部发布、删除非幂等资源。若接口支持幂等且可安全重试,则存在恢复余地;若只会执行一次无法撤销,就要强制检查参数与前置状态。

结果评估和过程评估能否共用同一组测试用例?

可以,但需要各自独立的评价维度;结果用例关注最终产物,过程用例关注轨迹决策。同一任务可能会做双评级,例如既判正确率又判工具调用安全。

过程评估发现步骤多但最终成功,应扣分吗?

若多出的是冗余但无害调用,可直接扣效率分;若涉及越权或敏感资源读取,无论最终成功都应视为严重缺陷。以风险等级和操作规范为准,而不是只数步数。

从一道题,走向一组知识

把知识连起来

评估与调试

如何评估 AI Agent 工具调用的正确性

同属「评估与调试」专题,接着看 Agent 工具调用正确性 评估 tool call correctness 在具体场景中的处理方式。

评估与调试

什么是 AI Agent 的轨迹评估,轨迹中应记录哪些关键字段

同属「评估与调试」专题,接着看 Agent 轨迹评估 trajectory 记录字段 在具体场景中的处理方式。

参考资料

  • Define success criteria and build evaluations - Claude Platform Docs

示例用于理解所注明的运行环境与边界;延伸学习可结合原文中的更多案例。

本题目录
  1. 先记住这个答案
  2. 为什么两类评估对应不同风险结构
  3. 一个具体场景:自动发券 Agent
  4. 何时只看结果会失效,以及代价
  5. 容易答错的地方
  6. 面试官还会怎么问
  7. 把知识连起来
读懂,再试着讲出来

先看核心答案,再读代码。最后展开追问,检查自己有没有遗漏边界。

试着回答追问
浏览全部面试题理解原理,也关注真实的使用场景。回到顶部 ↑