研究实验表明,当破坏 LLM Agent 的某一层时,端到端通过率仅下降 1.7~5.9 个百分点,而该层专属断言下跌 25~91 分——聚合分是均值,均值天然抹平方差。
2026 年 6 月 10 日,三位研究人员发布了一项实验结果,旨在回答一个窄化的问题:如果你故意破坏一个生产环境中 LLM Agent 的某一层,你的评估套件能发现吗?
答案是:不能。在 Sawyer Zhang、Alexander Wang 和 Sophie Lei 的 Layer-Isolated Evaluation(层级隔离评估)中,一个已部署的订单 Agent 被拆解为一个固定的层级分类体系——本体层(ontology)、意图层(intent)、路由层(routing)、分解层(decomposition)、升级层(escalation)、安全层(safety)、记忆层(memory)以及一个横向包装层(cross-cutting envelope)——然后在七个非安全层上逐个注入损伤。其中六个注入回归中,聚合通过率仅移动了 1.7 到 5.9 个百分点。而属于实际被破坏的那一层的断言切片,下降了 25 到 91 分。
作者们并非有意去测量这个。他们称之为"我们没有设计进去的效应"。这是当前 Agent 评估中最重要的数字,但它是一个算术陈述,而非关于任何特定供应商工具的评判。
端到端任务成功率分数是一个均值。均值的职责就是丢弃方差——这就是它的本职工作。当一个复合系统的某一层降级时,大多数运行仍能绕开它,失败集中在输入分布的一个窄切片中,而均值吸收了损害。这个分数没有说谎。它正在做均值该做的事,即回答一个与工程师调试回归时提出的问题完全不同的问题。
这就是 Layer-Isolated Evaluation 第二个发现比标题更重要的原因。定位性(localization)成立:在七个案例中的五个里,注入层的切片是受打击最严重的单一切片;在全部七个案例中,它都位列前三,平均排名为 19 个切片中的 1.29 名。作者们谨慎地指出,一个层自己对自身故障的切片响应有一部分是构造上为真的;实验实际确立的是它周围的一对事实——聚合分数掩盖了故障,且损害停留在其他切片上而非在它们之间蔓延。信号从未缺席。它在任何人读到之前就被平均掉了。
他们的纯套件运行了 238 个案例,分布在 23 个切片上,其中 225 个在 2.39 秒内完成——每个案例约 10 毫秒,不涉及模型调用,在 CI 中按切片基准线进行门控。定位性在一个结构不同的第二个租户上复现了,因此这不是某个产品目录的人为产物。
三个月前,从一个完全不同的方向,同一条线出现了。
在 2026 年 3 月 3 日发布的 AgentAssay 中,Varun Pratap Bhardwaj 报告,行为指纹识别——将执行轨迹映射到一个紧凑向量并测试多变量漂移——在一类回归上达到了 86% 的检测能力,而二元通过/失败测试在同一类回归上达到了 0%。不是弱检测,是零。该论文在五个模型和三个场景上运行了 7,605 次试验,并将指纹识别结果与一个三值判决方案(PASS、FAIL 和 INCONCLUSIVE)配对,该方案基于假设检验而非某人随意选取的阈值。Bhardwaj 开篇认为,目前尚无原则性方法论来验证一个 Agent 在其提示词、工具、模型或编排逻辑发生变更后没有出现回归;这个框架是作者提出的,但它是一片争议地带。
2026 年 5 月 12 日,TensorZero 的 Alan Mishler 发表了最清晰的边界陈述,在论证一些乐观的东西时。嘈杂的 LLM 评估器,他展示,在一项工作上确实是可靠的:对 Agent 变体进行排序。在五个环境中,评估器分数与真实值的 Agent 级别相关性在每种情况下都优于输出级别相关性,且往往差距很大——在 Wordle 上是 0.96 对比 0.41。成对来看,评估器在 Gridworld 上 97% 的时间里选出了两个变体中更好的一个,在另外两个环境中是 87% 和 82%,在最困难的两种环境中是 64%。平均是有效的。
然后是这句话:"每个输出的不可靠性限制了嘈杂评估器用于典型生产任务(如 guardrails),所有这些任务都依赖于信任任何特定输出的判决。"
这是同一堵墙,由一个没有动机从中得出治理结论的人以肯定的方式陈述的。聚合评估对"我们应该发布哪个 Agent"这个决策是可靠的。它对"这个特定动作是否应该被允许"这个决策是不可靠的。这不是一个刻度盘上的两个档位。它们是不同的测量,而一个 guardrail 完全位于平均无助于你的那一侧。
Agent 中的每个组件都会受到聚合掩盖的影响。策略层受其影响更严重,源于三个结构性原因。
它很少触发。预算上限、PII 过滤器、对破坏性操作的审批暂停——这些都是异常路径。按代表性流量构建的测试语料库本身就会很少包含它们,所以分母会将其淹没。一个在 2% 的运行中触发的控制在由其他 98% 构建的均值中无法移动分数。
正确的执行看起来像失败。当一个策略在运行中途停止 Agent 时,任务没有完成。对于端到端任务成功率指标,一个正确被阻止的操作和一个 hallucinated(幻觉)工具调用是同一事件:零。开启治理后你的评估分数会下降——这悄悄地创造了一种激励:用关闭治理的配置做基准测试,然后发布一个从未被测量过的配置。
其回归是设计上的静默。损坏的检索层产生明显错误的答案。损坏的升级规则产生看起来没问题但跳过了本应进行的审查的答案。输出中没有任何内容表明这一点。这正是层级隔离实验量化的失败形态,也是 25 到 91 点的切片崩溃可以隐藏在 6 点聚合移动内部的原因。
注意 Layer-Isolated Evaluation 作者们刻意没有做的事:他们在七个非安全层上注入了回归。安全层在注入下的行为不在他们测量的结果中。论文自己对那个空白的回答是它的第三个贡献——一个覆盖率诚信准则,拒绝为从未被套件执行过的层打分。为一个你没有测试过的控制报告通过率不是测量。它是用其他所有内容的平均值填入的空白。
实际转变很小,大部分是文书工作。不要再把评估分数当作制品,而是开始把每个决策的记录当作制品。在你想要能够修复的粒度上打分:路由选择、升级决策、工具调用、策略评估。保留聚合分数——它在对变体选择确实有效,这是 Mishler 的数据所展示的——但不要再向它提出一个它从未被构建来回答的定位问题。而且永远不要为一个套件没有执行的层报告数字。
如果记录的唯一内容是运行的结果,所有这些都不可能实现。
Waxell Observe 围绕记录而非分数构建。其产品页面描述了捕获"Agent 运行的完整解剖——不仅是输出,而是引导出输出的每个决策":带 token 数、延迟和成本的 LLM 调用;带所考虑选项和所做选择的路由决策;带相关性分数的检索查询;带输入、输出和计时的工具调用——组装成完整的执行树,带有父子跨度关系,由 OpenTelemetry 驱动。这是按层级分辨率作为仪表化的默认输出,而非某人必须构建的独立测试工具。它用两行 Python 安装,并自动仪表化 200+ Python 库、框架和向量数据库。
执行那一半是闭合论文所打开的循环的东西。Observe 的 50+ 策略类别在实时评估 Agent 行为——在执行前、步骤之间和完成后——当策略触发时,Agent 收到结构化反馈:用调整后的参数重试、升级给人工、或停止。这些评估发生在 Observe 已经捕获的相同决策点上,这是这里重要的部分:治理信号位于决策的粒度,而非被折叠成单个运行结束判决(因无人能分解的原因移动了四分)。
我们之前关于为什么基准分数通过而治理策略失败的帖子认为,你必须故意触发一个控制才能知道它是否工作。这篇文章是那篇的测量前提:如果唯一的仪器只报告整个 Agent 的一个数字,触发控制什么有用信息也告诉不了你。
AI Agent 评估是衡量 Agent 是否正确完成其任务并在执行过程中行为可接受的实践。在大多数实现中,它在测试语料库上产生一个聚合任务成功率分数。该聚合非常适合比较两个版本的 Agent,但不适合识别哪个内部组件导致了回归。
因为均值天生会丢弃方差。当一个复合 Agent 的某一层降级时,失败集中在狭窄的输入切片中,而大多数运行成功,所以整体分数几乎不动。2026 年 6 月的 Layer-Isolated Evaluation 研究直接测量了这一点:聚合通过率移动了 1.7 到 5.9 个百分点,而匹配的每层切片下降了 25 到 91 个百分点。
这完全取决于决策的粒度。TensorZero 2026 年 5 月的分析发现,嘈杂评估器在排序 Agent 变体上是可靠的——在一个环境上 Agent 级别相关性为 0.96,输出级别为 0.41——因为每个输出的噪声在许多样本上平均化了。同一分析指出,这种每个输出的不可靠性限制了此类评估器用于 guardrails 等生产任务,在这些任务中,决策取决于对某个特定输出的判决。
故意触发它并确认执行事件出现了,而不是检查输出看起来是否可接受。策略控制很少触发,而一个正确的阻止在端到端指标中注册为任务失败,所以它们是聚合分数最看不到的组件。如果每个策略评估都在决策点被捕获,而不是在运行结束时被汇总,那么一个停止触发的控制就变得可以检测为记录中的absence。
这是将 Agent 分解为命名层级(如意图、路由、分解、升级和记忆)并为每个层级提供自己的确定性断言切片(带锁定的基准线)的实践。回归然后在对应的切片上浮出水面,而不是被平均到一个单一分数中。该方法还支持覆盖率诚信规则:一个套件从未执行的层级被报告为未执行,而不是被赋予一个通过率。
arXiv (Sawyer Zhang, Alexander Wang, Sophie Lei), "Layer-Isolated Evaluation: Gating the Deterministic Scaffold of a Production LLM Agent with a No-LLM, Regression-Locked Test Harness", 10 June 2026.
arXiv (Varun Pratap Bhardwaj), "AgentAssay: Token-Efficient Regression Testing for Non-Deterministic AI Agent Workflows", 3 March 2026.
TensorZero (Alan Mishler), "Even (very) noisy LLM evaluators are useful for improving AI agents", 12 May 2026.
Hacker News, "Even (very) noisy LLM evaluators are useful for improving AI agents", discussion thread.
Waxell, "Waxell Observe — AI Agent Observability & Governance".
Originally published on the Waxell blog.
Start free with Waxell Observe and one governed MCP upstream at waxell.dev/signup — two lines of Python, and every LLM call, tool invocation and agent decision is captured from that point on, at the granularity you need to find the layer that broke.
For further actions, you may consider blocking this person and/or reporting abuse