微软与 HuggingFace 推出 ThinkingBox,通过检查数据库实际状态而非 Agent 回复来评估,在 12 万次试验中 66% 的「成功」实际存在字段错误或遗漏步骤。
微软与 Hugging Face 联合发布了一篇博客,介绍了一个名为 ThinkingBox 的全新 Agent 评估框架,其核心思想很简单:评估一个 AI Agent 的依据是它实际写入数据库的内容,而非它在最终回复中说的话。
文章给出了一个典型场景:一个处理延迟配送问题的客服 Agent。它调用了 9 次工具,正确读取了退款政策,并将工单标记为已解决。但有两处错误:快递异常仍然处于打开状态,所以工单本应保持待处理而非标记为已解决;而且客户真正的问题从未得到回答。如果评估者只检查工具调用记录或最终回复语句,会将其判定为成功——但数据库里的实际状态说明并非如此。
ThinkingBox-Bench 涵盖了零售、汽车保险、旅游、新兴银行和咨询等 5 个领域共 507 个有状态业务流程,对 18 个专有和开源 LLM 各进行 20 次测试,每次都从相同的干净后端开始。在 12 个模型、121,680 个有效测试的通用集消融实验中,79,853 次尝试未通过执行检查,其中 67.24% 的失败操作顺利结束且没有报告工具错误。进一步分析这些失败案例:77.61% 存在错误的字段值,43.30% 产生了意外的附加效果,25.36% 缺少必需的效果。
单次尝试准确率(pass@1)和全部 20 次尝试的一致性(observed 20/20)反映出的情况截然不同。Claude Opus 5.5 在整体 pass@1 上领先达 67.16%,Kimi-K3 则是最强的开源模型达 57.37%。但 Kimi-K3 在 93.89% 的任务上至少成功过一次,而单次尝试通过率仅为 13.41%(507 个任务中 68 个);Claude Opus 5 至少成功一次的任务比例更低(79.09%),但在全部 20 次尝试中每次都通过的任务达 47.53%(507 个中 241 个)。更新版的 Claude Opus 5.5 平均分高于 Claude Opus 5,但全部 20 次尝试都通过的任务数量完全相同(241 个),这意味着准确率的提升并未带来额外的可靠性。
失败的诊断分析是最有参考价值的部分:79.9% 是工具使用错误,10.3% 是错误的状态更新,7.0% 是不完整的用户问题解答,只有 2.9% 完全不涉及状态变更操作。这意味着大多数失败是重试-恢复问题,而非推理问题。
ThinkingBox 现已通过 Hugging Face 和 OpenEnv 提供使用,框架采用 MIT 许可证,基准数据采用 CDLA-Permissive-2.0 许可证。