Hamel Husain 发布 evals-skills 框架,总结 50+ 企业和 4000+ 学生的经验,帮助开发者规避 AI Agent 评估中的常见陷阱。基于实战积累的最佳实践指南。
今天,我发布了 evals-skills,这是一套用于 AI 产品 evals¹ 的技能。这些技能防范了我在帮助 50 多家公司和在我们课程中教学 4000 多名学生时看到的常见错误。
编码 agent 现在开始对应用程序进行仪器化、运行实验、分析数据和构建界面。我一直在用 evals 来指导它们。
OpenAI 的 Harness Engineering 文章很好地说明了这一点。他们用 Codex agent 完全构建了一个产品——三名工程师、五个月、约 100 万行代码——他们发现改进围绕 agent 的基础设施比改进模型本身更为重要。这些 agent 查询追踪来验证自己的工作。文档告诉 agent 应该做什么。遥测告诉它是否有效。Evals 告诉它输出是否良好。
现在所有主要的 eval 供应商都提供了 MCP server²。繁琐的部分——为应用程序进行仪器化、编排实验和构建标注工具——现在都落到了编码 agent 肩上。
但一个有 eval 平台的 agent 仍然需要知道如何使用它。比如说,一个支持机器人告诉客户"你的计划包含免费退货",但实际上不包含。另一个说"我已经取消了你的订单",但没有人要求这样做。两者都是幻觉,但一个事实错误,另一个编造了用户行为。如果你把它们混在一个通用的"幻觉分数"中,你会错过这些错误。
这些技能填补了空白。它们补充了供应商的 MCP server:那些给你的 agent 访问追踪和实验的权限,这些则教它如何使用它们。
如果你是 eval 新手或继承了一个现有的 eval 管道,从 eval-audit 开始。它检查你当前的设置(或缺乏设置),在六个方面进行诊断检查,并生成一个优先级问题列表和后续步骤。安装这些技能或给你的 agent 这个 prompt:
Install the eval skills plugin from https://github.com/hamelsmu/evals-skills, then run /evals-skills:eval-audit on my eval pipeline. Investigate each diagnostic area using a separate subagent in parallel, then synthesize the findings into a single report. Use other skills in the plugin as recommended by the audit.
如果你在 eval 方面经验丰富,可以跳过审计,直接选择你需要的技能:
这些技能是一个起点,只编码了跨项目泛化的常见错误。基于你的栈、你的领域和你的数据的技能会表现得更好。从这里开始,然后编写你自己的。
👉 仓库在这里:github.com/hamelsmu/evals-skills 👈
如果这些技能对你有帮助,我很想听到你的反馈!你可以在 X 上找到我,或通过我的新闻通讯给我发邮件。
¹ 不是 MMLU 或 HELM 这样的基础模型基准,这些衡量通用 LLM 能力。产品 evals 衡量的是你的管道在你的任务和你的数据上是否有效。如果你不熟悉产品特定的 AI evals,请查看我的 AI Evals FAQ。
² Braintrust、LangSmith、Phoenix、Truesight 等。