作者用30个控制问题实测编码Agent对自家技术栈的掌握程度,发现Agent自信满满却仅约40%准确,且错误答案与正确答案一样流畅,难以辨别。
我的编程 Agent 每次回答关于我的技术栈的问题时都信心满满。上个月我终于问了那个本该最先问的问题:这其中到底有多少是真的?
我把 Agent 日常依赖的平台文档——一个游戏平台的 RGS API、它的数学 SDK、审批清单——都收集起来,写下 Agent 应该能够回答的问题,从这些文档中生成大约 30 道对照题,然后给 Agent 的回答打分。
得分在 40% 左右。最糟糕的并非分数本身——而是每一个错误答案听起来都和正确答案一模一样。同样的自信、同样的流畅度、同样的代码块。模型的训练数据只是比文档更旧,而对话中没有任何东西能告诉我哪些答案是来自 2024 年的。
上下文文件解决不了这个问题
标准解决方案是 CLAUDE.md / skills 文件夹 / memory MCP server。三个我都有。但三个问题依然存在:
每次对话每个词都要付费——整个文件跟着一起发送,不管当前任务是否需要它。
它们会静默腐坏。三月写的文件到六月就已经自信地答错了,但没有任何东西提醒你。
你无法衡量它们。在 Agent 在生产环境失败之前,没有人知道一文件夹的 markdown 到底覆盖了什么。
所以我让知识去参加考试
我围绕一个机制构建了 mozg:每个知识库("大脑")都根据它自己的用途来评分。
粘贴一个文档 URL。爬虫找到每一个页面(GitHub tree、llms.txt、sitemap 或链接爬取)并将其提取为原子化、可搜索的笔记。
你写的目标变成大约 30 道考题。大脑在每次摄入后参加考试。"训练 87%" 是一个可测量的数字,答错的题目就列在大脑页面上。
考试故意问一些大脑尚未覆盖的内容。失败才是重点——它们精确地告诉你接下来该喂什么。
Agent 通过 MCP 连接(Claude Code / Codex / Cursor 中一条命令),在服务端搜索——一个答案的上下文成本是它实际需要的 3 条笔记,而不是大脑所持有的 700 条。
我没有计划到的部分:它从使用中学习
一旦真实的 Agent 开始查询大脑,日志中就包含了比我能写的任何测试都更好的东西:大脑未能回答的问题。现在,每次返回空结果的搜索都会自动变成一道考题,而下一次重读源文件时就会去搜寻它。Agent 提交的纠错会变成待所有者审核的笔记。第十个用户得到的大脑比第一个用户的明显更好。
同样的考试本身就是一门课程:learn.mozg.sh 将任何大脑作为间隔重复课程来服务——阅读、回忆、测验——以大脑的考试作为最终测试。排行榜上你的分数旁边标注着你的 Agent 的分数。击败自己的 Agent 是一种奇特的激励。
评判者是一个模型,所以分数会有 ±3-4 分的波动(多数投票可以抑制大部分波动)。
大脑的质量取决于它的来源——考试告诉你材料缺失了,但不告诉你去哪里找。
对于稳定、众所周知的知识(如 Python 标准库),大脑毫无用处——模型已经知道了。大脑的价值在于文档变化比训练截止日期更快的领域。
目录中有免费的、无需信用卡的大脑,专门针对这些快速迭代的技术栈:Next.js App Router、Expo/React Native、Svelte 5、Tailwind v4、MCP 规范本身。用一分钟将一个连接到你的 Agent:https://mozg.sh——或者自己在 https://learn.mozg.sh 学习。它处于测试阶段;内部的聊天按钮直通我。