作者对常用编程Agent进行了文档级盲测,以实际API文档为标准出题,Agent得分约40%,且错误答案与正确答案置信度完全相同。根因是模型训练数据滞后,CLAUDE.md等记忆工具存在无声腐化和无法量化覆盖率的缺陷。
我的 coding agent 回答关于我技术栈的每个问题都充满信心。上个月我终于问了那个本该首先问的问题:这些答案有多少是真的?
我选取了 agent 每天依赖的平台文档——一个游戏平台的 RGS API、数学 SDK、审批清单——写下了 agent 应该能够回答的内容,从中生成了约 30 个对照问题,然后用实际文档对 agent 的答案进行评分。
得分大约是 40%。最糟糕的并非分数——而是每个错误答案听起来都和正确答案一模一样。同样的自信,同样的流畅,同样的代码块。模型的训练数据本身就比文档旧,而对话中没有任何东西能告诉我哪些答案是基于 2024 年的知识。
标准的解决方案是 CLAUDE.md / skills 文件夹 / 记忆 MCP server。我三个都有了,但三个问题依然存在:
我围绕一个机制构建了 mozg:每个知识库('brain')都根据其自身用途进行评分。
粘贴一个 docs URL。爬虫会找到每个页面(GitHub tree、llms.txt、sitemap 或链接遍历),并将其提取为原子化的、可搜索的笔记。
你写的目标会变成约 30 道考试题。每次摄入后 brain 都会参加考试。'训练程度 87%' 是一个可测量的数字,失败的题目会列在 brain 页面上。
考试故意问 brain 尚未覆盖的内容。失败才是重点——它们精确地告诉你接下来需要补充什么。
Agents 通过 MCP 连接(Claude Code / Codex / Cursor 中一条命令),进行服务端搜索——答案的上下文成本是它实际需要的 3 条笔记,而不是 brain 持有的 700 条。
我没有计划到的部分:它从使用中学习
一旦真实的 agents 开始查询 brains,日志中就包含了比我能写的任何测试都更有价值的东西:brain 未能回答的问题。现在每次返回空结果的搜索都会自动变成一道考试题,下一次重新读取源时会去搜索它。Agents 提交的纠错成为需要所有者审核的笔记。第十个用户得到的 brain 比第一个用户明显更好。
同样的考试被证明是一套课程体系:learn.mozg.sh 将任何 brain 作为间隔重复课程——阅读、回忆、测验——以 brain 的考试作为最终测试。排行榜上你的分数和你的 agent 并排显示。打败自己的 agent 有着奇怪的激励效果。
评判者是一个模型,所以分数会有 ±3-4 分的波动(多数投票可以抑制大部分波动)。
一个 brain 的质量取决于它的来源——考试告诉你材料缺失,但不告诉你去哪里找。
对于稳定、众所周知的知识(Python stdlib),brain 没有任何帮助——模型已经知道这些。brain 的价值在于文档更新速度超过训练截止日期的领域。
整个产品在 GitHub 上以 AGPL 协议开源:https://github.com/egorfedorov/mozg——用你自己的密钥自托管,一切都能工作。全部官方目录免费。云端赚取费用的唯一正当方式是:套餐覆盖我们的服务器在构建 brain 时消耗的推理成本——或者你带上自己的 API key,不花一分钱。
目录中恰好有针对这些快速迭代技术栈的免费、无需信用卡的 brain:Next.js App Router、Expo/React Native、Svelte 5、Tailwind v4 以及 MCP 规范本身。一分钟内将其中一个连接到你的 agent:https://mozg.sh——或者自己在 https://learn.mozg.sh 学习。它处于测试阶段;里面的聊天按钮直接通向的我。