文章以行覆盖率满分、变异测试得分仅 4% 的案例,说明执行代码不等于验证行为正确。另一个案例将实现与检查交给不同模型,生成 554 个测试用例并发现 38 个缺陷。
这不是一个假设出来的差距,而是一套有记录可查的测试套件:行覆盖率达到 100%,mutation score 却只有 4%。每一行代码都执行到了,但人为植入的 bug 仍有 96% 漏过了测试。来源。
覆盖率告诉你哪些代码行执行过,却完全不能说明:如果逻辑出了错,测试能不能发现。AI 生成的测试往往就落在这个盲区里:写得流畅,全部通过,却几乎没有验证什么。
两周前,First Mate Technologies 公布了 QueueMate 的开发成果。这是一款餐厅排队应用,开发时刻意将构建与检查分开:一个模型编写实现,另一个独立模型设计测试用例,并在代码合并前进行审查。负责检查的模型生成了 554 个测试用例。这轮检查发现了 38 个缺陷,其中包括一个会话处理中的一级严重 bug,而负责实现的模型自己编写的测试没有发现它。(developer-tech.com)
这个案例完整说明了“验证优先”测试的核心观点:编写代码的模型,并不擅长判断自己写的代码是否正确。你需要第二道独立检查,而且最好不只是“再找一个 AI”,而是采用真正能够探查行为的方法。
同样是在过去一周,Momentic 推出了名为“Mo”的 Agent。它像人一样操作应用,报告复现步骤并提供视频证据,而不是拿自己生成的输出作为断言依据(SiliconANGLE,9 月 28 日)。这表明,行业正在走向同一个答案:将生成者与评判者分开。
这里有一个实用工具,它既不新,也不稀奇。mutation testing 已经存在了几十年,只是如今变得格外切题:
mutation testing 工具(根据你的技术栈,可以选择 Stryker、PIT 或 mutmut)会自动对代码做一处小改动,比如把 > 改成 >=、删除一行代码,或者反转一个布尔值。
随后,它会针对修改后的代码重新运行测试套件。
如果某个测试失败,这个 mutant 就被“杀死”了,说明测试套件发现了问题。如果所有测试仍然通过,这个 mutant 就“存活”了,说明无论覆盖率报告怎么说,测试套件都没有真正验证这段逻辑。
Gartner 在 2026 年 2 月发布的相关洞察摘要把问题说得很直接:依靠 AI 扩大测试覆盖范围会漏掉缺陷,因为 AI 生成的测试往往缺乏深度和精确性。摘要明确建议使用 mutation testing,作为纠正这一问题的验证层。(Gartner,Sushant Singhal 与 Erin Khoo)
mutation score 不是一种主观感觉。它是一个数字,逐个 mutant 告诉你:如果逻辑出了问题,你的测试是否真的能察觉。
你不需要搭建完整的 mutation testing 环境,就能在不到十分钟的时间里体会到这个差距。我做了一个免费、可运行的实验,用手动方式实现同样的机制:在看起来能正常工作的代码中,植入四个 bug。
node run-lab.js weak → AI 生成的测试套件通过了 3/3 个测试。运行的却是有问题的代码。
node run-lab.js verify-candidate → 独立验证套件运行失败,并发现了全部 4 个植入的 bug。
它采用的机制与 mutation score 相同,只是省去了工具配置:故意破坏逻辑,然后直接回答“我的测试能发现这个问题吗?”这个问题。仓库:chernevnikolay86-wq/ai-test-verification-lab
不要根据测试是否全部通过,来评价 AI 写的测试。要看它们面对一个可能出现的错误代码版本时,是否会失败。
如果你的技术栈有可用的 mutation testing 工具,就专门针对 AI 生成的测试文件运行它。mutant 的存活率,才是诚实反映测试覆盖效果的数字。
如果无法使用工具,就为被测函数编写 2–3 个故意出错的版本,或者让第二轮独立检查来编写,然后看看现有测试套件能否发现其中任何一个问题。这就是手动版 mutation testing。
把“AI 自己写的测试通过了”当作验证的起点,而不是终点。真正重要的问题是:“这是真实的 bug,还是模型失误?”只有独立检查才能回答。
这些内容属于《AI-Assisted Software Testing in Practice》第一章的范畴。这是一本面向测试人员和 SDET 的实战指南:读者已经掌握基础知识,现在需要一套可操作的方法,去验证 AI 编写的测试,而不是直接相信它们。没有认证,也没有平台宣传,只有一套可运行的工具包,以及背后的推理。
免费实验(机制与上文相同,可以自己运行):chernevnikolay86-wq/ai-test-verification-lab
Kindle,9.99 美元:Amazon 商品编号 B0HL4SC5PX
PDF + EPUB + 实验套装,19 美元:Gumroad 商品路径 nikolaychernev/ai-testing-in-practice
让 AI 生成的测试真正值得信任。别直接相信它,运行它。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。