8.0
热点
AI SCORE
编程提效2026-09-01 14:36
实测200次AI输出:18%存在幻觉,验证层工具免费开源
dev.to · AI#AI幻觉#验证工具#开源
Editor brief · 编辑速览
作者连续一周手动验证Claude/GPT/DeepSeek的200次输出,发现36次(18%)存在自信型错误,12次伪造引用,8次工具参数幻觉,4次泄漏系统提示词。提供了一个100ms内运行的免费验证层工具。
上周我做了一组实验。每当我的 AI agent 生成一段输出,我都会手动验证并记录它是否正确。
结果令人尴尬。
在 Claude、GPT 和 DeepSeek 的 200 次输出中:
这相当于近五分之一的 token 预算花在了我必须手动发现并重做的输出上。
LLM 的优化目标是听起来有说服力,而不是保证正确。当它们遇到不确定性时,会用看起来合理的内容填充空白。问题是,"看起来合理"不等于"真实",而在代码中,"看起来合理但错误"的东西会浪费数小时来调试。
一个验证层,置于模型和你的工作区之间。它在生成之后、输出到达代码库之前运行:
所有检查在 CPU 上 100ms 内完成。与模型无关。免费。
Download: https://agent-download-site.vercel.app
试着审核一天你自己的 agent 输出。你可能会对发现的结果感到惊讶。

We're a place where coders share, stay up-to-date and grow their careers.