8.0
热点
AI SCORE
技术实践2026-09-02 03:24
AI 生成结果18%有幻觉:我的七天追踪实验
dev.to · AI#AI幻觉#代码验证#prompt工程
Editor brief · 编辑速览
作者对 Claude/GPT/DeepSeek 共 200 次输出人工验证,发现近五分之一存在事实错误或伪造引用,并开源了一款 100ms 内运行的验证层工具。
上周我做了一个实验。每次 AI agent 生成输出时,我都会手动验证并记录它是否正确。
结果令人尴尬。
在跨 Claude、GPT 和 DeepSeek 的 200 次输出中:
这意味着近五分之一的 token 预算花在了我不得不手动 catch 并重做的输出上。
LLM 被优化为听起来有说服力,而不是追求正确。当它们遇到不确定性时,会用看起来合理的内容填补空白。问题是 plausible 不等于 true,而在代码中,"看似合理但错误" 的东西需要花几个小时来 debug。
一个验证层,夹在模型和你的工作区之间。它在生成之后、输出到达你的代码库之前运行:
全部在 CPU 上 100ms 内完成。与模型无关。免费。
Download: https://agent-download-site.vercel.app
试着审计你自己的 agent 输出一天。你可能会对发现的东西感到惊讶。

We're a place where coders share, stay up-to-date and grow their careers.