Sakana AI 的 TMLR 论文提出基于 Claude 的三智能体多层审查系统,并构建包含 1,164 个错误的矛盾检测基准。系统在该基准上检出 73.43% 的核心论断错误,此前最佳系统为 14.81%。
人工智能
Sakana AI 发布了 TMLR 研究论文《Beyond Imitation》,围绕错误检测构建了一套由 LLM 辅助的同行评审方法。大多数 AI 评审系统的评分依据,是它们模仿人类评审的程度。这项研究提出了一个更难的问题:AI 评审系统能否发现人为植入的错误?研究团队提供了两项成果:Contradiction Benchmark(矛盾基准)和 Multi-Layered Review(MLR,多层评审)系统。对于开发研究 Agent 的程序员来说,这项研究带来的启示很实际:系统设计和模型选择都会影响错误检测能力。
规模:在来自 5 个会议的 257 篇论文中,植入了 1,164 处矛盾。MLR 最多读取 10 页正文。
运行方式:使用现成的 API 模型(Claude Sonnet 4、Claude Haiku 3.5)。无需 GPU,无需微调。每次评审约花费 $0.47。
表现:在参与测试的全部 4 个系统中,错误检测能力最强,评分也与人类评审较为一致。
最佳表现:通过 4 次评审,发现了 73.43% 的核心论点错误,而最佳基线系统仅发现了 14.81%。
最差表现:在真实撤稿的 arXiv 论文上,精确匹配率只有 16.11%。
核心结论:优势是先读懂论文再作判断,能发现更多严重错误;短板是仍会受到隐藏 prompt injection 的欺骗。
优势:先读懂论文再作判断,能发现更多严重错误。
短板:仍会受到隐藏 prompt injection 的欺骗。
Multi-Layered Review 是 Sakana AI 开发的一套 Agent 式 AI 评审系统,会先理解研究论文,再进行批评分析。它使用 3 个 Agent,运行在现成的 Claude 模型上:
Appendix Agent(Claude Haiku 3.5):总结附录中的实验和实现细节。
Literature Review Agent(Claude Sonnet 4):通过网络搜索,将论文放到已有研究的脉络中考察。这个 Agent 是可选的。
Review Agent(Claude Sonnet 4):执行一个包含 3 轮的 prompt 链,设计灵感来自 Keshav 的 Three-Pass Approach(三遍阅读法)。
第 1 轮撰写高层次提纲。第 2 轮详细阅读,标出薄弱之处、假设和缺漏。第 3 轮将所有 Agent 的输出整合为优势、弱点、问题、推荐意见、评分和待办清单。系统直接接收 PDF,因此图表和公式都能保留下来。
这个基准将错误植入真实论文,检查评审系统能否发现它们。研究团队收集了 257 篇采用 CC 许可的论文,来自 ACL、AISTATS、CVPR 和 ICML 2025,以及 NeurIPS 2024。
Gemini 2.5 Pro 为每篇论文的论点、证据和方法构建知识图谱。节点与“主要论点”的距离决定错误的严重程度。距离为 0 时,错误直接涉及核心论点;距离越大,涉及的内容越偏向细节。随后,GPT-4.1 在每个距离上选取 1 个节点,将其改写为矛盾,最终得到 1,164 个数据点。
一个基于 o3 的评判模型对每份评审评分 10 次。在没有植入错误的论文上,它的准确率达到 99.9%。对于人工确认已成功发现错误的案例,它的敏感度为 86.8%,因此论文报告的分数可能偏保守。
在这个基准上,MLR 领先于所有基线系统。通过 4 次评审,它发现了 73.43% 的距离为 0 的矛盾,总体检出率为 40.95%。表现最好的基线系统 AgentReview,在距离为 0 的矛盾上检出率为 14.81%。即使只进行 1 次 MLR 评审,检出率仍达到 60.79%。
一项消融实验区分了模型和系统设计各自的影响。在 LLM-Review 中,将 GPT-4.1 换成 Claude Sonnet 4 后,距离为 0 的错误检出率从 14.56% 提升至 35.40%。在单次评审中,MLR 的设计又带来了约 25 个百分点的提升。随着节点距离增大,准确率下降,这也支持了基于距离的严重程度评分方式。
在 WithdrarXiv-Check 中的真实撤稿论文上(共 211 篇),提升幅度有所缩小。MLR 的“相似”匹配率为 26.07%,“精确”匹配率为 16.11%。最强基线系统在这两项指标上的得分分别为 18.48% 和 9.00%。
在评分上,大体一致。在 ICLR 2025 投稿论文上,MLR 预测评分与人类评分的 Pearson 相关系数达到 0.586。作为参照,人类评审者之间的相关系数为 0.742。在 ICML 2025 上,AI Reviewer 略胜一筹,其相关系数为 0.439,而 MLR 为 0.429。
在关注重点上,则不一致。MLR 更强调研究的有效性和实验,而人类更重视表达清晰度和新颖性。作者将其定位为一种互补视角,而非人类评审的替代品。
MLR 每次评审约花费 $0.47,不包含可选的 Literature Review Agent。它使用 189,062 个输入 token,约为 AI Reviewer 的 403,654 个的一半。单 prompt 变体将成本降低了约三分之二。在基准的一个子集上,其检出率下降了约 3.5 个百分点。
| 特性 | MLR(Sakana AI) | LLM-Review | AI Reviewer | AgentReview |
|---|---|---|---|---|
| 本研究使用的 LLM | Claude Sonnet 4 + Haiku 3.5 | GPT-4.1 | o4-mini | GPT-4o |
| 设计 | 3 个 Agent,3 轮 prompt 链 | 单 prompt,文本截断 | 5 份评审集成、元评审、反思 | 评审者、作者、领域主席角色 |
| Contradiction Benchmark 总体检出率 | 40.95%(4 次评审) | 6.39% | 6.50% | 5.95% |
| 核心论点错误检出率(距离为 0) | 73.43% | 14.56% | 11.17% | 14.81% |
| WithdrarXiv-Check,相似/精确匹配率 | 26.07% / 16.11% | 5.21% / 2.37% | 13.74% / 9.00% | 18.48% / 5.69% |
| ICLR 2025 与人类评分的 Pearson 相关系数 | 0.586 | -0.013 | 0.538 | 0.195 |
| 每次评审的输入 token 数 | 189,062 | 6,517 | 403,654 | 310,964 |
| 每次评审成本 | ~$0.47 | ~$0.01 | ~$0.49 | ~$0.81 |
| 代码是否开放 | 需提出申请 | 是 | 是 | 是 |
所有基准测试、相关系数、token 数和成本数据均来自《Beyond Imitation》论文。
Sakana AI 根据发现错误的能力评价 AI 评审系统,而非模仿人类的程度。
MLR 发现了 73.43% 的核心论点错误,约为最佳基线系统的 5 倍。
更换模型和采用 3 轮设计,都能大幅提升错误检测能力。
真实撤稿论文中的错误仍然难以发现:精确匹配率为 16.11%。
隐藏的 prompt injection 仍会影响所有参与测试的 AI 评审系统。
欢迎查看这篇论文。所有功劳都归于这个项目的研究人员。也欢迎在 Twitter 上关注我们,别忘了加入我们拥有 150k+ 成员的机器学习 SubReddit,并订阅我们的 Newsletter。等等!你用 Telegram 吗?现在也可以在 Telegram 上加入我们了。
Asif Razzaq 是 Marktechpost AI Media Inc. 的 CEO。作为一名富有远见的创业者和工程师,Asif 致力于发挥人工智能的潜力,为社会创造福祉。他最近的一项事业是推出人工智能媒体平台 Marktechpost。这个平台以深入报道机器学习和深度学习新闻而著称,内容既在技术上严谨,也能让广泛的读者轻松理解。平台每月浏览量超过 200 万,体现了它在读者中的受欢迎程度。