新基准Reconstruction测试模型能否仅凭参考文献预测论文核心发现,七个前沿模型得分3-15%,且测试严格避免数据泄露。
在模型设计蛋白质、登顶编程排行榜的一个月里,一篇相对低调的论文悄然发布,却是一个有用的反面参照:一份名为 Reconstruction 的基准测试,用于衡量模型是否能仅凭论文发表前的参考文献恢复一篇研究论文的核心思想。结果是,最前沿的模型得分在 3% 到 15% 之间。这个数字值得静下心来思考,恰恰因为在这个喧嚣的月份里,它是一条枯燥的消息。
这个设置很关键,因为大多数"AI 能做科研吗"的论断在数据泄露面前站不住脚——模型已经读过了待测试的论文。Reconstruction 正是针对这一问题进行工程化设计的。它使用了严格的时间截止线,确保目标论文在模型的训练数据之后;使用匿名化的引用 ID;与种子信息隔离;以及冻结的参考文献。任务:仅凭一篇论文引用了哪些文献——在这些文献写就之前——推断该论文做了什么。六款前沿模型,643 篇论文,涵盖机器学习及五个 Nature 旗下的科学领域。
这是一个真正困难、也真正公平的测试,测的是一项具体能力——不是"模型是否聪明",而是"模型能否从研究者拥有的相同起点材料中,产生一个真正研究思想所需的那种新奇连接"。而答案,对于独自工作的单一模型来说,基本上是否定的。3% 到 15%。
这才是它变得有用、而不只是令人谦卑的地方。纯参考文献的多智能体流水线——跨模型评审加上瑞士制(Swiss-tournament)结构对候选假设进行比拼,无网络搜索——将匹配率提升至六个领域约 23%–42%。这比最佳单一模型提升了约 2.4 倍。

从中得出两点结论,它们指向不同的方向——这正是我相信它的原因。
乐观的解读:结构有帮助,而且帮助很大。同样的底层模型,编排成一个系统来生成候选并相互竞赛,比它们各自单独工作的表现提升了一倍多。这是多智能体论点有真实数字支撑的版本,而非凭感觉——而且它与我持续看到的现象一致:模型周围的套索(harness)提取出了模型独自无法表达的能力。
冷静的解读:42% 是这里的最高成绩,而且是用了整套竞赛流水线才达到的。即使编排之后,这些系统仍然错过了真实科学家从相同参考文献中得出的大多数研究思想。多智能体并非模型最擅长之事的神奇溶剂——真正的原创综合。它是在一个低基数上的有意义倍增器。
我发现这类基准测试比模型赢下的排行榜更有用,因为它们绘制的是边缘而非中心。这里的边缘很清晰:模型在生成和针对检验进行验证方面表现卓越,但在原创综合这一特定行为上仍然薄弱——即发明出还没有人写下的那种连接。
这是一张好地图,用于决定实际委托什么工作。把模型交给答案存在、只是需要寻找、生成或检验的工作,它就是超人类的。把它交给答案尚不存在、需要从稀疏信号中发明的工作,你就身处 3% 到 15% 的区间,它顶多是个头脑风暴伙伴,而且需要你在循环中。知道你的任务落在这条线的哪一边,比知道本周的排行榜顺序更有价值。
把模型接入多智能体竞赛流水线,从 15% 艰难爬升到 42%,对于困难的生成问题来说也是一种值得掌握的好技巧——即使本周的标题是 42% 离完成还有多远。
如果你曾用多智能体设置,在一个真正生成性的任务上超越了单一模型能做到的,我想听听提升有多大——真实的数字比炒作更难找。