Hugging Face 团队系统性复现 ICML 论文,发现约 30% 代码无法复现、依赖缺失、数据不可用等典型问题。
比任何人都审不完的论文
关于 AI 研究究竟有多少可复现性的问题,比当前的 AI 浪潮更早出现。但这些问题因规模而加剧。ICML 2026 收到了 23,918 篇投稿,录用了 6,352 篇,比上一年增加了约一倍,继续保持着至少部分由 AI Agent 使实验运行和论文撰写速度加快所驱动的指数增长趋势。
审稿能力并没有随之翻倍。大多数会议的审稿人是志愿者,他们可能没有时间或专业知识来完整审阅一篇论文。以下是一位审稿人对一篇录用的 ICML 2026 spotlight 论文的评价,引用审稿人原话:

"我的低置信度评分是因为我没有仔细检查所有证明过程。"
请注意,这篇论文获得了高评分并取得了 spotlight。记住它,因为我们稍后会在文章中回到这篇论文,以及当我们最终仔细检查证明过程时发现了什么。
然而,变化在于,推动投稿洪流的同一技术也可以帮助我们跟上这个速度。像 Claude Code、Codex、Cursor 和 Pi 这样的编码 Agent 现在可以阅读论文、编写代码、启动实验并报告它们的发现。仔细审阅一篇论文过去需要审稿人花费一个周末;而一个 Agent 可以在一个下午内并行尝试数千次。
所以我们想问的问题是:如果我们真正在大规模上重新审视一个顶级会议,并尝试复现每篇论文,我们会发现什么?
黑客松(7 月 15 日 - 8 月 2 日)
我们没有自己审计论文,而是向整个社区开放,带来了多样化的 Agent 框架、算力预算和科学品味。2026 年 7 月 15 日至 8 月 2 日,ICML 2026 开放复现挑战的工作方式如下:
选择一篇论文。我们索引了所有 6,341 篇 ICML 2026 录用论文及其摘要,并提取了每篇论文的核心科学主张,以便 Agent 可以从一个具体的、可检验的目标开始,而不是面对一份 40 页的 PDF。鼓励多人复现同一篇论文。
自带 Agent。参与者使用 Claude Code、Codex、Cursor、OpenResearch 的 orx 以及介于它们之间的一切。我们提供了一个简化的界面,使 Agent 可以用一条命令拉取论文、其主张和挑战说明。
复现,然后公布一切。每次运行都会产生一份 Trackio 日志本:一个静态的 Hugging Face Space,包含报告、运行的代码、它产生的 artifacts,以及(可选的)作为 Hugging Face Dataset 上传的完整 Agent 执行轨迹。审计过程本身必须是可审计的。
评判。一个自动化的日志本裁判(运行开放权重模型 GLM-5.2)重新阅读每份日志本并对每个主张给出裁决:已验证、已证伪、玩具(在缩减规模下的证据)或不确定。裁判被明确指示将每份日志本的自我评估视为不可信。
参与者获得 20 美元的 Hugging Face 计算积分,用于在 HF Jobs 上运行实验;挑战期间,参与者共启动了 2,962 个云作业。当完整复现不可能时(例如论文的数据集是专有的或其检查点未发布),参与者在模拟原始数据属性的合成数据上运行玩具复现。
以下是完成的复现看起来的样子:

从数字来看,这次黑客松可能是科学会议历史上最大规模的复现尝试:
1,221 名社区成员加入了组织
6,816 份复现日志本发布
2,226 篇论文被尝试复现,占整个会议的 34%,其中许多由多个独立团队进行
35,908 条主张被裁决,所有裁决在挑战截止时冻结在一个公开数据集中
2,962 个 HF Jobs 启动;274 个完整 Agent 轨迹数据集发布在 Hugging Face 上
汇总每篇论文的主张级裁决:
51% 的被审查论文(1,103 篇)至少有一条主张被独立验证。其中,266 篇论文被完全复现,每条提取的主张都得到了验证,另有 632 篇被部分复现且没有发现任何证伪。共有 3,978 条独立主张通过真实实验得到确认。
23% 的被审查论文(496 篇)至少有一条主张被证伪或质疑。其中包括 49 篇论文所有主张均被证伪且无法验证,以及(也许最有趣的是)242 篇论文独立复现团队对相同主张得出了相反的裁决。可复现性不是二元的,它是对抗性的。
其余处于中间地带:502 篇只有玩具规模的证据,280 篇无法得出任何结论(最常见的原因是缺失 artifacts)。
做得好的复现
有些论文穿过这道关卡后表现出色,社区最优秀的日志本本身就值得一读:
"Flat Minima and Generalization: Insights from Stochastic Convex Optimization" 由 20 个独立团队复现,其中 12 个验证了每一条主张。链接的那份包含了并发布了完整的 Agent 轨迹。
"A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness" 有 17 份日志本中的 14 份验证了每一条主张。一篇关于不可靠的 LLM 裁判在 LLM Agent 的审查下依然站得住脚的论文 :)
证伪,以及当我们仔细检查时发现了什么
35 名参与者正式声称他们证伪了某些内容。我们对每一条声称的证伪进行了对抗性再验证:重新阅读论文、重新阅读日志本、从论文原文重新推导数学过程或重新实现实验。
以下是一些被确认的证伪,附上发现它的日志本链接:
导言中提到的那篇分页论文。那位没有仔细检查证明过程的审稿人?论文"Towards Optimal Robustness in Learning-Augmented Paging"声称其算法实现了 H_k + O(1) 的鲁棒性。一位参与者的日志本测量了附加项以 0.38 ln k 的速度增长,并定位到了证明中失效的具体步骤。我们自己的重新实现将扫描扩展到 k = 1,024,并在约九倍标准差处确认了这种增长。真正的鲁棒性是 H_k + Θ(log k)。
一个在第 224 步之后崩塌的定理。"Attention's forward pass and Frank-Wolfe" 证明了当原点位于 token 粒子的凸包内部时,token 粒子会收缩到原点。三个独立团队发现了反例,违规首次出现在 t = 224、~3,800 和 6,416 步,这恰好解释了为什么其他所有人都"验证"了这一主张:有限视野检查停止得太早。最干净的反例是用精确的有理算术表述的,因此没有浮点歧义可以躲藏。作者在同一天确认了这一点,并正在修复。
理论用一种 loss 写成,结果用另一种产生。在"Self-Distillation Enables Continual Learning"中,论文的核心方程及其整个理论部分分析的是反向 KL 散度,但发布的代码默认计算的是正向 KL(据作者称,这是产生论文所有结果的设置)。发现这一问题的日志本在作者的代码和数据下也无法复现论文宣称的 +4pp 的 headline 结果。作者已经上传了一个澄清版本到 arXiv。
一个被 padding 稀释的评估。在"Do Transformers Need Three Projections?"中,一位参与者发现约 66% 的评估标签位置是 EOS padding token,这些 token 训练的损失接近于零,使困惑度降低了约三倍。摘要中"50% 缓存减少带来 3.1% 的质量成本"在修正后约为 9.4%。
🚨 错误的证伪。有时我们会在尝试复现的过程中发现缺陷。一份日志本戏剧性地声称"论文的方法比基线慢 2 倍";这原来是复现中的一个算术错误:每轨迹时间与每批 50 的时间进行了比较。正确归一化后,参与者自己的数据证实了论文宣称的 8 倍加速。
我们已开始就每一项确认的发现联系论文作者,措辞很简单:这是我们发现的,这是所有证据,你是否同意或者我们的分析有误?早期的回应非常积极:

到目前为止,多篇论文的作者已确认了发现,两篇 arXiv 更正正在进行中,在其中一个案例中,作者在挑战发现错误前一个月已在新版 arXiv 中悄悄修复了这个错误,我们将其计为独立收敛 🤗
这次黑客松提出的最有趣的问题是:人类在审阅论文中还有角色吗?我们认为是有的,原因如下:
纯 Agent 执行会遇到真正的限制。Agent 会陷入局部循环、误读尺度依赖行为(几份关于分页论文的"已验证"裁决来自在 log-k 增长变得可见之前就停止的检查),偶尔还会在单位不匹配的基础上构建整个证伪。挑战中最可靠的结果来自有人类在引导的工作流程:重新指向 Agent、质疑一个假设,或者在花一周算力之前判断一个实验的前提是错误的。
某些评估在目前是不可替代的人类工作。我们的"人在回路"获胜者就是最清晰的例子。论文声称在极端量化下图像生成稳定。数值指标说"没有崩溃";但图像是否真正可用是一个感知问题。Agent 构建了一个专用的审查 UI,人类亲自判断了所有 128 对图像,注释被提交到仓库,Agent 事后验证其一致性。发布的 Agent 轨迹捕捉了整个交流过程,包括参与者询问审查工具如何工作,然后回来说"我已经检查了这些图像对并把 csv 放到了仓库里,请检查。"
那么作为人类审稿人,我们的角色是什么?我们认为是有效地管理智能。就像教授或首席研究员(PI)建立一个让研究生能够做好工作的环境一样——提供算力、测试框架、数据访问和在适当时候的针对性反馈——那些从 Agent 中获益最多的参与者是那些构建了正确环境并提出正确问题的人,然后让 Agent 执行运行。
感谢加入的 1,221 人、获胜者、以优雅态度回应的作者,以及我们在 Hugging Face 和 alphaXiv 的组织者。挑战的所有日志本、裁决、轨迹和 artifacts 都是公开的,从挑战 Space 开始。我们认为这是迄今为止对机器学习会议进行的规模最大的开放、按主张逐条审计,我们希望这个记录不会保持太久。
敬请期待未来的复现活动。 🤗
文中提到的 Spaces 8
更多文章
DeepSeek-V4:一个百万 token 上下文的 Agent 真正能用的模型
![]()
我们的 Transformers Code Agent 击败了 GAIA 基准 🏅
![]()
![]()
· 注册或登录以评论
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
文中提到的 Spaces 8