讨论大语言模型合并率的改进现状,较为专业的技术讨论但对普通开发者的实际应用价值有限。
我在阅读 metr 的文章,其中讨论了 LLM 代码通过测试的频率远高于其合并质量。他们观察了 LLM 在编程时的表现,比较了两种成功标准:一种是"通过所有测试",另一种是"会被维护者批准合并"。不出所料,在更严苛的成功标准下,LLM 的表现差得多。他们的 50% 成功达成时间从 50 分钟缩短到 8 分钟。
作为其中的一部分,他们包含了这样的图表:
但这些数据有些地方让我觉得奇怪。让我们只看更有价值的数据——合并率。
什么样的直线最能描述这些数据?metr 提出的曲线略微向上倾斜。但这是我看到的:
在 2024 年年底的某个时点,我们可能经历了一次能力的跃升,但这个图表没有显示出自 2025 年初以来合并率有任何实际改进的证据。
Fisher 警告我们不要凭眼睛观察图表,所以让我们更严谨地处理。我们将使用留一法交叉验证,比较 metr 提议的线性斜率和图表暗示的阶跃函数。
Brier 分数是一种平方误差形式,因此越低越好。这意味着阶跃函数比线性斜率有更强的预测能力("拟合得更好")。为了娱乐,我们也可以拟合一个在整个时间跨度内完全恒定的函数。它碰巧获得了最好的 Brier 分数。
停下来想想这意味着什么:在图表后半部分预测恒定合并率的两个模型比线性增长趋势更准确。11 而且比逻辑趋势更准确,因为在这个概率值范围内,对数几率的线性基本上等于概率的线性。这印证了我们在图表中看到的:合并率在图表后半部分没有增加。
这意味着 LLM 在编程能力方面已经一年多没有改进了。这不是很疯狂吗?为什么没人讨论这个?
后记:我听说在 metr 图表结束和今天这四个月间,出现了另一次能力的跃升(由更新的 Anthropic 和 Google 模型实现),但我们没有明确的证据,因为没有人像 metr 那样仔细测量过 Sonnet 4.5 以后模型的合并率。
可能确实出现了一次能力的明显跃升。但另一方面,人们在整个 2025 年都声称有这种情况,而现在我们看到,那时并不是真的。在 2025 年期间,炒作和实际性能之间的差距比我们想象的要大。现在是这样吗?我不知道。但这正是我觉得有趣的地方。