深度对比两大推理模型在能力与成本的差异,直接影响程序员的 AI 工具选型决策。
自秋季以来,我一直在用 LLM Chess 对模型进行压力测试,到目前为止,除了 OpenAI 的 o1 之外,其他"推理"(或"思维")模型都没有给我留下深刻的印象。我立即启动了这个基准测试,但需要等待几天才能收集足够的数据(API 似乎被限流了,速度非常慢)。
LLM Chess 模拟随机机器人与 LLM 进行的多场游戏。数千个 prompt,数百万个 token,每场游戏都是独特的(不像大多数评估那样有固定的 prompt 集和通过条件)。多个指标被收集并在多次运行中汇总。模型的性能在推理方面进行评估(赢局/平局的百分比)和可引导性/耐久性(模型多久失败一次,无法遵循指令或由于多个错误回复而退出游戏)。
在 o1 之前,LLM 无法在国际象棋中击败随机玩家。GPT-4o?零胜场。Claude 3.5 —— 零胜场。它们要么早期崩溃,要么将游戏拖到 200 步的游戏限制(自动判和)。
然后出现了 o1。OpenAI 的"推理"模型打破了记录:
o1-preview:46.67% 的胜率
其他"推理"模型呢?在 2024 年底 o1 发布后,随之而来的是关于 OpenAI 保密性的争议……关于隐藏的"推理" token 的讨论(看不见却要付费)以及人们因为 OpenAI 怀疑他们试图破解其秘密而被禁用的情况。当时我们看到了 AI 实验室试图复制 o1 的成功,推出"推理"模型。例如 Qwen 的 QwQ、Sky T1。甚至 Google 在 2024 年 12 月发布了他们的实验性 Gemini Thinking 模型。
其他任何"推理"或"思维"模型都无法接近 OpenAI 的模型 —— 它们甚至在基本的指令跟随上也会陷入冗长,只进行几步就退出游戏循环:平均游戏持续 2 到 14 步。以非推理的老旧过时的 GPT-4 Turbo 为例,它平均能持续 192 步(最后因为被随机玩家将军而失败 :)。
2024 年底的这些非 OpenAI 推理模型碰巧是代理模型。这让我对 R1 的期待很低……
事实证明,Deepseek 的推理模型是真家伙。它确实取得了有意义的胜场数,同时保持了相对较少的错误。
R1 表现不错,但不是很好。注意它与 o1 模型相比有多少平局。这是因为 R1 破坏了协议、违反了 prompt 指令,或者幻觉了非法移动(因此被判为失败)。它在指令跟随方面存在困难,容易受到 prompt 变化的影响,随机退出游戏循环。
作为参考,以下是截至 2025 年 1 月的顶级非推理模型:
除了胜场数较多外,推理模型还保持了积极的平均材料差异。国际象棋游戏中的材料数量是所有棋子的加权分数(即一个兵是 1 单位的材料,皇后是 9)。每个玩家开局时的材料数量为 39。评估计算每场游戏结束时的材料差异 —— 如果一个玩家失去的棋子多于他夺取的,差异将是负数。其他非推理模型(和推理"代理")通常有负的或接近 0 的材料差异(如果它们无法推进游戏而破坏循环的话)。
以下是游戏结束时平均材料差异的数字:
我还测试了几个量化版本的蒸馏 R1。Deepseek 的做法是使用完整 R1 模型的输出对多个较小的模型(70B、14B、8B 等)Qwen 2.5 和 Llama 3.1 进行微调。据说他们应该获得了推理能力。输出中还有一个特殊的 <think></think> 部分,将所有推理 token 与最终答案隔离(这是早期思维模型忽略的重要内容)。
此外,我注意到这些模型有时无法正确打开和关闭 think 标签(缺少打开的 <think>)。
Google 也在 R1 发布后的第二天发布了对 Gemini Thinking 的更新!
表现比 12 月的版本好得多!至少现在它是可控的,可以在游戏中持续约 40 步。他们还增加了思维部分的分离,不会让推理 token 膨胀响应。而且,它也是一个思维代理……
奇怪的是,大多数游戏掉线是由于服务器错误(例如某些版权过滤器)或获得空的完成 —— 该模型肯定存在稳定性问题。
某些评论可能仅对登录访问者可见。登录查看所有评论。某些评论已被帖子作者隐藏 —— 了解详情
如需进一步采取行动,你可以考虑屏蔽此人和/或举报滥用