实测Qwen3.6-35B-A3B生成速度快2.2倍,但因思考时间长3.1倍实际更慢;25项任务质量持平。
大模型的能力边界正在发生微妙的变化:你的笔记本电脑如今已经可以运行一个能力几乎与云端任何模型相当的模型。我把 Qwen3.8-27B 换到了我的 Agent 里,效果非常出色——但这只"鸟"的飞行方式与飞机截然不同。
这个小小的 Qwen 模型在 Artificial Analysis 的 Intelligence Index 中排名 135 个模型中的第一位,得分 52,比 Z.ai 的 GLM-5.2 高出一分——后者是当时最先进的开源模型,拥有 7530 亿参数。一台笔记本电脑上的模型击败了一个参数量约为自身 28 倍的前沿级云端模型。
大黄蜂是如何做到与大型客机同等飞行的?更大的模型能够存储更多知识,因此可以直接跳到答案——就像一个横跨多个领域的专家。而较小的模型没有记住那么多东西,所以它们必须更多地推理,几乎是从第一性原理出发,来弥合那个差距。
我在对比 DeepSeek V4 云端模型和两款本地模型时亲眼看到了这一点。我在相同的工作上对它们进行了比较:25 个风险投资任务(研究初创公司、总结文章、转录播客),由一个裁判模型评分。
Qwen3.8-27B 是密集模型:它在每个问题上都使用了书中的每一个章节。走马观花式的 DeepSeek 和 Qwen 3.6 35b(我投入测试的另一款本地模型)则只翻到与问题相关的章节。
这些模型给出的答案质量相同。但速度不同。本地 Qwen 35b 以最高速度飞驰,但比云端模型多思考了约 7.2 倍,在 DeepSeek 之后 9 秒才冲出终点线。最新版的 Qwen 模型快了 3 秒,而云端模型则再快 6 秒。
云端模型直接跳到正确答案;本地模型则在不同速度和准确率下进行内部思考和辩论。
举例来说:在一个分诊任务中,35B 用了 993 个 token 才产出六个单词——"Classification: Scheduling / Action: Respond." 在回应前用 1000 个 token 进行思考,就像一只蜂鸟冲向金银花时的冲刺。大黄蜂只需要 369 个思考 token,以一半的速度嗡嗡前行。
本地模型可以达到与云端模型相同的结果,但它们会走一条不同的飞行路线来到达那里。
Artificial Analysis 将这里的领先者 Qwen3.8-27B 排在 Intelligence Index 135 个模型中的第一位,得分 52,比 GLM-5.2 的 51 高出一分——后者是 Z.ai 两个月前发布的 7530 亿参数前沿模型。同一个页面将其排在每个任务输出 token 数的第 23 位(135 个中),160M 加权 token vs 同类中位数 43M。智力排名和冗长排名独立变动,而这正是整篇文章所讨论的权衡。
Artificial Analysis 将这里的领先者 Qwen3.8-27B 排在 Intelligence Index 135 个模型中的第一位,得分 52,比 GLM-5.2 的 51 高出一分——后者是 Z.ai 两个月前发布的 7530 亿参数前沿模型。同一个页面将其排在每个任务输出 token 数的第 23 位(135 个中),160M 加权 token vs 同类中位数 43M。智力排名和冗长排名独立变动,而这正是整篇文章所讨论的权衡。
模仿差距的解释。较小的模型产生的链式思维更流畅,但更可能在逻辑上不一致,因为一旦被迫偏离直接通往答案的路径,它们拥有的附近正确样本地图更加稀疏。参见 Chain of Thought in Large Language Models: Elicited Reasoning or Constrained Imitation?我在 When Models Learn 中涵盖了这种权衡的一般形态,即用推理时计算量换取能力。
模仿差距的解释。较小的模型产生的链式思维更流畅,但更可能在逻辑上不一致,因为一旦被迫偏离直接通往答案的路径,它们拥有的附近正确样本地图更加稀疏。参见 Chain of Thought in Large Language Models: Elicited Reasoning or Constrained Imitation?我在 When Models Learn 中涵盖了这种权衡的一般形态,即用推理时计算量换取能力。
方法。25 个风险投资任务(研究初创公司、总结文章、转录播客),来自我自己的 Agent 队列。一个独立的裁判模型 deepseek-v4-pro 对输出进行盲评,从完整性、准确性和简洁性三个维度打分,各 3 分共 9 分。每次运行的 max_tokens 均为 4096。两款本地模型都通过 Ollama 在同一个 MLX 运行时上运行,因此比较不受运行时差异的干扰。我通过重新评分相同的输出来建立裁判的噪声底,得到平均绝对差为 0.16。
方法。25 个风险投资任务(研究初创公司、总结文章、转录播客),来自我自己的 Agent 队列。一个独立的裁判模型 deepseek-v4-pro 对输出进行盲评,从完整性、准确性和简洁性三个维度打分,各 3 分共 9 分。每次运行的 max_tokens 均为 4096。两款本地模型都通过 Ollama 在同一个 MLX 运行时上运行,因此比较不受运行时差异的干扰。我通过重新评分相同的输出来建立裁判的噪声底,得到平均绝对差为 0.16。
Qwen3.6-35B-A3B 是一个 350 亿参数的模型,每个 token 激活 30 亿参数,是一种稀疏的混合专家架构,共 256 个专家,每个 token 路由 8 个并激活 1 个共享专家。依据 Qwen 在 Hugging Face 上的模型卡和 vLLM 的模型配方。
Qwen3.6-35B-A3B 是一个 350 亿参数的模型,每个 token 激活 30 亿参数,是一种稀疏的混合专家架构,共 256 个专家,每个 token 路由 8 个并激活 1 个共享专家。依据 Qwen 在 Hugging Face 上的模型卡和 vLLM 的模型配方。