Grok 4.6通过更长的补充训练和强化学习微调实现能力提升,Artificial Analysis指数提升5分至61,与GPT-5.6 Sol Max持平,Terminal-Bench几乎翻倍。关键在于推理成本未变——提升来自权重编排而非参数规模。
SpaceXAI 本周发布了 Grok 4.6,而我一直在回味的细节不是某个 benchmark,而是他们没有做的事:底下没有更大的基础模型。Grok 4.6 就是 Grok 4.5 加上了一次更长的补充训练、重新生成的微调轨迹,以及在 agentic 环境中的强化学习。同一套底座,更好的教育。
这次"教育"带来了不少收获。Artificial Analysis Intelligence Index 提升了 5 分——目前达到 61,与 GPT-5.6 Sol Max 并列,超过了 Kimi K3。Terminal-Bench v3 从 15.7% 升至 26%,几乎翻倍。而定价纹丝不动:每百万 token 2 美元/6 美元,比 Sol 的费率低约 60%,当然有常规的附加条款(超过 200K prompt token 后费率翻倍,而且"快速"版本贵一倍)。

多年来,更好的模型的路线图是更大的模型,而更大的模型运行成本更高,所以能力和价格一路同步攀升。后训练升级打破了这个关联:推理成本和以前一样,因为它就是同一个模型。这就是为什么你能看到分数跃升 5 分而定价不变——提升在于权重的排列方式,而非权重的数量。
如果你留心观察,业界也能看到同样的动向。今年的收益持续来自 RL 在 agentic 环境中的应用、来自更好的轨迹数据、来自更长的精调轮次——而非参数数量,后者已经没人再拿出来吹了。(阿里巴巴上周披露的 2.4T 参数倒是引人注目,主要是因为这种披露已经变得罕见了。)前沿战场正悄然演变为一场课程设计的竞争。
对于我们这些购买 token 的人来说,这再好不过:每美元的能力持续提升,还不用承受迁移到新模型家族的痛苦。Grok 4.6 发布的当天就落地到了 Cursor 和 API——同一套接口、同一个价格、更好的答案,如果愿意更刻意地花费,还有一个新增的 xhigh 推理力度层级。
此次发布的重点是长时运行的 agents——500K context 以及专门在 agentic 环境中做的 RL。Terminal-Bench 翻倍就是支撑证据,而这个数字恰恰是我最不信任、又最希望得到验证的那个,原因是熟悉的:agentic benchmark 对测试框架细节极其敏感,而厂商自己跑的 agentic benchmark 更是如此。
但请注意这个赌注的形态。xAI 本轮没有把训练预算花在 trivia 或数学上;他们花在了工具使用、错误恢复和多步骤工作上。Meta 对 Muse Glimmer 的 agent tuning 也是如此。阿里巴巴对 Qwen 的 computer-use 分数也是如此。每家实验室现在都在为"循环"而训练,因为循环正是 token 消费量最大的地方。模型正越来越多地被 agents 的需求所塑造——这意味着对你重要的 benchmark 是 agentic 那些,而那些恰恰是最难从一篇新闻稿中取信的。
两个实际建议。第一,如果你已经在不同模型层级之间做路由,Grok 4.6 的 2/6 美元定位与 Sonnet 5 和 Qwen3.8-Max 同一档位——"有能力的中间层级"现在真正拥挤起来了,而中间层级本来就是大多数 agent 流量应该跑的地方。我上周写的价格战正从新的方向持续升级。
第二,关注模式而非产品。当前沿级的能力通过后训练以不变的价格在一个月内出现第二次时,教训是:今天"足够好"的层级将在一个季度后明显变得更好,而你无需改动一行代码。为模型可替换性做架构——与以往一样的结论,只是从又一个角度抵达。
需要明确的是,这里没有开放权重——只有 API、Cursor、OpenRouter 及同类平台。如果你已经在真实的长时任务上跑过它,评论区敞开;我特别想了解 500K context 在深度上是否能保持连贯,还是只是塞得下而已。
研究和起草过程有 AI 辅助;所有测试、观点和最终编辑均为本人自主完成。