xAI 的 Grok 4.6 在 Artificial Analysis 指数上与 GPT-5.6 Sol Max 持平(61分),输入token费用低约60%,输出低约80%;且长任务轮次效率更高(平均53轮 vs Opus 5的103轮)。
简报:xAI 于 2026 年 8 月 12 日发布 Grok 4.6——这是一次后训练层面的改进,而非更大的基础模型——在 Artificial Analysis 智能指数(61 分)上与 GPT-5.6 Sol Max 完全持平,同时输入 token 收费约低 60%、输出 token 收费约低 80%。持平并不是最值得关注的点。决定性的数字是轮次效率:Grok 4.6 在长周期 agent 任务中平均以约 53 轮和约 5 亿个输入 token 解决问题,而 Claude Opus 5 需要约 103 轮和约 20 亿个 token。尖端模型的竞争已经不再是看谁拥有最智能的模型——而是看谁能以最低成本运行一个 agent。
一个月前,Grok 4.5 于 2026 年 7 月 16 日发布,xAI 确认下一版本已在开发中。这一节奏得到了保持:Grok 4.6 于 8 月 12 日到来,且与大多数尖端发布不同,它并没有声称是一个更大的模型。这是一次纯粹的后训练推进——相同的基础、更长的训练周期、重建的监督微调轨迹,以及在 agent 环境中的强化学习(来源:MarkTechPost — SpaceXAI 推出 Grok 4.6)。
这一发布策略很重要。过去一年,尖端模型的竞争一直围绕参数量和基准测试天花板展开。Grok 4.6 的定位——"与领先者持平,成本只是零头"——反映的是一个已经超越原始智能、开始优化 agent 工作数小时的单元经济学的市场。
xAI 保持基础模型不变,将预算投入到训练配方上:模型生成并筛选的推理数据、高质量的工程数据、改进的优化器,以及在知识工作、通用编码、Web 开发、计算机辅助设计和内核优化上的强化学习。该模型保留了 500,000 token 的上下文窗口,支持文本和图像输入,并在 Grok 4.5 推出的推理努力等级上增加了 xhigh 级别(来源:xAI — Grok 4.6)。
值得关注的行为声明是自我验证。xAI 指出,在更长的轨迹上,Grok 4.6 在继续下一步之前越来越多地验证自己的工作——这是供应商的观察,而非独立测量,但与以下基准测试结果一致。参数数量未公布,也没有开源权重版本:这是一个仅通过 API 访问的模型,在 Cursor 和 Grok Build 上发布首日即可用。
在 Artificial Analysis 智能指数上,Grok 4.6 获得 61 分——比 Grok 4.5 的 56 分高出 5 分,与 GPT-5.6 Sol Max(61)持平,落后于 Claude Opus 5(63)和 Claude Fable 5(62)(来源:Artificial Analysis — Grok 4.6 基准测试与分析)。
其最佳表现集中在 agent 工作上,而非静态推理。GDPval-AA v2——Artificial Analysis 用于真实场景下知识型 agent 工作的主要指标——达到 1753 Elo,仅次于 Claude Opus 5,与 Fable 5 和 Qwen3.8 Max 在统计上无法区分。在 τ³-Banking(多轮工具使用客服)上,它获得 50.7%,与 Qwen3.8 Max 的 51.3% 并列第一阵营。在 Terminal-Bench v2.1 上,它达到 88.4%,处于领先者水平。
失败与胜利同样具有启发性。在 DeepSWE v1.1——工程团队真正关注的基准——上,Grok 4.6 获得 65.9%,较上一代提升 11.9 分,但与 GPT-5.6 Sol Max 相比有 7 分的明显差距。在 Terminal-Bench v3.0 上,它达到 26%,约为 Grok 4.5 的 15.7% 的两倍,但在列出的四个模型中仍排名末位(来源:MarkTechPost — SpaceXAI 推出 Grok 4.6)。诚实的解读是:xAI 以更低的成本获得了 agent 能力,但深度编码的可靠性尚未到位。
这是重新定义整个发布的数字。在 AA-Briefcase——Artificial Analysis 用于长周期知识型 agent 工作的私有基准——上,Grok 4.6 以 1577 Elo 首次亮相,与 Fable 5 处于同一水平,但达到这一回答仅需约 53 轮和约 5 亿个输入 token,而 Claude Opus 5(max)需要约 103 轮和约 20 亿个 token(来源:Artificial Analysis — Grok 4.6 基准测试与分析)。
轮次减半,输入 token 仅为四分之一。长时 agent 会话以指数级累积上下文,因此一个以少 4 倍的上下文达到相当回答的模型,在超出其目录价格的优势上获得了复合成本收益。按任务衡量的成本为 0.84 美元——与稍低智能的开源模型 Kimi K3 相同,这使 Grok 4.6 处于整个智能指数帕累托前沿上。
公开价格为每百万 token 2 美元/6 美元(输入/输出)——比 Claude Opus 5(5 美元/25 美元)低 60%,在输出维度上比 GPT-5.6 Sol(5 美元/30 美元)低 80%,而输出是重度推理工作负载的主导成本项。但有一个需要建模的陷阱:超过 200,000 token 的提示后,费率翻倍至 4 美元/12 美元,且适用于整个请求;缓存输入的价格也从 0.30 美元悄然升至 0.50 美元(来源:Netalith — Grok 4.6:费率、基准测试和真正的新变化)。对于该模型优化方向的超长上下文工作负载,"半价"的叙事有所削弱。
Grok 4.6 加剧了整个夏季以来逐渐显现的战略分歧。一派——Meta 的 Muse Glimmer 和 Moonshot 的 Kimi K3——押注开源权重和本地部署。另一派——xAI、OpenAI、Anthropic——押注闭源模型、仅通过 API 访问,通过集成工具和托管定价获得优势。Grok 4.6 明确属于第二类:无自托管路径、无权重,但在 Cursor、Grok Build、OpenRouter、Vercel 和 Cloudflare 上发布首日即可用。
可持续性的问题在于这一版本能否在自身的路线图下存活。Grok 4.7——一个更大的架构,公布参数量约 2.1 万亿——预计将在几周内到来,而 Grok 5 的目标是在 2026 年底之前(来源:DEV Community — Grok 4.6:对 agent 开发者的意义)。如果这得到确认,Grok 4.6 是一个过渡版本:xAI 同时进行两个实验——更大基础模型带来什么,以及仅靠后训练能提取出什么。
Grok 4.6 真的和 GPT-5.6 Sol 一样智能吗? 在综合智能指数上,两者以 61 分持平,但侧影不同。Grok 4.6 在 agent 评估上占优(GDPval-AA v2、τ³-Banking),在深度编码上落后(DeepSWE、Terminal-Bench v3.0)。"一样智能"完全取决于任务。
它真的便宜很多吗? 每百万 token 2 美元/6 美元(输入/输出),而 Opus 5 为 5 美元/25 美元,Sol 为 5 美元/30 美元。输入便宜 60%、输出便宜 80%——但超过 200,000 token 提示后,费率翻倍至 4 美元/12 美元,适用于整个请求。
权重是开源的吗? 否。它仅通过 API 访问,来源为 xAI、Cursor、Grok Build 和合作平台。如果你需要本地部署或隔离环境,请转向 Kimi K3 或 Muse Glimmer。
Grok 4.7 呢? 预计几周内到来,架构公布约 2.1 万亿参数。Grok 4.6 可能是一个短暂的过渡版本:因此请根据 API 端点而非精确版本做规划。
来源:
Artificial Analysis — Benchmarks et analyse de Grok 4.6
MarkTechPost — SpaceXAI lance Grok 4.6
xAI — Annonce de Grok 4.6
Netalith — Grok 4.6 : tarifs, benchmarks et vraies nouveautés
DEV Community — Grok 4.6 : ce que cela signifie pour les développeurs d'agents
本文最初发表于 The Agent Report。