Grok 4.6 持平 GPT-5.6 Sol Max 的 Intelligence Index(61分),但费用低60-80%;关键优势在于任务完成效率(53轮 vs Opus 5的103轮),大幅降低代理运行成本。
TL;DR: xAI 于 2026 年 8 月 12 日发布 Grok 4.6——这是一次后训练升级,而非更大的基础模型——在 Artificial Analysis Intelligence Index(人工智能分析智能指数)上得分恰好与 GPT-5.6 Sol Max 持平(均为 61),而输入 token 收费低约 60%,输出 token 收费低约 80%。打成平手并非最值得关注的部分。真正决定性的数字是轮次效率:Grok 4.6 平均用约 53 轮和约 0.5B 输入 token 解决长时域 agent 任务,而 Claude Opus 5 需要约 103 轮和约 2.0B token。前沿竞争不再是哪家模型最聪明——而是哪家能让 agent 跑任务跑得最便宜。
一个月前,Grok 4.5 于 2026 年 7 月 16 日发布,xAI 已确认下一个版本已在开发中。这一节奏保持了下来:Grok 4.6 于 8 月 12 日落地,与大多数前沿发布不同,它没有声称是一个更大的模型。这是一次纯粹的后训练发力——相同的基础、更长的补充训练运行、重生成的监督微调轨迹,以及在 agent 环境中运行的强化学习(来源:MarkTechPost — SpaceXAI Releases Grok 4.6)。
这个定位很重要。过去一年,前沿发布取决于参数量和基准分数天花板。Grok 4.6 的定位——「与领先者持平,成本只是零头」——反映的是市场已经走过了单纯追求智能的阶段,现在优化的是让一个 agent 在任务上跑上几小时的单位经济学。
xAI 保持了基础模型不变,把预算花在训练配方上:精选的模型生成推理数据、高质量工程数据、改进了的优化器,以及跨知识工作、普通编程、Web 开发、计算机辅助设计和内核优化的强化学习。该模型保持 500K token 的上下文窗口,接受文本和图像输入,并在 Grok 4.5 原有层级之上新增了一个 xhigh 推理 effort 级别(来源:xAI — Grok 4.6)。
值得关注的行为主张是自我验证。xAI 报告,在更长的轨迹上,Grok 4.6 越来越倾向于在继续之前检查自己的工作——这是厂商自述,并非独立测量,但与下方的基准测试结果一致。没有公布参数量,也没有开放权重发布:这是一个仅通过 API 提供的模型,从第一天起就在 Cursor 和 Grok Build 中上线。
在 Artificial Analysis Intelligence Index 上,Grok 4.6 得分 61——比 Grok 4.5 的 56 高出 5 分,与 GPT-5.6 Sol Max(61)持平,落后于 Claude Opus 5(63)和 Claude Fable 5(62)(来源:Artificial Analysis — Grok 4.6 Benchmarks)。
它最强的表现在 agent 工作上,而非静态推理。GDPval-AA v2——Artificial Analysis 衡量现实世界 agentic 知识工作的主要指标——达到 1753 Elo,紧随 Claude Opus 5 之后,与 Fable 5 和 Qwen3.8 Max 在统计上难以区分。在 τ³-Banking(多轮客服工具使用)上得分为 50.7%,与 Qwen3.8 Max 的 51.3% 并列前二。在 Terminal-Bench v2.1 上达到 88.4%,与领先者并驾齐驱。
失败之处同样值得注意。在 DeepSWE v1.1——工程团队真正关心的基准——上,Grok 4.6 得分为 65.9%,较上一代提升 11.9 个百分点,但与 GPT-5.6 Sol Max 仍有 7 分的明显差距。在 Terminal-Bench v3.0 上达到 26%,约是 Grok 4.5 的 15.7% 的两倍,但在列出四款模型中仍排名末尾(来源:MarkTechPost — SpaceXAI Releases Grok 4.6)。诚实的解读是:xAI 以低成本买到了 agent 能力,但深度编程可靠性尚未达到。
这个数字重新定义了整个发布。在 AA-Briefcase——Artificial Analysis 的长时域 agentic 知识工作私有基准——上,Grok 4.6 以 1577 Elo 首次亮相,达到 Fable 5 水平,但达到该答案仅需约 53 轮和约 0.5B 输入 token,而 Claude Opus 5(max)需要约 103 轮和约 2.0B token(来源:Artificial Analysis — Grok 4.6 Benchmarks)。
减半的轮次,四分之一的输入 token。长 agent 运行使上下文以指数级累积,因此一个用少四倍上下文达到相近答案的模型,其成本优势在其标价之外会成倍放大。每任务实测成本为 $0.84——与略微更智能的开源权重模型 Kimi K3 基本持平,使 Grok 4.6 落在整个 Intelligence Index 的帕累托前沿上。
标称定价维持在每百万输入/输出 token $2/$6——较 Claude Opus 5($5/$25)输入低 60%、输出低 80%,较 GPT-5.6 Sol($5/$30)在推理负载占主导的输出维度低 80%。但有一个值得建模的陷阱:超过 200K prompt token 时,费率翻倍至 $4/$12,且适用于整个请求;缓存输入定价悄然从 $0.30 升至 $0.50(来源:Netalith — Grok 4.6 Explained)。对于该模型所针对的超长上下文负载,「半价」的说法有所软化。
Grok 4.6 锐化了整个夏季一直在酝酿的战略分裂。一派——Meta 的 Muse Glimmer 和 Moonshot 的 Kimi K3——押注开放权重和本地部署。另一派——xAI、OpenAI、Anthropic——押注仅 API 封闭模型,通过集成工具链和托管定价取胜。Grok 4.6 明确属于后者:没有自托管路径,没有权重,但第一天就在 Cursor、Grok Build、OpenRouter、Vercel 和 Cloudflare 上可用。
持久性问题是这个发布能否撑过自己的路线图。据报道 Grok 4.7——一个更大的 2.1 万亿参数架构——预计在数周内发布,Grok 5 目标在 2026 年底前实现(来源:DEV Community — Grok 4.6 for Agent Builders)。如果成真,Grok 4.6 是一个过渡发布:xAI 在并行运行两个实验——更大的基础能带来多少,以及仅靠后训练能榨出多少。
Grok 4.6 真的和 GPT-5.6 Sol 一样智能吗?在综合 Intelligence Index 上它们持平于 61,但 Profile 不同。Grok 4.6 在 agentic 评测上领先(GDPval-AA v2、τ³-Banking),在深度编程上落后(DeepSWE、Terminal-Bench v3.0)。「一样智能」完全取决于任务。
它到底便宜多少?每百万输入/输出 token $2/$6 对比 Opus 5 的 $5/$25 和 Sol 的 $5/$30。输入低 60%、输出低 80%——但超过 200K prompt token 时费率翻倍至 $4/$12,且适用于整个请求。
它是开放权重吗?不是。它仅通过 xAI、Cursor、Grok Build 和合作伙伴平台提供 API。如果你需要本地或气隙部署,请改看 Kimi K3 或 Muse Glimmer。
Grok 4.7 呢?预计数周内发布,据报道是约 2.1T 参数架构。Grok 4.6 可能是一个短命的过渡发布,所以请围绕 API 端点而非特定冻结版本来做规划。
来源:
Artificial Analysis — Grok 4.6 benchmarks and analysis
MarkTechPost — SpaceXAI Releases Grok 4.6
xAI — Grok 4.6 announcement
Netalith — Grok 4.6 pricing, benchmarks, and what's actually new
DEV Community — Grok 4.6: what it means for agent builders
Cet article a été initialement publié sur The Agent Report.