xAI 发布 Grok 4.6,定位为长时间运行 Agent 和复杂交互/视觉工作场景,在 Artificial Analysis 综合指数上与 GPT-5.6 Sol 持平,输入 $2/M 输出 $6/M,已上线 Cursor 和 Grok Build。
2026 年 8 月 12 日,xAI 发布 Grok 4.6,这是 7 月 Grok 4.5 的后继版本。这次发布的定位与上一次不同。这次并没有主打原始智能的跃升,而是一款为长时间运行的 Agent 和大刀阔斧的交互式、视觉化工作打造的模型:跨多步研究一个主题、在代码库中穿梭工作,或者把一个粗略的产品构想打磨成精致的第一版。
官方主打的数据比较克制。xAI 表示,Grok 4.6 在 Artificial Analysis Intelligence Index(九项基准测试的综合指数)上与 GPT-5.6 Sol 持平。在其余已公布的所有评估中,Grok 4.6 与 GPT-5.6 Sol 和 Anthropic 的 Fable 5 互有胜负,各有领先和落后。定价为每百万输入 token 2 美元、每百万输出 token 6 美元,更快的版本价格翻倍。
我靠用 Spring AI 构建 AI Agent 为生,所以最先关注的就是这个 Agent 化的定位。下面是这次发布实际包含了什么、数字在哪些地方站得住脚,以及它对前沿竞争意味着什么。
官方公告对模型规模着墨甚少,大篇幅都在讲训练。公告从未提及参数数量。此前的报道说法不一:有报告指出沿用了与 Grok 4.5 相同的 1.5T V9 基座,仅做了大量后训练;也有报告指向更大的 2T 模型。无论哪种情况,xAI 的口径都是——这次发布重点在训练配方,而非模型规模。
公司实际描述的内容如下:
最值得关注的是行为层面的说法。xAI 表示,在更长的轨迹上,开始观察到更多的自我测试和验证行为——模型在继续之前会检查自己的输出。对于视觉和交互式项目,Grok 4.6 比 Grok 4.5 产生更强力的第一版输出,能够一次到位建立应用的结构和视觉语言,而不必经历多轮迭代。
xAI 发布了十项评估,将 Grok 4.6 与 Grok 4.5、GPT-5.6 Sol Max 和 Fable 5 Max 进行对比。对手的数字来自已发布的技术报告和排行榜,所有数据均为自报,因此请将这些数字视为方向性参考。
AA Intelligence Index:61,与 GPT-5.6 Sol Max(61)持平,落后 Fable 5 Max(62)1 分,领先 Grok 4.5 High(56)5 分。
GDPVal-AA v2:1753,四者中最高。
CursorBench v3.2:69.9%,落后 Fable 5 Max(70.5%),领先 GPT-5.6 Sol Max(67.2%)。
FrontierCode v1.1(Extended):61.3%,领先 GPT-5.6 Sol Max(60.6%),落后 Fable 5 Max(63.6%)。
DeepSWE v1.1:65.9%,与 GPT-5.6 Sol Max(73%)和 Fable 5 Max(70%)存在明显差距。这是相对表现最弱的一项。
Terminal-Bench v3.0:26%,大幅落后于两个竞争对手(34.6% 和 34.1%)。
APEX-Agents:57.5%,处于两者之间。
APEX-SWE:56.4%,落后 Fable 5 Max(58.8%)。
AA-Briefcase:1577,以微弱优势领先 Fable 5 Max(1574)。
Harvey LAB(Vals):15.8%,轻松超越两个竞争对手。
Grok 4.6 在所有基准测试上都大幅领先 Grok 4.5 High。与顶尖梯队相比,格局喜忧参半:在 GDPVal-AA、AA-Briefcase 和 Harvey LAB 上胜出,在综合指数上持平,在 DeepSWE 和 Terminal-Bench 上明显落败。最后一项不可忽视。Terminal-Bench 衡量的是真实终端工作,26% 对阵 34% 不是一个四舍五入的误差。
Grok 4.6 起步价为每百万输入 token 2 美元、每百万输出 token 6 美元。更快的版本价格翻倍。xAI 将其定调为"大约只有可比前沿模型定价的一半",而定价这部分无需任何基准测试解读。
即日起已在 Cursor 和 Grok Build 上线,并通过 API 提供,渠道包括 console.x.ai、OpenRouter、Vercel 和 Cloudflare 等合作伙伴。第一周,xAI 在 Grok Build 和 Cursor 提供双倍的包含用量。
Grok 4.5 于 2026 年 7 月 16 日发布,Musk 两天后确认 4.6 已在开发中。他的公开时间表显示 4.6 在两周内发布、4.7 在四周内发布,而 8 月初的一次泄露指出 4.7 将携带更大的 2.1T 架构。如果属实,4.6 是后训练版本,4.7 才是规模跃升。xAI 同时在跑两个实验:在一个现有基座上能榨取多少,以及更大的基座在此基础上能带来多少增益。
xAI 选择公布哪些基准测试本身就是一个表态。DeepSWE、CursorBench、Terminal-Bench、APEX、AA-Briefcase:这些都是 Agent 化和编码评估,而非一年前主导发布会的知识和数学基准。前沿的讨论已经转向长时域 Agent 工作,每个实验室现在都在为之优化。
对于正在交付 Agent 功能的人来说,这次发布中有两点值得付诸行动。
第一,自我验证行为。一个在长轨迹上能检查自己输出的模型,会改变你的测试框架需要做的事。无需在每个工具调用外层包手动验证,而是可以让模型自己捕获错误,把你的检查留给真正关键的接缝处。这是我自己在 Spring AI Agent 中最在意的模式:act、observe、verify 的循环,Agent 要么在这里证明自己的价值,要么在这里崩盘。
第二,价格。长时域 Agent 运行消耗 token 的方式与短 prompt 完全不同。每次重试和每次工具调用失败都是一次新的请求。以每百万 token 2 美元和 6 美元的价格,更快版本价格翻倍,长时域任务让 Agent 持续工作的性价比高于前沿模型的通常水平。
注意事项是真实的。基准测试是自报的,Terminal-Bench 显示了真实的弱点,而且模型在所有平台同步上线:Cursor、Grok Build、API 和各个合作伙伴平台。Agent 化相关分数需要在你的脚手架里复现才有意义。但对于一个明确以长时域 Agent 为核心的发布而言,强劲的 Agent 化评估、半价 token,以及建立在验证基础上的训练叙事,这是一个实实在在的进步。
官方公告有完整的基准测试表格,OfficeChai 的解析也逐条梳理了同样的数字。如果你正在构建 Agent,Grok 4.6 值得在这周测试一下,尤其在双倍用量优惠还在的时候。你会先拿它跑哪个 Agent 工作负载?