SpaceXAI 于 8 月 12 日发布,标尺测试追平 GPT-5.6 Sol Max,coding benchmark 仍有差距;保持 $2/$6 每百万 token 定价不变。
SpaceXAI 刚刚发布了 Grok 4.6。这是一次在 Grok 4.5 基础上的后训练升级,而非更大的基础模型。SpaceXAI 保持了基础模型不变,将改进精力投入到了更长的补充训练轮次、再生监督微调轨迹,以及在 agentic 环境中的强化学习上——目标是训练出能在多个步骤中持续执行任务而不偏离轨道的 Agent。Grok 4.6 在 Artificial Analysis Intelligence Index 上得分 61,比 Grok 4.5 高出 5 分,与 GPT-5.6 Sol Max 持平。该模型支持 50 万个 context token,已在 Cursor 和 Grok Build 中上线,并新增了一个高于 Grok 4.5 推理档位的 xhigh 推理努力级别。
是的,已投入生产,但适用于一组有边界的负载。该模型通过 xAI API 以 grok-4.6 的名称正式可用,是 Grok Build 的默认模型,已登陆所有方案的 Cursor,并可通过 OpenRouter、Vercel 和 Cloudflare 路由。没有开放权重版本,也没有自托管路径,因此气隙部署(air-gapped deployments)无法使用。
公司阶段:种子轮团队和独立开发者可以立即采用,Cursor 和 Grok Build 无需额外工具链工作。中型工程组织是最强匹配场景:API 接入、mTLS 认证、批处理和优先级处理均有文档支持。受监管企业应先进行试点——该供应商的品牌历史在多个采购委员会中仍是实际的采购审查问题。
行业:软件和开发者工具、半导体和内核工程、硬件和 CAD 相邻设计、金融研究、法律分析。训练数据组合明确针对了其中若干行业。
应用场景:仓库级重构、迁移 Agent、基于 50 万 token 语料库的研究与综合流程、从产品简报生成应用脚手架、GPU 内核优化,以及文档密集型的知识工作。
Grok 4.6 不是更大的基础模型。SpaceXAI 描述的是比 Grok 4.5 更长的补充训练轮次,使用了精挑细选的模型生成数据来覆盖推理和高级技术概念、高质量工程数据,以及改进的优化器和训练配方。
然后用 Grok 4.5 再生了跨推理努力级别、agent 工具链以及涵盖 STEM、软件工程和知识工作领域监督微调轨迹,用基于模型的检查过滤掉了有问题的轨迹。随后在涵盖知识工作、一般编程、Web 开发、计算机辅助设计和内核优化的 agentic 环境中进行了强化学习。
一个重要的行为洞察是:在更长的轨迹上,SpaceXAI 报告了更多的自我测试和验证行为,模型在继续下一步之前会检查自己的工作。这是一个来自内部测试的供应商观察,而非独立测量的结果。
该模型支持 50 万个 context token,接受文本和图像输入,输出仅限文本,没有公布文本输出限制,知识截止日期为 2026 年 2 月 1 日。reasoning_effort 现支持 low、medium、high(默认),以及一个新的 xhigh 级别。SpaceXAI 没有公布 Grok 4.6 的参数数量。
在 xAI 的发布榜单上,Grok 4.6(High)在 Artificial Analysis Intelligence Index 上得分 61,较 Grok 4.5 的 56 分提升 5 分,与 GPT-5.6 Sol Max 持平。它在 GDPval-AA v2(1753 Elo,Grok 4.5 为 1526)、AA-Briefcase(1577,Grok 4.5 为 1313)和 Harvey LAB 上领先榜单。
但在工程团队最关心的编程指标上处于落后。DeepSWE v1.1 为 65.9%,较上一代提升 11.9 分,但落后于 GPT-5.6 Sol Max 的 73%。Terminal-Bench v3.0 达到 26%,约为 Grok 4.5 的 15.7% 的两倍,但仍在这四款列出模型的末位。CursorBench v3.2 为 69.9%,FrontierCode v1.1 Extended 为 61.3%,APEX-Agents 为 57.5%。
评估时有两点需要注意。首先,榜单中 GDPval-AA v2 和 AA-Briefcase 的加粗胜利位于 Artificial Analysis 公布的置信区间内——属于统计持平,而非真正的领先。其次,对比集合中不含 Anthropic 的 Claude Opus 5,该模型目前在该指数上排名第一。所披露的落后项是更可靠的信号。
根据发布说明,Grok 4.6 在 20 万 prompt token 以下的价格为每 100 万 token $2 / $0.50 / $6(输入 / 缓存输入 / 输出),超过该阈值后为 $4 / $1 / $12。发布页面还提到了一个双倍价格的更快变体,但没有公布单独模型 ID。Grok Build 和 Cursor 首周提供 2 倍的赠送用量。
团队应设置 prompt_cache_key(或在 Chat Completions 上设置 x-grok-conv-id header)。没有它的情况下,请求会分散到不同服务器上,缓存命中率变得不可靠,从而适用全额输入价格。
Grok 4.6 是 Grok 4.5 的后训练升级,不是更大的基础模型。
50 万 context,支持文本和图像输入,新增 xhigh 推理努力级别。
在 AA Intelligence Index 上与 GPT-5.6 Sol Max 持平(61 分);在 DeepSWE 和 Terminal-Bench 上落后。
同样的 $2 / $6 标称价格,超过 20 万 prompt token 后费率翻倍。
今日可通过 API、Cursor 和 Grok Build 使用——无开放权重,无自托管。