SpaceXAI不到一个月内连发两代版本,新版称可研究X平台帖子并进行深度推理,训练策略上选择利用被业界视为废料的数据。
We’re so glad you’re here. You can expect all the best TNS content to arrive Monday through Friday to keep you on top of the news and at the top of your game.
Check your inbox for a confirmation email where you can adjust your preferences and even join additional groups.
Follow TNS on your favorite social media networks.
Become a TNS follower on LinkedIn.
Check out the latest featured and trending stories while you wait for your first TNS newsletter.
SpaceXAI 于周三发布了 Grok 4.6,距离 Grok 4.5 推出不到一个月。该公司表示,Grok 4.6 能够研究陌生领域、深入大型代码库工作,以及将产品想法转化为可运行的应用程序。SpaceXAI 还发现,在处理较长任务时,Grok 4.6 会更频繁地检查自身工作,不过这些结果尚未经过独立验证。
但 Grok 4.6 的训练方式反映了编码模型竞赛中的一次转变。第一次就生成正确代码仍然重要,但发现错误、修复错误并继续推进而不偏离原始任务同样重要。
第一次就生成正确代码仍然重要,但发现错误、修复错误并继续推进而不偏离原始任务同样重要。
SpaceXAI 对 Grok 4.6 进行了比其前身更长的补充训练,结合模型生成的推理内容与技术材料以及工程数据。用于更新模型权重的优化器和训练配方也进行了调整。随后使用 Grok 4.5 重新生成了跨越不同推理设置、Agent 工具链以及涵盖 STEM、软件工程和知识工作等领域的监督微调轨迹。使用基于模型的检查移除了有问题的轨迹。
强化学习将这项工作扩展到通用编码、内核优化、Web 开发和计算机辅助设计。模型的奖励依据是完成整个任务,而不仅仅是起草一段看似合理的代码。
SpaceXAI 表示,Grok 4.6 在处理较长任务时更倾向于暂停,并检查自身工作是否真的站得住脚再继续。它还能在早期就生成更强的可视化和交互应用程序,在工作过程中发现并纠正自己的错误。
基准测试更清晰地支持了 Grok 4.6 相比 Grok 4.5 有相当大改进的说法,而不是支持 Grok 4.6 目前是最佳编码模型的主张。
Grok 4.6 在 CursorBench v3.2 上得分为 69.9%,高于 Grok 4.5 的 66.7%。这使其超越了 OpenAI 的 GPT-5.6 Sol Max(67.2%),不过 Anthropic 的 Fable 5 Max 以 70.5% 领先。其 DeepSWE v1.1 分数从 54% 急剧上升至 65.9%,但 GPT-5.6 Sol Max 和 Fable 5 Max 仍以 73% 和 70% 领先。在 FrontierCode v1.1 Extended 上,Grok 表现更好,其 61.3% 的分数略高于 Sol 的 60.6%,但仍低于 Fable 的 63.6%。
Terminal-Bench v3.0 对 Grok 来说是更艰难的考验。其分数从 15.7% 上升至 26%,但 Sol 和 Fable 仍以 34.6% 和 34.1% 遥遥领先。
由于模型选择与周围环境密切相关,这些差异对开发者为他们的 Agent 选择模型非常重要。CursorBench 评估的是由 Cursor 创建的环境中的表现,Cursor 也是参与 Grok 训练的一家公司。DeepSWE 和 Terminal-Bench 评估仓库工作、终端使用和扩展问题解决的各种组合。
Grok 在 APEX-Agents 上实现了最大幅度的提升之一,从 47.1% 增至 57.5%。这使其略微超越了 56.7% 的 Sol Max,但仍落后于 59.2% 的 Fable 5 Max。在 APEX-SWE 上,Grok 的分数从 53.6% 升至 56.4%,而 Fable 达到 58.8%。
其 Artificial Analysis Intelligence Index 分数上升了 5 点达到 61,与 GPT-5.6 Sol Max 持平,但落后于 Claude Opus 5 和 Fable 5。在较长任务上获得了最大收益,而 Sol 和 Fable 在多项编码和终端测试中仍然表现更好。
Token price versus task cost
一个 Token 价格低廉的模型,如果反复调用工具、重新读取文件或重启任务,仍可能产生高昂成本。
Grok 4.6 保持了与 Grok 4.5 相同的官方 API 定价:每百万输入 Token 2 美元,每百万输出 Token 6 美元。更快的变体价格是的两倍。
在不考虑推理 Token、缓存、重试和工具使用差异的情况下,这一一定价使标准模型不到 GPT-5.6 Sol Max API 成本的一半。对于长时间运行的 Agent,Token 费率只是总成本的一部分。
一个 Token 价格低廉的模型,如果反复调用工具、重新读取文件或重启任务,仍可能产生高昂成本。相反,一个更昂贵的模型如果能以更少的步骤完成任务,可能更具成本效益。随着行业逐渐摆脱无限制的 AI 编码预算,衡量完成整个工作的成本比单独比较 Token 价格更重要。
Artificial Analysis 将 Grok 4.6 置于其 Intelligence-versus-Cost-per-Task Pareto 前沿,每项任务成本为 0.84 美元。GPT-5.6 Luna、GLM-5.2 和 Meta 的 Muse Spark 1.2 等几个模型的每任务成本更低,但未能达到 Grok 4.6 的 Intelligence Index 分数。
同一测试还揭示了 AA-Briefcase(一个用于长时间运行专业任务的私有基准)在资源使用上的显著差异。Grok 4.6 约用了 53 轮完成评估,消耗约 5 亿输入 Token。Claude Opus 5 Max 需要约 103 轮和 20 亿输入 Token。
Grok 4.6 可通过 SpaceXAI API、OpenRouter、Vercel 和 Cloudflare 获取。也可以通过 SpaceX 最近收购的 Grok Build 和 Cursor 访问。
Grok Build 是 SpaceXAI 对标 Anthropic 的 Claude Code 和 OpenAI 的 Codex 的产品,包含在每月 30 美元的 SuperGrok 套餐中。SpaceXAI 在模型发布的第一周内在 Cursor 和 Grok Build 中提供双倍的 Grok 4.6 使用额度。
此次发布适逢 Grok 4.5 于七月推出之后,也恰在 Grok Bot 推出一天之后——Grok Bot 是一个用于将持续性任务分配给持久 Agent 的系统。
collectively, these releases indicate that SpaceXAI is moving beyond a chatbot model toward building the infrastructure needed to support long-running agents.
collectively, these releases indicate that SpaceXAI is moving beyond a chatbot model toward building the infrastructure needed to support long-running agents.