Grok 4.7定位为可连续运行数小时的编程Agent,但实测大多数场景下仍会中途失败,对需要长时间自动化编程任务的开发者有直接警示作用。
一个能连续运行数小时的编程 Agent,在编辑文件、运行测试、处理错误的过程中会做出数十个决策。只要其中一个环节出错,就会一路传导到后续任务,除非 Agent 自己能发现并纠正。SpaceXAI 看起来正是针对这个问题在训练 Grok。
该公司于周日发布了 Grok 4.7,其训练方法独具特色。SpaceXAI 采用了一次更长的强化学习训练_run,有意向更难的任务倾斜,包括那些需要"数小时"才能完成的问题。该公司表示,训练还让 Grok 在验证自身工作和管理更长上下文方面表现得更好。
Agent 每失败一次尝试,都会给模型增加更多的历史记录需要处理,而一个错误的假设可以一直跟着它贯穿整个任务。SpaceXAI 试图通过更好的上下文管理和自我验证来解决这个问题,这样 Grok 就能在错误的基础上继续构建之前将其捕获。
SpaceXAI 采用了一次更长的强化学习训练,有意向更难的任务倾斜,包括那些需要"数小时"才能完成的问题。
Grok 4.7 在 Terminal-Bench 4.0 上得分为 38.0%,相比 Grok 4.6 的 20.3% 有所提升。在 CursorBench 4.0 上也实现了进步,该基准测试在编辑器内测试更长时间运行的编程工作流,从 40.4% 提升到 46.3%,在 AA Briefcase v1.1(多小时专业工作评估)上从 1,546 提升到 1,657。
作为参考,Anthropic 的 Claude Fable 5.1 在 Terminal-Bench 4.0 上的得分为 57.9%;Grok 4.7 在这项上仍然落后于 Fable 5.1。更值得关注的是它相比 Grok 4.6 的进步幅度。SpaceXAI 表示,进步来自于将更大的基础模型与一次扩展的强化学习训练相结合,训练内容有意向更难的多小时问题倾斜,而且该模型在两个对长时执行至关重要的能力上特别有所提升:自我验证和长上下文管理。
一个无人值守连续运行数小时的 Agent,必须在不断增长的交互历史中保持跟踪,同时检查每个步骤是否有效,然后再进入下一步。这些问题在最近针对私有代码库的基准测试中暴露出来,即使表现最好的模型失败率也超过 60%。SpaceXAI 表示 Grok 4.7 在上下文管理和自我验证两方面都有提升,尽管没有透露具体方法。该公司没有披露上下文收益是来自架构变更、摘要、检索还是更好的长序列保留,也没有透露在强化学习过程中如何评估自我验证。
一个无人值守连续运行数小时的 Agent,必须在不断增长的交互历史中保持跟踪,同时检查每个步骤是否有效,然后再进入下一步。
SpaceXAI 训练 Grok 4.7 原生理解 Grok Bot harness,让模型与周围基础设施结合得更紧密。
Agent harness 处理模型周围的工作,包括暴露工具、格式化终端响应、将执行结果反馈到上下文、以及决定接下来发生什么。OpenAI 上周采取了类似方法,将 Codex harness 开放为 Agents API,将长时间运行 Agent 背后的基础设施变成托管服务。
借助 Grok 4.7,SpaceXAI 将部分这种集成推入到训练阶段。一个已经熟悉其 harness 的模型,不需要在运行时通过提示学习每种工具格式和交互模式。这可以减少工具使用和多步执行的开销,尽管 SpaceXAI 没有公布足够多的细节来展示 Grok 4.7 的性能提升有多少来自 harness 特定的训练。
围绕特定工具 schema、上下文格式和执行环境训练模型,可能会使开发者在不牺牲 Agent 性能的情况下更换模型变得更加困难。
随着 Agent 承担更多开发生命周期,这个问题的严重性会增加。Google 最近让 AI Agent 更易于处理 Go 所做的工作采取了不同方法,改变的是开发环境而非模型。在这两种情况下,模型不再是唯一被优化的部分。围绕它的系统也在改变。
围绕特定工具 schema、上下文格式和执行环境训练模型,可能会使开发者在不牺牲 Agent 性能的情况下更换模型变得更加困难。
Grok 4.7 定价为每百万输入 token 2 美元,每百万输出 token 6 美元。在这个价格下,多小时 Agent 运行的成本可能更低,但可靠性仍然是问题。Grok 4.7 在 Terminal-Bench 上得分为 38.0%,而 Fable 5.1 达到 57.9%。