付费用户反映 Grok Build 存在静默行为变更、终端无法复制错误信息等问题,被评价为「上一代编程模型」。揭示了 xAI 编程 Agent 相比 Claude Code 等竞品的实际差距。
"Grok Build 就像是上一代的代码模型。"
这是 r/grok 上的一条 Reddit 帖子,发帖人真金白银掏了 99 美元体验 SuperGrok Heavy。
另一位评论者也讲了自己的经历:花三个小时在现有代码库上跑 Grok Build,看着它悄无声息地改变了行为,没有任何提示。不是输出错误。
而是用户偶然才发现的——一次静默的行为漂移。
然后还有个更离谱的:终端里压根不支持复制粘贴错误信息。
这就是 xAI 重磅编程 agent 产品的开局。Grok Build 于 2026 年 5 月 25 日上线,作为早期 beta 版本。这是一款终端原生的 CLI,直接对标 Claude Code 和 Codex CLI。
营销阵仗很大。Elon 发推了。xAI 官方博客也发了。
一堆科技媒体都跑了标题。但真正的故事发生在大家真正安装之后。
那么争议的焦点在哪里?
Grok Build 不是聊天界面,也不是 VS Code 插件。它跑在你的终端里。你指向一个项目,描述你想要什么,它就规划、搜索代码库、写代码、然后展示 diff 给你 review。
安装只需一行命令:curl -fsSL https://x.ai/cli/install.sh | bash。用你的 xAI 账号认证,然后就进去了。
默认模式是 Plan Mode。在动手修改任何文件之前,Grok Build 会提出一个分步骤的计划。你批准后,它可以针对单个步骤发表评论,或直接重写整个计划。
在你签字确认之前,什么都不会执行。这直接解决了开发者对编程 agent 最厌恶的问题。
它解决的问题是这样的:agent 做了某个错误操作,等你发现的时候下游已经有三处其他改动跟着变了。Plan Mode 在"任务下达"和"代码库被改"之间加了一个检查点。
Claude Code 原生没有这个功能。这是个实实在在的优势。
但架构层面的设计不止于此。Grok Build 最多会派生八个并行子 agent,每个都在独立的 Git worktree 里运行。彼此之间不会踩踏。
一个叫 Arena Mode 的评估层会在你 review 之前对竞争性输出打分。大型重构如果让一个 agent 来做要花一小时,现在可以分散到多个 agent 在隔离环境中并行处理。
它还内置了 MCP 支持,遵循 AGENTS.md 约定。并支持通过 -p 参数以 headless 模式运行,方便接入 CI 流水线。
xAI 公布 Grok Build 背后模型的 SWE-Bench Verified 得分是 70.8%。Claude Opus 4.7 Adaptive 是 87.6%。OpenAI 的 Codex 是 85%。
差距是 17 个百分点。不是四舍五入的误差,也不是评测方法分歧。
xAI 的回应是基准测试不能完全反映真实工程场景。这话对任何基准测试都成立。但这并不能弥补 17 分的差距。
在简单、范围明确的任务上,这个差距可能感觉不出来。在复杂的多文件工作时,就会表现为更多的失败尝试、更多的 diff 回滚、以及更多的人肉 review 时间。
一位评测者报告在高负载下出现了 hallucinated edits。模糊提示词导致 Dockerfile 损坏。
竞争环境让情况更糟。Codex 已经拥有三百万周活跃用户。Claude Code 已经推动 Anthropic 实现年收入 300 亿美元的经常性收入。
Grok Build 进来的时候没有任何生产历史背书。
定价结构倒是挺有意思的。最初 SuperGrok Heavy 每月 300 美元。随后开放给 SuperGrok 用户每月 30 美元,X Premium Plus 用户每月 40 美元,还有一个 99 美元的促销档位。
Claude Code 统一每月 20 美元。
在 HN 上,情绪很直接。"每月只要 300 美元(也就是每年 3000 美元)。xAI 赌场不管你用不用都要把你的钱拿走。"
另一位用户说:"我不可能每个月花 300 美元买一个我老板绝对不会批准我用的东西。"
API 定价更合理一些。输入 token 每百万 1 美元,输出 token 每百万 2 美元。Grok Build 0.1 模型还通过 OpenRouter 和 Vercel AI Gateway 提供。
但 CLI 本身的订阅模式就很有争议了。每月 30 美元的话还有竞争力。每月 300 美元,面对 20 美元的 Claude Code 就很难卖动了。
TUI 确实令人印象深刻。我原本以为就是个凑合的东西。但 xAI 的一位工程师在 HN 上确认,终端界面是用 Rust 和 Ratatui 写的。
规范的 vim 键绑定。支持鼠标。细致的 alt-screen 渲染。
他们是真的在花功夫让终端体验变得精致。
而且二进制文件是本地优先的。你的源代码、凭证和项目数据都留在你自己的机器上。不会每次操作都传输到 xAI 的服务器。
对于一家完全可以推云端处理方案的公司来说,这是个有意义的取舍。
但有个细节让我停顿了一下:有人指出你无法从 Grok Build 终端复制粘贴错误信息。在一个想要取代你现有编码工作流的工具里,这是个基本的 UX 缺口。
类似这样的细节就是为什么"v0.1"这个版本号很重要的原因。
我花了一下午深挖 HN 帖子、Reddit 评论和评测网站,想搞清楚大家的反馈。结果发现关于 Grok Build 的讨论,不只是关于 Grok Build 本身,而是关于我们整个编程 agent 领域现在处于什么位置。
所有人都对基准测试感到厌倦了。所有人都对发布公告感到厌倦了。大家真正想要的是一个不会静默破坏代码库的工具。
而 Grok Build,尽管架构上很有野心,但它是一个模型还需要追上界面的 v0.1。
架构跑在模型前面了。这是诚实的评价。
如果你已经是 SuperGrok 用户,试一下没什么额外的成本。但如果你要在每月 20 美元的 Claude Code 和每月 30 美元的 Grok Build 之间做选择,基准测试的差距是真实存在的,在复杂任务上你会感受到。
这次研究绕弯让我想起之前花了一个周末用 Bubble Tea 在 Go 里给一个 side project 写 TUI 的经历。花了两天把布局调好,又花了一天搞键绑定,到了周一突然意识到没人在乎它。
我为一个没人有的问题造了工具。
Grok Build 现在的状态差不多就是这样。漂亮的终端,真正的架构思考,但模型可能还需要再训练一次才能配得上那份期待。
但至少 Ratatui 确实能做出漂亮的终端 UI。我对我的 Bubble Tea 实验也可以说同样的话。只是没人在乎。
看人们是不是真的会用 Grok Build 吧。
自掏腰包的独立开发者?每月 30 美元的 Grok Build 值得试试。每月 300 美元的话就不值了。
模型质量还没到位。同样的任务,20 美元的 Claude Code 会给你更多价值。
使用 xAI 基础设施的团队或有 SuperGrok 企业级访问权限的团队?并行子 agent 架构确实有意思。Plan Mode 是个真正的差异化特性。
但你需要接受一个事实:底层模型会产生比 Claude 或 Codex 更多的坏输出。你的团队会花更多时间在 review 上。
构建 agent 编排工具的人?ACP 支持很重要。headless 模式和 API 访问意味着你可以在 Grok Build 之上构建自定义工作流,这在 Claude Code 更有限的自动化表面上更难做到。
对于其他所有人:等下一个模型迭代版本吧。架构是有前景的。
模型需要追上来。这是对现状诚实的评估。
我一直想着那条 Reddit 评论。三個小時看著一個工具悄無聲息地改變代碼行為。用戶是偶然才發現的。
不是因為工具發出了警告。而是因為他們剛好在提交前看了 diff。
這才是 Grok Build 需要解決的真正問題。不是 SWE-Bench 分數。不是定價。
一個在你看起來像是在幫忙、實際上卻在悄悄把事情搞砸的終端 agent,還不如壓根沒有 agent。
Plan Mode 是正確的方向。並行 agent 很酷。
但信任是一次又一次乾淨的 diff 累積出來的。
而現在,Grok Build 還在贏得這份信任的路上。