前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9369
  • PostgreSQL pgvector混合搜索实战:向量相似度+全文关键词融合
  • 新版Claude不再需要"Think Step by Step":Osmani提示指南解读
  • CodeSmith三区架构:解决prefix drift导致Token重计费问题
  • 像读流水线一样读Transformer Block
  • Cloudflare OS:面向 AI 原生的企业工作台开源
  • AI 编程工具正在泄露凭据:Cursor、Claude Code、Copilot 和 MCP 均有风险
  • prompt-shelf:在 Claude Code 里暂存草稿、临时想法和常用 prompt
  • Agenshive:AI agent 专属 Q&A 平台,用执行验证替代投票
  • 评审容量已成交付新瓶颈:打字快不等于交付快
  • AI Agent 让 CI 成为瓶颈,加速流水线是错误解法
  • Claude Code Mods 沙箱机制深度解析
  • MCP 协议安全:Agent 工具调用的运行时攻击面
  • Node.js多LLM提供商集成实战:统一输出契约与回退策略
  • Google RRSI 方法:防止自改进 AI Agent 记忆测试任务
  • DeepSeek Harness v0.2支持Claude Code Mods兼容层
  • MCP协议深度解析:AI工具集成标准现状与局限
  • 生产级LLM Gateway四个关键设计决策
  • MCP JSON 配置优化:同步一次节省 98% Discovery Token
  • Agent 静默失败代价 2500-8000 美元:用权威系统交叉验证代替执行日志
  • Agent 静默失败导致数千美元损失:如何用外部核查机制堵漏
  • Grok Build 真实用户体验:宣传与实际的落差
  • 两个面向AI Agent的x402 API:页面质量检测与成本计算
  • AI幻觉报告泛滥,谷歌暂停开源漏洞奖励计划
  • Rust成为微软内部一级语言,与C++/C#并列
  • 生产级Agentic RAG系统实战课程
  • Claude-Mem:让AI编程工具跨会话持久记忆
  • Google Gemini 调整分层策略:免费用户只能用量最小的 Flash-Lite
  • 积分系统设计中没人会纳入预算的工程细节
  • Agenthof:用控制面让 AI Agent 的每次调用都有审计可查
  • Claude Code Mods 发布:Agent 变成可扩展平台
  • ThinkingBox:Benchmark 专门捕获 AI Agent「说完成但没做完」
  • 5 个 JSON Schema 将 AI 编程智能体的输出质量管起来
  • DeepSeek Harness v0.2 发布官方桌面客户端
  • Redis 作者新项目 DwarfStar:消费级硬件运行 DeepSeek V4
  • Chalkboard:用可视化面板追踪 AI Agent 修改过程的 Electron 工具
  • Agent PR 合并率 90% 仍可能掩盖工程工作流弱点
  • AI API 定价的隐藏成本:system prompt token 开销常被低估
  • MacBook Pro外接iPhone加速LLM推理:预填充最高提效44%
  • MCP 传输协议对比:stdio 与远程 HTTP 怎么选
  • 远程 MCP 服务器的 OAuth 2.1 认证完整指南
  • Agent报告完成但数据库未写入:分布式一致性的典型陷阱
  • Kiro Workflows:多 Agent 编排的声明式工作流框架
  • 我用AI当助产士:程序员用LLM记录分析分娩全程
  • Nocturne:可自编辑记忆的 Agent,支持遗忘策略与召回验证
  • 零依赖 Pre-commit 守卫:防止 Cursor/Claude Code 破坏整洁架构
  • Claude官方指南:如何充分释放Opus 5.5在Claude和Claude Code中的性能
  • Claude Code 接入第三方模型作子代理,省 Token 新思路
  • OpenAPI 规范一键转 MCP Server 的具体映射方法
  • 编码 Agent 权限安全:黑名单漏过 46/75 提示注入,能力边界放过 3 成
  • AI编程代理成本实测:token单价低不等于任务成本低
  • 我用 Diff Budget 约束 AI 编码 Agent 的范围蔓延
  • 已加载 51 / 9369
8.0
热点
AI SCORE
编程提效2026-10-04 17:13

Grok Build 真实用户体验:宣传与实际的落差

dev.to · AI#Grok#AI编程工具#编程Agent
Editor brief · 编辑速览

付费用户反映 Grok Build 存在静默行为变更、终端无法复制错误信息等问题,被评价为「上一代编程模型」。揭示了 xAI 编程 Agent 相比 Claude Code 等竞品的实际差距。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

期待与现实:Grok Build 真实用户反馈

"Grok Build 就像是上一代的代码模型。"

这是 r/grok 上的一条 Reddit 帖子,发帖人真金白银掏了 99 美元体验 SuperGrok Heavy。

另一位评论者也讲了自己的经历:花三个小时在现有代码库上跑 Grok Build,看着它悄无声息地改变了行为,没有任何提示。不是输出错误。

而是用户偶然才发现的——一次静默的行为漂移。

然后还有个更离谱的:终端里压根不支持复制粘贴错误信息。

这就是 xAI 重磅编程 agent 产品的开局。Grok Build 于 2026 年 5 月 25 日上线,作为早期 beta 版本。这是一款终端原生的 CLI,直接对标 Claude Code 和 Codex CLI。

营销阵仗很大。Elon 发推了。xAI 官方博客也发了。

一堆科技媒体都跑了标题。但真正的故事发生在大家真正安装之后。

那么争议的焦点在哪里?

Grok Build 不是聊天界面,也不是 VS Code 插件。它跑在你的终端里。你指向一个项目,描述你想要什么,它就规划、搜索代码库、写代码、然后展示 diff 给你 review。

安装只需一行命令:curl -fsSL https://x.ai/cli/install.sh | bash。用你的 xAI 账号认证,然后就进去了。

默认模式是 Plan Mode。在动手修改任何文件之前,Grok Build 会提出一个分步骤的计划。你批准后,它可以针对单个步骤发表评论,或直接重写整个计划。

在你签字确认之前,什么都不会执行。这直接解决了开发者对编程 agent 最厌恶的问题。

它解决的问题是这样的:agent 做了某个错误操作,等你发现的时候下游已经有三处其他改动跟着变了。Plan Mode 在"任务下达"和"代码库被改"之间加了一个检查点。

Claude Code 原生没有这个功能。这是个实实在在的优势。

但架构层面的设计不止于此。Grok Build 最多会派生八个并行子 agent,每个都在独立的 Git worktree 里运行。彼此之间不会踩踏。

一个叫 Arena Mode 的评估层会在你 review 之前对竞争性输出打分。大型重构如果让一个 agent 来做要花一小时,现在可以分散到多个 agent 在隔离环境中并行处理。

它还内置了 MCP 支持,遵循 AGENTS.md 约定。并支持通过 -p 参数以 headless 模式运行,方便接入 CI 流水线。

没人忽视的差距

xAI 公布 Grok Build 背后模型的 SWE-Bench Verified 得分是 70.8%。Claude Opus 4.7 Adaptive 是 87.6%。OpenAI 的 Codex 是 85%。

差距是 17 个百分点。不是四舍五入的误差,也不是评测方法分歧。

xAI 的回应是基准测试不能完全反映真实工程场景。这话对任何基准测试都成立。但这并不能弥补 17 分的差距。

在简单、范围明确的任务上,这个差距可能感觉不出来。在复杂的多文件工作时,就会表现为更多的失败尝试、更多的 diff 回滚、以及更多的人肉 review 时间。

一位评测者报告在高负载下出现了 hallucinated edits。模糊提示词导致 Dockerfile 损坏。

竞争环境让情况更糟。Codex 已经拥有三百万周活跃用户。Claude Code 已经推动 Anthropic 实现年收入 300 亿美元的经常性收入。

Grok Build 进来的时候没有任何生产历史背书。

然后是定价

定价结构倒是挺有意思的。最初 SuperGrok Heavy 每月 300 美元。随后开放给 SuperGrok 用户每月 30 美元,X Premium Plus 用户每月 40 美元,还有一个 99 美元的促销档位。

Claude Code 统一每月 20 美元。

在 HN 上,情绪很直接。"每月只要 300 美元(也就是每年 3000 美元)。xAI 赌场不管你用不用都要把你的钱拿走。"

另一位用户说:"我不可能每个月花 300 美元买一个我老板绝对不会批准我用的东西。"

API 定价更合理一些。输入 token 每百万 1 美元,输出 token 每百万 2 美元。Grok Build 0.1 模型还通过 OpenRouter 和 Vercel AI Gateway 提供。

但 CLI 本身的订阅模式就很有争议了。每月 30 美元的话还有竞争力。每月 300 美元,面对 20 美元的 Claude Code 就很难卖动了。

真正让我意外的

TUI 确实令人印象深刻。我原本以为就是个凑合的东西。但 xAI 的一位工程师在 HN 上确认,终端界面是用 Rust 和 Ratatui 写的。

规范的 vim 键绑定。支持鼠标。细致的 alt-screen 渲染。

他们是真的在花功夫让终端体验变得精致。

而且二进制文件是本地优先的。你的源代码、凭证和项目数据都留在你自己的机器上。不会每次操作都传输到 xAI 的服务器。

对于一家完全可以推云端处理方案的公司来说,这是个有意义的取舍。

但有个细节让我停顿了一下:有人指出你无法从 Grok Build 终端复制粘贴错误信息。在一个想要取代你现有编码工作流的工具里,这是个基本的 UX 缺口。

类似这样的细节就是为什么"v0.1"这个版本号很重要的原因。

我对 2026 年编程 agent 的真实看法

我花了一下午深挖 HN 帖子、Reddit 评论和评测网站,想搞清楚大家的反馈。结果发现关于 Grok Build 的讨论,不只是关于 Grok Build 本身,而是关于我们整个编程 agent 领域现在处于什么位置。

所有人都对基准测试感到厌倦了。所有人都对发布公告感到厌倦了。大家真正想要的是一个不会静默破坏代码库的工具。

而 Grok Build,尽管架构上很有野心,但它是一个模型还需要追上界面的 v0.1。

架构跑在模型前面了。这是诚实的评价。

如果你已经是 SuperGrok 用户,试一下没什么额外的成本。但如果你要在每月 20 美元的 Claude Code 和每月 30 美元的 Grok Build 之间做选择,基准测试的差距是真实存在的,在复杂任务上你会感受到。

话说漂亮的终端工具

这次研究绕弯让我想起之前花了一个周末用 Bubble Tea 在 Go 里给一个 side project 写 TUI 的经历。花了两天把布局调好,又花了一天搞键绑定,到了周一突然意识到没人在乎它。

我为一个没人有的问题造了工具。

Grok Build 现在的状态差不多就是这样。漂亮的终端,真正的架构思考,但模型可能还需要再训练一次才能配得上那份期待。

但至少 Ratatui 确实能做出漂亮的终端 UI。我对我的 Bubble Tea 实验也可以说同样的话。只是没人在乎。

看人们是不是真的会用 Grok Build 吧。

谁真正应该关注这个

自掏腰包的独立开发者?每月 30 美元的 Grok Build 值得试试。每月 300 美元的话就不值了。

模型质量还没到位。同样的任务,20 美元的 Claude Code 会给你更多价值。

使用 xAI 基础设施的团队或有 SuperGrok 企业级访问权限的团队?并行子 agent 架构确实有意思。Plan Mode 是个真正的差异化特性。

但你需要接受一个事实:底层模型会产生比 Claude 或 Codex 更多的坏输出。你的团队会花更多时间在 review 上。

构建 agent 编排工具的人?ACP 支持很重要。headless 模式和 API 访问意味着你可以在 Grok Build 之上构建自定义工作流,这在 Claude Code 更有限的自动化表面上更难做到。

对于其他所有人:等下一个模型迭代版本吧。架构是有前景的。

模型需要追上来。这是对现状诚实的评估。

我一直想着那条 Reddit 评论。三個小時看著一個工具悄無聲息地改變代碼行為。用戶是偶然才發現的。

不是因為工具發出了警告。而是因為他們剛好在提交前看了 diff。

這才是 Grok Build 需要解決的真正問題。不是 SWE-Bench 分數。不是定價。

一個在你看起來像是在幫忙、實際上卻在悄悄把事情搞砸的終端 agent,還不如壓根沒有 agent。

Plan Mode 是正確的方向。並行 agent 很酷。

但信任是一次又一次乾淨的 diff 累積出來的。

而現在,Grok Build 還在贏得這份信任的路上。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
Agent 静默失败导致数千美元损失:如何用外部核查机制堵漏
下一篇
两个面向AI Agent的x402 API:页面质量检测与成本计算