前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9275
  • 可信数据是AI Agent规模化的关键瓶颈
  • Anthropic为Agent引入梦境推理能力引热议
  • Python 中缓存 LLM 响应:细节决定成败
  • Harness Engineering:打造 AI 编程助手的工作环境
  • 加向量数据库前,先用 NumPy 搞定 Embedding
  • 自实现令牌桶限流:比等 429 更优
  • 长时 AI 任务用后台任务队列:状态机比框架重要
  • asyncio 并发调用 40 个 LLM:代码少但坑多
  • AI 项目中 API 密钥的泄密风险与防护层级
  • 电话Agent工程实践:SIP/WebRTC音频路径全解析
  • pgvector索引调优:HNSW与IVFFlat成本精确分析
  • 多租户应用按客户计费:成本与可计费用量必须分开
  • PDF 解析难点深度剖析:字符间距阈值是万恶之源
  • Hugging Face开源OlmoEarth文本嵌入
  • 阿里开源 Qwen3.8:2.4T MoE、激活 95B、256K 上下文
  • MiniMax H3:单个 Transformer 替代视频生成完整流水线
  • DeepSeek V4 Pro 正式版发布:多项测试接近 Fable 5 水平
  • AI编程助手Lovable完成新一轮4亿美元融资,估值达133亿美元
  • MiniMax Music 3.0:开放权重生产级音乐生成模型
  • Microsoft 发布 MindTopo:VLMs 空间推理能力新基准
  • Grok 4.6 发布:剑指 GPT-5.6 Sol,主打长时间 Agent 任务
  • Grok 4.6 中文详解:训练数据、Agent 能力边界与定价
  • 市场份额报告:Google Gemini 份额从 12% 跌至 1.9%
  • 用Embeddings+Reranking+LLM构建可靠的内容分类流水线
  • 推理冷启动从10分钟降至秒级:容器镜像瘦身实战
  • Anthropic研究揭示:Claude Code旧版权限提示97%被机械通过
  • DeepSeek-V4-Pro-0813 悄然上线,支持思考与非思考模式
  • AI 生图 Prompt 审核实战:Node.js 调用 Chat JSON Schema 方案
  • 企业AI分析的隐藏陷阱:语义漂移问题深度剖析
  • AI 正在消除软件工程中层:代码看不懂、没人负责的团队困境
  • Qwen3.8-2.4T-A95B 模型发布
  • TraceMotive:本地优先的AI代理执行追踪调试工具
  • AI编程工具正在离开IDE:终端原生Agent工作流崛起
  • 个人开发者用AI编程的项目架构经验
  • FastAPI五个安全漏洞发现与修复全过程
  • 长文档AI审核的审计设计:Map-Reduce优于检索增强
  • AI Agent辅助发现SharePoint RCE漏洞链(CVSS 9.1)
  • 我用Claude Code将API的P99延迟降低一半
  • AI Agent读了你的secrets并删了生产数据库——PocketOS事故详解
  • 用聊天模型做金融内容审核:结构化输出设计实践
  • Prompt注入攻击原理与防御实践指南
  • 大规模漏洞扫描活动泛滥,攻击者冒充ClaudeBot等AI爬虫
  • 谷歌DeepMind发布手语转文本模型SL2T
  • LFM2.5-VL-3B:边缘设备高性能视觉语言模型发布
  • 通义千问3.8-27B发布,刷新开源大模型参数效率
  • 多Agent协作陷阱:个体测试全过,团队输出仍错误
  • Agent Plugins:Vercel/OpenAI/Microsoft 等联合推出 Agent 技能打包新标准
  • 企业实战:50+ AI Agent在UK主权云上的部署架构
  • ZeroGPU Router:让 AI Agent 用小模型处理例行任务
  • Solv Labs在AWS Bedrock上构建可审计的Agent支付系统
  • CodeBurn:让AI编程投入产出可见化
  • 已加载 51 / 9275
8.0
热点
AI SCORE
模型发布2026-08-12 23:59

Grok 4.6 发布:剑指 GPT-5.6 Sol,主打长时间 Agent 任务

dev.to · AI#Grok#xAI#Agent
Editor brief · 编辑速览

xAI 发布 Grok 4.6,定位为长时间运行 Agent 和复杂交互/视觉工作场景,在 Artificial Analysis 综合指数上与 GPT-5.6 Sol 持平,输入 $2/M 输出 $6/M,已上线 Cursor 和 Grok Build。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

2026 年 8 月 12 日,xAI 发布 Grok 4.6,这是 7 月 Grok 4.5 的后继版本。这次发布的定位与上一次不同。这次并没有主打原始智能的跃升,而是一款为长时间运行的 Agent 和大刀阔斧的交互式、视觉化工作打造的模型:跨多步研究一个主题、在代码库中穿梭工作,或者把一个粗略的产品构想打磨成精致的第一版。

官方主打的数据比较克制。xAI 表示,Grok 4.6 在 Artificial Analysis Intelligence Index(九项基准测试的综合指数)上与 GPT-5.6 Sol 持平。在其余已公布的所有评估中,Grok 4.6 与 GPT-5.6 Sol 和 Anthropic 的 Fable 5 互有胜负,各有领先和落后。定价为每百万输入 token 2 美元、每百万输出 token 6 美元,更快的版本价格翻倍。

我靠用 Spring AI 构建 AI Agent 为生,所以最先关注的就是这个 Agent 化的定位。下面是这次发布实际包含了什么、数字在哪些地方站得住脚,以及它对前沿竞争意味着什么。

Grok 4.6 的新变化

官方公告对模型规模着墨甚少,大篇幅都在讲训练。公告从未提及参数数量。此前的报道说法不一:有报告指出沿用了与 Grok 4.5 相同的 1.5T V9 基座,仅做了大量后训练;也有报告指向更大的 2T 模型。无论哪种情况,xAI 的口径都是——这次发布重点在训练配方,而非模型规模。

公司实际描述的内容如下:

  • 比 Grok 4.5 更长的补充训练阶段,使用由模型生成的精选数据来提升推理能力和高级技术概念,辅以高质量的工程数据和改良后的优化器及训练配方。
  • 监督微调阶段:Grok 4.5 自己在推理工作流、Agent 测试框架以及 STEM、软件工程、知识工作等领域上重新生成了 SFT 轨迹。问题轨迹通过基于模型的检查过滤掉了。
  • 强化学习覆盖范围广泛的 Agent 任务:通用编码、知识工作,以及内核优化、Web 开发、计算机辅助设计等领域的特定环境。

最值得关注的是行为层面的说法。xAI 表示,在更长的轨迹上,开始观察到更多的自我测试和验证行为——模型在继续之前会检查自己的输出。对于视觉和交互式项目,Grok 4.6 比 Grok 4.5 产生更强力的第一版输出,能够一次到位建立应用的结构和视觉语言,而不必经历多轮迭代。

基准测试表现

xAI 发布了十项评估,将 Grok 4.6 与 Grok 4.5、GPT-5.6 Sol Max 和 Fable 5 Max 进行对比。对手的数字来自已发布的技术报告和排行榜,所有数据均为自报,因此请将这些数字视为方向性参考。

AA Intelligence Index:61,与 GPT-5.6 Sol Max(61)持平,落后 Fable 5 Max(62)1 分,领先 Grok 4.5 High(56)5 分。

GDPVal-AA v2:1753,四者中最高。

CursorBench v3.2:69.9%,落后 Fable 5 Max(70.5%),领先 GPT-5.6 Sol Max(67.2%)。

FrontierCode v1.1(Extended):61.3%,领先 GPT-5.6 Sol Max(60.6%),落后 Fable 5 Max(63.6%)。

DeepSWE v1.1:65.9%,与 GPT-5.6 Sol Max(73%)和 Fable 5 Max(70%)存在明显差距。这是相对表现最弱的一项。

Terminal-Bench v3.0:26%,大幅落后于两个竞争对手(34.6% 和 34.1%)。

APEX-Agents:57.5%,处于两者之间。

APEX-SWE:56.4%,落后 Fable 5 Max(58.8%)。

AA-Briefcase:1577,以微弱优势领先 Fable 5 Max(1574)。

Harvey LAB(Vals):15.8%,轻松超越两个竞争对手。

Grok 4.6 在所有基准测试上都大幅领先 Grok 4.5 High。与顶尖梯队相比,格局喜忧参半:在 GDPVal-AA、AA-Briefcase 和 Harvey LAB 上胜出,在综合指数上持平,在 DeepSWE 和 Terminal-Bench 上明显落败。最后一项不可忽视。Terminal-Bench 衡量的是真实终端工作,26% 对阵 34% 不是一个四舍五入的误差。

定价与可用性

Grok 4.6 起步价为每百万输入 token 2 美元、每百万输出 token 6 美元。更快的版本价格翻倍。xAI 将其定调为"大约只有可比前沿模型定价的一半",而定价这部分无需任何基准测试解读。

即日起已在 Cursor 和 Grok Build 上线,并通过 API 提供,渠道包括 console.x.ai、OpenRouter、Vercel 和 Cloudflare 等合作伙伴。第一周,xAI 在 Grok Build 和 Cursor 提供双倍的包含用量。

这对前沿竞争意味着什么

Grok 4.5 于 2026 年 7 月 16 日发布,Musk 两天后确认 4.6 已在开发中。他的公开时间表显示 4.6 在两周内发布、4.7 在四周内发布,而 8 月初的一次泄露指出 4.7 将携带更大的 2.1T 架构。如果属实,4.6 是后训练版本,4.7 才是规模跃升。xAI 同时在跑两个实验:在一个现有基座上能榨取多少,以及更大的基座在此基础上能带来多少增益。

xAI 选择公布哪些基准测试本身就是一个表态。DeepSWE、CursorBench、Terminal-Bench、APEX、AA-Briefcase:这些都是 Agent 化和编码评估,而非一年前主导发布会的知识和数学基准。前沿的讨论已经转向长时域 Agent 工作,每个实验室现在都在为之优化。

对 Agent 构建者的意义

对于正在交付 Agent 功能的人来说,这次发布中有两点值得付诸行动。

第一,自我验证行为。一个在长轨迹上能检查自己输出的模型,会改变你的测试框架需要做的事。无需在每个工具调用外层包手动验证,而是可以让模型自己捕获错误,把你的检查留给真正关键的接缝处。这是我自己在 Spring AI Agent 中最在意的模式:act、observe、verify 的循环,Agent 要么在这里证明自己的价值,要么在这里崩盘。

第二,价格。长时域 Agent 运行消耗 token 的方式与短 prompt 完全不同。每次重试和每次工具调用失败都是一次新的请求。以每百万 token 2 美元和 6 美元的价格,更快版本价格翻倍,长时域任务让 Agent 持续工作的性价比高于前沿模型的通常水平。

注意事项是真实的。基准测试是自报的,Terminal-Bench 显示了真实的弱点,而且模型在所有平台同步上线:Cursor、Grok Build、API 和各个合作伙伴平台。Agent 化相关分数需要在你的脚手架里复现才有意义。但对于一个明确以长时域 Agent 为核心的发布而言,强劲的 Agent 化评估、半价 token,以及建立在验证基础上的训练叙事,这是一个实实在在的进步。

官方公告有完整的基准测试表格,OfficeChai 的解析也逐条梳理了同样的数字。如果你正在构建 Agent,Grok 4.6 值得在这周测试一下,尤其在双倍用量优惠还在的时候。你会先拿它跑哪个 Agent 工作负载?

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
Microsoft 发布 MindTopo:VLMs 空间推理能力新基准
下一篇
Grok 4.6 中文详解:训练数据、Agent 能力边界与定价