8.0
热点
AI SCORE
模型发布2026-09-22 00:56
Grok 4.7低价发布,但基准测试大幅落后Claude和GPT-6
The Decoder#xAI#Grok#大模型基准测试
Editor brief · 编辑速览
Grok 4.7在Artificial Analysis智能指数仅得46分,Claude Fable 5.1和GPT-6各53分,差距在编程Agent场景更为明显,但价格较低。
Elon Musk 创立的 xAI 推出了 Grok 4.7,这是其迄今为止在编程和知识工作上能力最强的模型。据该公司介绍,Grok 4.7 基于更大的基座模型训练,应用了更长的强化学习流程,并设计为能够更好地验证自身输出。定价为每百万输入 token 2 美元、每百万输出 token 6 美元。这一价格区间更接近中国模型而非西方前沿模型,而这或许不无道理。在独立基准 Artificial Analysis Intelligence Index(v4.3.2,综合十项基准测试)中,Grok 4.7 得分为 46,位列中游。Claude Fable 5.1 和 GPT-6 均以 53 分领先。

在智能体编程场景中,差距进一步拉大。在 Terminal-Bench 4.0 上,Grok 4.7 仅取得 26% 的成绩,而 GPT-6 Astra 为 60%,Claude Fable 5.1 为 55%。就连更便宜的 DeepSeek V4.1 Flash 也以 27% 略胜一筹。该模型现已通过 Grok API、Cursor 和 Grok Build 对外提供。
