SpaceXAI 发布 Grok 4.7,基于更大基座模型和更长 RL 训练,但定价与 Grok 4.6 相同($2/$6),定位编程、Agent 任务和知识工作。
SpaceXAI 发布了 Grok 4.7,这是一款用于编程、Agent 任务和知识工作的新旗舰模型。Grok 4.7 基于更大的基础模型和更长的强化学习训练,但在价格和速度上与 Grok 4.6 保持一致。
是否可部署?可以,作为托管模型使用。你现在可以通过 xAI API、Cursor、Grok Build、OpenRouter、Vercel 和 Cloudflare 调用 grok-4.7。
SpaceXAI 列出了相对 Grok 4.6 的四项变化:
新的、更大的基础模型:Grok 4.7 不复用 Grok 4.6 的基础模型。
在更难任务上进行更长的 RL 训练:任务配比侧重于需要数小时才能完成的复杂问题。
更好的自我验证和长上下文处理能力:公司表示模型会更仔细地检查自己的工作。
原生 Grok Bot harness 支持:模型经过了训练,能够理解 Grok Bot harness,用于对话和知识工作。
开发者文档列出了 API 规格:
| 属性 | 值 |
|---|---|
| Model name | grok-4.7 |
| Context window | 500,000 tokens |
| Knowledge cutoff | May 2026 |
| Modalities | Text and image input, text output |
| Reasoning effort | low, medium, high (default), xhigh |
| APIs | Responses API, Chat Completions |
| Tools | Function calling, web search, X search, code execution |
发布基准表格将 Grok 4.7 xHigh 与 Grok 4.6 High、GPT-5.6 Sol Max 和 Fable 5.1 Max 进行了对比。Grok 4.7 的 DeepSWE 分数在 High effort 下运行。所有分数均为厂商自报。
| Benchmark | Grok 4.7 xHigh | Grok 4.6 High | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| Input price ($/M) | $2 | $2 | $4 | $10 |
| Output price ($/M) | $6 | $6 | $20 | $50 |
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%* | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
Grok 4.7 在每一项上都超越了 Grok 4.6。最大幅度的提升出现在 Terminal-Bench 4.0 上,从 20.3% 升至 38.0%。EEBench 提升了 11 点达到 64.0%,是该表格中的最高分。在 Harvey 法律 Agent 基准上,Grok 4.7 得分 19.6%,而 Fable 5.1 Max 仅为 6.7%。
Grok 4.7 并非全面领先。Fable 5.1 Max 在 7 项基准中的 4 项领先,包括 57.9% 的 Terminal-Bench 4.0 得分。GPT-5.6 Sol Max 在 DeepSWE v1.1 上以 72.7% 保持领先。
价格是另一个维度。Fable 5.1 Max 的输入价格高出 5 倍,输出价格高出约 8.3 倍。GPT-5.6 Sol Max 的输入价格高出 2 倍,输出价格高出约 3.3 倍。在 CursorBench 4.0 单位任务成本图表上,SpaceXAI 将 Grok 4.7 定位在性价比前沿。
在 GDPval(测试专业知识工作)上,Grok 4.7 xhigh 得分 1,695 Elo,较 Grok 4.6 high 的 1,605 有所提升。Fable 5.1 max 以 1,735 领先,GPT-6 Astra max 得分 1,542。SpaceXAI 还表示 Grok 4.7 在创建文档和演示文稿方面表现更好。
Grok 4.7 配备了全新的安全护栏体系。SpaceXAI 称这是他们测试过的在拒答和越狱抗性方面最强的模型。它在 LatchBio 生物安全基准上以 62.4% 位居榜首。
在 HackerBench v0.3(SpaceXAI 自己设计的风险和恶意网络任务基准)上,该模型让 3.3% 的风险双用途提示通过。公司表示它很少拦截合法的安全研究工作。精选网络安全合作伙伴现已获得邀请制访问其红队能力,用于防御研究。
Grok 4.7 的价格为每百万输入 token 2 美元,每百万输出 token 6 美元。它在所有计划的 Cursor 中可用,并且是 Grok Build 中的默认模型。它还通过 Grok API、OpenRouter、Vercel 和 Cloudflare 提供服务。
Grok 4.7 Fast 是相同模型但运行在更快速的基础设施上,输出速度提高一倍,价格也翻倍。文档称它仅在 Cursor 和 Grok Build 中运行,不在公共 xAI API 上。它也不包含在 Grok Build 的免费层中。
美国区域端点 https://us.api.x.ai/v1 让推理留在美国境内,但需加价 10%。SpaceXAI 建议设置 prompt_cache_key 以获得可靠的缓存命中。
import os
from xai_sdk import Client
from xai_sdk.chat import user
client = Client(api_key=os.getenv("XAI_API_KEY"))
chat = client.chat.create(model="grok-4.7")
chat.append(user("Explain this repo."))
print(chat.sample().content)
Grok 4.7 保持 Grok 4.6 的定价,每百万 token 输入 2 美元、输出 6 美元。
它在发布基准表格上于 EEBench(64.0%)和 Harvey Legal Agent Benchmark(19.6%)领先。
Fable 5.1 Max 仍在 7 项基准中的 4 项领先,包括 Terminal-Bench 4.0。
该 API 提供 500,000 token 的上下文窗口和最高 xhigh 的 4 个推理级别。
在 SpaceXAI 的 HackerBench v0.3 上,只有 3.3% 的风险双用途提示通过。
快去查看公告、文档和 X 帖子。所有功劳归该项目的研究人员。此外,欢迎关注我们的 Twitter,别忘了加入我们的 15 万 + ML SubReddit 并订阅我们的Newsletter。等一下!你用 Telegram 吗?现在你也可以加入我们了。
想与我们合作推广你的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会吗?联系我们。
Michal Sutter 是一名数据科学专业人士,拥有帕多瓦大学数据科学理学硕士学位。凭借统计学分析、机器学习和数据工程的坚实基础,Michal 擅长将复杂数据集转化为可操作的洞察。