Grok 4 模型功能解读
xAI Grok 4 发布后的功能介绍与对比分析。新模型选项之一,但此类介绍文章通常缺乏深度评测。
xAI Grok 4 发布后的功能介绍与对比分析。新模型选项之一,但此类介绍文章通常缺乏深度评测。
你可能已经听说过 xAI 团队由埃隆·马斯克创立的最新突破——Grok 4 的发布。
在这篇文章中,我们将深入探讨这个模型是什么、它的数据指标、它是否真的出众或只是另一个常规 AI 模型、它是否实现了 AGI,以及到目前为止社区的总体印象。
读完这篇文章,你将获得所有必要的信息来决定是否想使用 Grok 4。
废话不多说,让我们开始吧!
Grok 4 是一个推理模型,也是迄今为止最智能的模型,如下面的基准测试所示。说实话,这个模型不仅与其他 AI 模型竞争,还与人类竞争,使其成为首创的模型(我们稍后会讨论这一点)。
如上面的图表所示,与最近的 AI 模型相比,它在智能、速度和定价方面都有出色的得分。它在人工智能排行榜上排名第一,但如果我们仔细观察,它在生成响应方面的速度略慢一些。Grok 4 的延迟约为 13.58 秒(首个 Token 的时间),这衡量的是从 AI 模型接收响应第一部分的时间。这略低于 OpenAI 的 o4-mini-high,与 Claude Sonnet 4 模型相当。
它的训练数据量比 xAI 的第一个公开 AI 模型 Grok 2 多 100 倍,强化学习计算量大约是当前市场上任何其他 AI 模型的 10 倍。
它配备 256k token 的上下文窗口(模型一次能读取和记住的信息量),与最近的 Gemini 2.5 Pro 的 1M token 上下文窗口相比相当低。它略高于约 200k token 的 Claude 4 系列。
Grok 4 的定价相当标准,但有个细节。与 Grok 3 的定价相同,为每百万输入 token 3 美元(超过 128k 后翻倍)和每百万输出 token 15 美元(超过 128k 后翻倍)。
这个模型在 GPQA Diamond 上获得了历史最高分 88%,这是对 Gemini 2.5 Pro 86% 的重大胜利。(GPQA Diamond 测试模型回答研究生级别、专家领域问题(例如物理、法律、医学)的能力)
这个模型在 GPQA Diamond 上获得了历史最高分 88%,这是对 Gemini 2.5 Pro 86% 的重大胜利。
(GPQA Diamond 测试模型回答研究生级别、专家领域问题(例如物理、法律、医学)的能力)
它在人类最后的考试中获得了历史最高分 24%,击败了 Gemini 2.5 Pro 之前的 21% 的分数。(人类最后的考试测试大型语言模型(LLM)在人类知识前沿的能力)
它在人类最后的考试中获得了历史最高分 24%,击败了 Gemini 2.5 Pro 之前的 21% 的分数。
(人类最后的考试测试大型语言模型(LLM)在人类知识前沿的能力)
它在 MMLU-Pro 和 AIME 2024 中获得了并列最高分,分别为 87% 和 94%。(MMLU-Pro 测试模型在 57+ 专业级主题中的表现,包括法律、工程、医学等。AIME 2024 衡量模型在高中奥数级数学问题上的表现)
它在 MMLU-Pro 和 AIME 2024 中获得了并列最高分,分别为 87% 和 94%。
(MMLU-Pro 测试模型在 57+ 专业级主题中的表现,包括法律、工程、医学等。AIME 2024 衡量模型在高中奥数级数学问题上的表现)
它也在编码基准上表现出色,在 LiveCodeBench 中排名第一,得分 79.4%,第二名仅为 74.2%。(LiveCodeBench 是一个实时编码基准,测试模型在实时交互式编程任务中的能力,而不仅仅是静态代码生成)
它也在编码基准上表现出色,在 LiveCodeBench 中排名第一,得分 79.4%,第二名仅为 74.2%。
(LiveCodeBench 是一个实时编码基准,测试模型在实时交互式编程任务中的能力,而不仅仅是静态代码生成)
是的,还有一些其他基准测试中它处于领先地位,但这些是最有趣的。
总的来说,目前如果你看任何基准测试,Grok 4 很可能在其中大多数测试中领先。
它可以通过 API 和付费订阅两种方式访问。你可以在 SuperGrok 上访问,价格为 $30/月或 $300/年,这给你访问标准 Grok 4 的权限。但是,要访问 Grok 4 Heavy,你需要订阅 SuperGrok Heavy 计划,费用为 $300/月或 $3000/年。
Grok 4:这是标准的通用模型,针对问题解决、一般对话和写作等多种任务进行了微调。它是 Grok 4 系列中的默认版本。
Grok 4 Heavy:这是 Grok 4 系列中的专门版本。它使用多个 agent,即并行运行多个 AI agent 来分析和解决问题并得出最佳解决方案。这确实有助于提高准确性,主要为繁重的研究、数据分析以及任何需要广泛思考的工作而构建。
更好的是,如果你只是想测试这些模型,它也可以在 OpenRouter 上获得,所以如果你有 API 密钥,你就可以开始了。
如果你不确定 AGI(人工通用智能)是什么,让我给你简要说明一下。基本上,生成式 AI(我们使用的东西,比如 OpenAI 模型、Claude Sonnet 模型等)是基于学习到的模式或它们被训练过的内容来生成内容。
然而,AGI 有意识地生成内容,其创造力可与人类智能相媲美。
让我告诉你,我的朋友,这不是你可以凭空构建的东西。在这里,我们讨论的是达到与人脑等同的人工智能,这并不容易实现。
回到话题,它还没有达到 AGI,但它是 AGI 竞赛中的一次飞跃,也是第一个在 ARC-AGI 基准中超越 15% 分数的模型,而且成本更低。
xAI 还在一个叫做 Vending Bench 的真实世界模拟中测试了 Grok 4。基本上,在这个基准中,想法是看一个模型是否可以随着时间的推移管理一个小企业,并处理随之而来的一切,比如补充库存、与供应商合作、调整价格等。这是在真实场景中测试 AI 模型的一个非常有趣的基准,它在这方面做得相当不错。
如你所见,Grok 4 的收入和规模是最大竞争对手 Claude Opus 4 的两倍多。
Grok 4 和这里的其他 AI 模型之间没有可比性,而且它以更低的价格完成所有这些工作。所以是的,这是朝着 AGI 迈出的一大步,但它根本还没有到达那里。
马斯克本人声称你可以将整个源代码复制粘贴到查询中,它会修复 bug 或为你添加功能,就是这样。据称它也工作得"比 Cursor 更好"。
而且,这似乎确实是真的。社区在这个模型发布以来的不到一周内就用它构建了很多东西,我们得到的结果是疯狂的。
它字面上一次性完成了一些疯狂的事情,如果这还不够,据称它在每个科目上都比博士级别更好。让这个事实沉下来。
🗣️ "关于学术问题,Grok 4 在每个科目上都比博士级别更好。没有例外。" - 埃隆·马斯克
在这个模型发布时,他们快速介绍了 xAI 接下来会发生什么,它看起来是这样的:
我们预期在接下来的几个月内看到以下内容:
Grok Code - 下个月发布
Grok 多模态或浏览 agent - 9 月发布
Grok 视频生成 - 10 月下旬
所以,如果你使用 AI 模型的主要目的是编码,可能值得再等一个月,看看对你的使用场景是否更好。
Grok 4 在选择正确的工具和几乎每次都用正确的参数进行工具调用时的准确度约为 99%。
它被设计为 agent 性的,这意味着在单个或多个 agent 在后台工作的情况下,它可以轻松处理多个任务。它是学术向导,正如你在我们上面讨论的基准中看到的那样,也是首批突破 ARC-AGI 基准 10% 障碍的 AI 模型之一,这使其能够做出有决定性的决策和计划,使其成为一个非常强大的模型。
然而,当涉及到多模态能力,特别是图像生成和分析时,它并没有好多少,并且表现不如 o3、Claude 4 等顶级多模态能力 AI 模型。虽然这在未来的日子里会显著改进。
我真正讨厌这个模型的另一个问题是在 xAI 之上实现的速率限制。几乎每 2-3 个连续提示,你就会被限制速率几分钟,这确实令人沮丧,尤其是考虑到你会在更多基于研究的情况下使用这个模型,你可能会向模型进行多个提示以获得你期望的答案。
如果我必须总结一下我们迄今为止所读的一切,它肯定是目前最适合推理、繁重研究和数据分析的模型!Grok 4 并不真的适合编码,所以最好再等一个月来等待一个编码调优的模型。
这无疑是迄今为止 AI 世界中最大的突破,声称它是目前最接近达到 AGI 的模型。所以是的,这个模型中确实有很大的潜力,所以要谨慎使用它。
力量越大,责任就越大!😉
让我知道你对 Grok 4 的看法,如果你自己测试过,它的表现如何。请在下面的评论中告诉我!
我们最近在 ForgeCode 上添加了对 Grok 4 的支持。如果这对你来说听起来很有趣,你肯定想在 ForgeCode 上尝试它。你可以创建一个账户并在一分钟内开始。自己看看它是否与基准测试建议的一样好,以及你是否想将此模型添加到你的日常工作流程中。
Claude Opus 4 vs. Grok 4 编码对比
Claude Opus 4 vs. Gemini 2.5 Pro
Claude 4 初步评测
Artificial Analysis. "Grok 4 Model Card." https://artificialanalysis.ai/models/grok-4 ↩
OpenRouter. "OpenRouter: Access LLMs via a Unified API." https://openrouter.ai ↩
xAI. "Grok 4 Launch & Benchmarks Livestream." Twitter/X Post. https://x.com/xai/status/1943158495588815072 ↩
Andon Labs. "Vending Bench: A Real-World AGI Simulation." https://andonlabs.com ↩
Grok. "Subscribe to Grok and SuperGrok Plans." https://grok.com/#subscribe ↩