xAI模型Grok 4.6在基准测试中与Claude顶级模型性能持平,价格却低85%,开源可下载模式重塑模型定价。
Check your inbox for a confirmation email where you can adjust your preferences and even join additional groups.
Follow TNS on your favorite social media networks.
Become a TNS follower on LinkedIn.
Check out the latest featured and trending stories while you wait for your first TNS newsletter.
我是 Matt Burns,Insight Media Group 首席内容官。每周我都会汇总最重要的 AI 动态,并解释这些发展对将这项技术投入使用的人和组织意味着什么。核心观点很简单:学会使用 AI 的工作者将定义各自行业的下一个时代,而这份 newsletter 就是为了帮助你成为其中一员。
Grok 4.6 于周三发布。几个小时后 Qwen 3.8-Max 面世。接着在周四,DeepSeek V4-Pro 跟进。三款前沿模型在约 24 小时内相继发布,而三者的共同卖点都是成本——因为能力已经被视为理所当然。
很难反驳 Elon Musk 在 X 上的帖子:「综合智能、速度和成本考虑,Grok 4.6 客观上排名第一」。两年前,前沿模型的发布重点是能力。现在则是价格。每项基准测试的存在都是为了证明更低的账单是合理的。
本周三款前沿模型中有两款支持下载权重,这意味着闭源实验室能够收取的费用上限,越来越由那些将模型免费提供的公司来决定。
这就解释了为什么 Elon 的 Cursor 交易在今天看来比六月时合理得多。当模型在价格上趋于一致时,钱就会流向决定由哪个模型完成任务的那一方。Musk 买下的正是这个。
同款模型,更好的训练。同样的账单。
SpaceXAI 用两句话宣布了 Grok 4.6。前沿智能,公司如是说,以及「相比 Grok 4.5 的显著改进,价格不变」。Artificial Analysis 给其 Intelligence Index 打出了 61 分,比 4.5 高出 5 分,与 GPT-5.6 Sol 持平。在 GDPVal-AA 排行榜上它攀升至榜首,达到 1,753 Elo,刚刚超过 1,741 的 Fable 5 Max。
那 5 分从哪里来?不是更大的模型。正如产品分析师 Aakash Gupta 所说,Grok 4.6 与 4.5 一样运行在 1.5 万亿参数上,所有提升都来自后训练。Terminal-Bench 在一个版本内跃升了 66%。API 价格从未变动,每百万 token 输入 2 美元、输出 6 美元,因为相同的权重服务成本相同。改进本质上是免费的。
本周剩余的消息解释了这个价格从何而来。
我们的 Amanda Caswell 仔细看了 SpaceXAI 在那两句话中省略的基准测试:CursorBench v3.2 上 69.9%,比 70.5% 的 Fable 5 Max 略低,在 DeepSWE 上则落后于其他选手。
当阿里巴巴宣布 Qwen3.8-Max 时,Adrian Bridgwater 捕捉到了顾问 Jeff Brokaw 的质疑,后者称没有发布的开源权重承诺是「API 商业模式套上了开源的外套,只为发布会拍照」。当时这是一个公允的评价。权重现在已经放出。第二天 DeepSeek 紧随其后推出 V4-Pro,增加了对 OpenAI Response API 的原生支持,以及带有高峰和非高峰费率的价目表,非高峰时段费率仅为高峰的一半。前沿智能现在有了夜班和周末优惠。
在此背景下,投资者 Gavin Baker 做了一项买家真正会做的数学计算。Grok 4.6 在输入 token 上比 Fable 5 Max 便宜 80%,在输出 token 上便宜 88%。他的结论是两个词:「帕累托占优」。
如果开发者的备选方案是 Hugging Face 上的一个文件,实验室就不能仅仅因为模型更好就收取更多费用。它会以旧价格发布更好的模型,然后自己承担差额。
当模型成为商品,路由成为生意
Box CEO Aaron Levie 解释了接下来会发生什么,值得你花时间直接阅读他的观点。但简而言之,更便宜的模型并不会缩减 AI 预算。它们为那些公司已经想要但负担不起的工作付了账,比如扫描诡异代码库寻找安全漏洞的 agent,或者阅读每一份合同。他称之为杰文斯悖论,我认为他说得对。越便宜,买得越多。Levie 写道,由此产生的结果是,更多针对不同任务和成本调优的模型意味着「在能够根据任务进行路由和优化的层面,价值越来越大」。
便宜的模型并不会均匀地商品化整个技术栈。价值向决定哪个模型做什么的人倾斜。
Nvidia 这周推出了正是这样的产品。TNS 的 Frederic Lardinois 报道了 Nemotron 3.5 Lightning,一款开源的 300 亿参数模型,以及 NeMo Switchyard,一个开源路由器,可以将每个任务发送到适合它的模型。Nvidia 自家的数据显示,Switchyard 配置将开源模型与 Anthropic 的 Opus 4.8 配对,成本约为三分之一,同时保持了前沿准确性。
路由器在模型变得越来越可替代时获得更多价值。路由器将模型选择从架构决策转变为运行时决策。切换实验室不再是重写,而是一个配置变更,一个可以轻松替换的供应商很难提价。
在 Towards Data Science 上,Sara Nóbrega 发布了实际应用版本,包括她报告的公司实际采用的分工:大约 70% 本地小模型、20% 中级 API、10% 前沿模型。她引用 Nvidia 的研究估计,40% 到 70% 的企业 AI 任务已经运行在 100 亿参数以下的模型上。
一个明显的反驳是每个 token 更便宜并不等于每个任务更便宜。这很公平。Jessica Wachtel 为我们用 DeepSeek 的 V4-Flash 对抗 V4-Pro,发现预算模型在最困难的任务上推理更好,然后在过程中消耗了三倍的 token。最终账单:九美分对比十美分。标价在你用自己的工作实际跑过之前告诉你的信息很少。
这就让我回到 Cursor。SpaceX 在六月宣布将以 60 亿美元的股票交易收购该公司。值得注意的是,这笔交易尚未完成。当时这看起来像是一种非常昂贵的招聘编程工具团队的方式。本周你可以看到他买了什么。Michael Truell,25 岁的 Cursor 联合创始人兼 CEO,帮助发布了 Grok 4.6,并在公开文章中为它背书,称 4.6「将 Opus 级智能和精炼与极低成本和高速相结合」。Cursor 背后的 CEO 不会公开为 Musk 的最新模型站台。
Grok Bot 在前一天发布,定位为 AI teammates,能够「登录你的工具,像你一样使用它们,然后带着完成的工作回来」。工程师 Kun Chen 花了一天时间拆解它,发现底层是 Cursor。每个用户都获得一台云虚拟机,Mac 和 iOS 应用是瘦客户端,任何真正的编码工作都交给 Cursor 的云 agent 来处理。Grok Bot,他写道,「显然是为 Grok 打造并重新命名的」。
所以 SpaceXAI 现在拥有了算力、模型、agent 框架,以及数亿可以交付的用户。
算力是其他任何人都无法去建造的部分。Musk 将算力和电力视为约束这一理念植入了 SpaceX,彭博社报道仅 Anthropic 一家现在每月就向 SpaceXAI 支付 12.5 亿美元。今年春天,SpaceXAI 自己的模型只使用了可用算力的 11%,而 Anthropic 则在应对算力紧张。
Elon 不需要赢得模型竞赛。他只需要跟上。同样,开源权重实验室也不必赢得前沿。他们只需要设定它的价格。
这里有一些说起来容易做起来难的建议:选一个开源权重模型,用真实工作跑一跑。不是因为 Codex 或 Claude 要消失了。而是因为那份价目表里的每一个折扣之所以存在,都是因为可下载模型给了买家另一个选择(所以试试那些选择)。