前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8391
  • SharePoint CVE-2026-55040认证绕过漏洞正被积极利用
  • Ranex内核:如何评判AI生成的代码质量
  • Qwen3.8-27B用一张消费级显卡跑出Opus级Agent能力
  • 15个视觉API图像token开销横评:最大相差270倍
  • 论文警告:AI采纳将导致专业人才断层,2030-2045年显现后果
  • 2026工具链革命:CLI取代Postman,Prompt取代手写代码
  • AI Agent可观测性:从系统健康到认知健康的监控范式转移
  • DeepSeek Harness插件生态爆发:长期记忆、电子宠物、4399小游戏
  • DeepSeek 发布 Harness Agent 框架与 V4 Pro 模型,编程能力跃升至第一梯队
  • 多模态模型视觉感知仍薄弱:Moonshot AI推出PerceptionBench
  • AI爬虫根本无法触发你的Analytics统计代码
  • SharePoint高危漏洞CVE-2026-55040正被大规模利用
  • Agent间停止传字符串:共享KV Cache的内存级handoff优化
  • Claude Code 自动化 pipeline 实战:幂等调度与自愈设计
  • 生产级 AI Agent 架构模式:6 种经实际验证的设计
  • ThoughtDAG:让LLM对话拥有可编辑的上下文有向无环图
  • OpenAI 上线 GPT-5.6 Sol 超极速模式,吞吐量达 750 tokens/s
  • 语义缓存:大幅降低LLM API成本的隐形成本杀手
  • LLM 成本爆炸的六大架构修复方案
  • RAG 系统如何学会说「不确定」
  • Grok 4.6以1/7价格匹配Fable 5 Max
  • DeepSeek模型集成指南:覆盖主流AI编程工具
  • TradingView信号转自动交易机器人的Webhook架构
  • RAG系统5个隐性成本陷阱
  • 候选人大模型评分系统:OpenAI/Claude/Gemini对比
  • Claude Code 自动生成演示视频:Playwright 录制 + AI 配音自动对齐
  • Qwen3.8-2.4T稀疏专家模型vLLM部署实战
  • ego-lite:专为AI代理设计的共享浏览器,人机并行不抢标签页
  • Cursor官方插件集合发布,含代码审查、团队工作流等实用工具
  • Claude Opus 5 基准登顶,开发者却怀念 Opus 4.8
  • Composio超量定价涨16倍真相:凭证托管成隐形收费项
  • GitHub Spec-Kit:规范优先开发,用可执行规格直接生成代码
  • MCP 缓存安全漏洞:私有结果可能跨用户泄露
  • 用 Rust 徒手实现栈式虚拟机:44 条指令、双后端与零成本安全类型
  • 微软 Copilot Notebooks 支持 Markdown,强化 AI 资料分析
  • Deltix:AI驱动自动化测试平台
  • 多 Agent 输出重复太吵?用输出去重器解决
  • AI Agent 为何需要向量数据库作为记忆层
  • DeepSeek V4 Pro 上线国家超算互联网,Harness 智能体框架开源
  • 智谱GLM-5.3发布:开源编程能力最强模型
  • 智谱 GLM-5.3 编程能力最强开源模型发布,Qwen3.8-27B 同日开源
  • 英伟达量产全球首款 200G/lane 硅光交换机,功耗降为 1/5
  • 别分类,直接「幻觉」标签:LLM标签推荐新思路
  • Anthropic推出Claude文本水印检测API
  • RPA与工作流自动化深度对比:如何构建持久自动化
  • Google Sheets推AI画布,可用自然语言构建交互应用
  • n8n替代方案横评:企业级自托管AI自动化平台
  • 苹果AI策略区域分化或致iOS应用在中国行为不同
  • CoT Prompting 实战指南:何时用、怎么用
  • 阿里Qwen3.8:消费级硬件即可跑出Opus 4.6级性能
  • 什么是AI上下文架构?为什么不建议自建?
  • 已加载 51 / 8391
8.0
热点
AI SCORE
模型发布2026-08-15 11:56

Grok 4.6以1/7价格匹配Fable 5 Max

The New Stack#xAI#Grok#大模型
Editor brief · 编辑速览

xAI模型Grok 4.6在基准测试中与Claude顶级模型性能持平,价格却低85%,开源可下载模式重塑模型定价。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Check your inbox for a confirmation email where you can adjust your preferences and even join additional groups.

Follow TNS on your favorite social media networks.

Become a TNS follower on LinkedIn.

Check out the latest featured and trending stories while you wait for your first TNS newsletter.

我是 Matt Burns,Insight Media Group 首席内容官。每周我都会汇总最重要的 AI 动态,并解释这些发展对将这项技术投入使用的人和组织意味着什么。核心观点很简单:学会使用 AI 的工作者将定义各自行业的下一个时代,而这份 newsletter 就是为了帮助你成为其中一员。

Grok 4.6 于周三发布。几个小时后 Qwen 3.8-Max 面世。接着在周四,DeepSeek V4-Pro 跟进。三款前沿模型在约 24 小时内相继发布,而三者的共同卖点都是成本——因为能力已经被视为理所当然。

很难反驳 Elon Musk 在 X 上的帖子:「综合智能、速度和成本考虑,Grok 4.6 客观上排名第一」。两年前,前沿模型的发布重点是能力。现在则是价格。每项基准测试的存在都是为了证明更低的账单是合理的。

本周三款前沿模型中有两款支持下载权重,这意味着闭源实验室能够收取的费用上限,越来越由那些将模型免费提供的公司来决定。

这就解释了为什么 Elon 的 Cursor 交易在今天看来比六月时合理得多。当模型在价格上趋于一致时,钱就会流向决定由哪个模型完成任务的那一方。Musk 买下的正是这个。

同款模型,更好的训练。同样的账单。

SpaceXAI 用两句话宣布了 Grok 4.6。前沿智能,公司如是说,以及「相比 Grok 4.5 的显著改进,价格不变」。Artificial Analysis 给其 Intelligence Index 打出了 61 分,比 4.5 高出 5 分,与 GPT-5.6 Sol 持平。在 GDPVal-AA 排行榜上它攀升至榜首,达到 1,753 Elo,刚刚超过 1,741 的 Fable 5 Max。

那 5 分从哪里来?不是更大的模型。正如产品分析师 Aakash Gupta 所说,Grok 4.6 与 4.5 一样运行在 1.5 万亿参数上,所有提升都来自后训练。Terminal-Bench 在一个版本内跃升了 66%。API 价格从未变动,每百万 token 输入 2 美元、输出 6 美元,因为相同的权重服务成本相同。改进本质上是免费的。

本周剩余的消息解释了这个价格从何而来。

我们的 Amanda Caswell 仔细看了 SpaceXAI 在那两句话中省略的基准测试:CursorBench v3.2 上 69.9%,比 70.5% 的 Fable 5 Max 略低,在 DeepSWE 上则落后于其他选手。

当阿里巴巴宣布 Qwen3.8-Max 时,Adrian Bridgwater 捕捉到了顾问 Jeff Brokaw 的质疑,后者称没有发布的开源权重承诺是「API 商业模式套上了开源的外套,只为发布会拍照」。当时这是一个公允的评价。权重现在已经放出。第二天 DeepSeek 紧随其后推出 V4-Pro,增加了对 OpenAI Response API 的原生支持,以及带有高峰和非高峰费率的价目表,非高峰时段费率仅为高峰的一半。前沿智能现在有了夜班和周末优惠。

在此背景下,投资者 Gavin Baker 做了一项买家真正会做的数学计算。Grok 4.6 在输入 token 上比 Fable 5 Max 便宜 80%,在输出 token 上便宜 88%。他的结论是两个词:「帕累托占优」。

如果开发者的备选方案是 Hugging Face 上的一个文件,实验室就不能仅仅因为模型更好就收取更多费用。它会以旧价格发布更好的模型,然后自己承担差额。

当模型成为商品,路由成为生意

Box CEO Aaron Levie 解释了接下来会发生什么,值得你花时间直接阅读他的观点。但简而言之,更便宜的模型并不会缩减 AI 预算。它们为那些公司已经想要但负担不起的工作付了账,比如扫描诡异代码库寻找安全漏洞的 agent,或者阅读每一份合同。他称之为杰文斯悖论,我认为他说得对。越便宜,买得越多。Levie 写道,由此产生的结果是,更多针对不同任务和成本调优的模型意味着「在能够根据任务进行路由和优化的层面,价值越来越大」。

便宜的模型并不会均匀地商品化整个技术栈。价值向决定哪个模型做什么的人倾斜。

Nvidia 这周推出了正是这样的产品。TNS 的 Frederic Lardinois 报道了 Nemotron 3.5 Lightning,一款开源的 300 亿参数模型,以及 NeMo Switchyard,一个开源路由器,可以将每个任务发送到适合它的模型。Nvidia 自家的数据显示,Switchyard 配置将开源模型与 Anthropic 的 Opus 4.8 配对,成本约为三分之一,同时保持了前沿准确性。

路由器在模型变得越来越可替代时获得更多价值。路由器将模型选择从架构决策转变为运行时决策。切换实验室不再是重写,而是一个配置变更,一个可以轻松替换的供应商很难提价。

在 Towards Data Science 上,Sara Nóbrega 发布了实际应用版本,包括她报告的公司实际采用的分工:大约 70% 本地小模型、20% 中级 API、10% 前沿模型。她引用 Nvidia 的研究估计,40% 到 70% 的企业 AI 任务已经运行在 100 亿参数以下的模型上。

一个明显的反驳是每个 token 更便宜并不等于每个任务更便宜。这很公平。Jessica Wachtel 为我们用 DeepSeek 的 V4-Flash 对抗 V4-Pro,发现预算模型在最困难的任务上推理更好,然后在过程中消耗了三倍的 token。最终账单:九美分对比十美分。标价在你用自己的工作实际跑过之前告诉你的信息很少。

这就让我回到 Cursor。SpaceX 在六月宣布将以 60 亿美元的股票交易收购该公司。值得注意的是,这笔交易尚未完成。当时这看起来像是一种非常昂贵的招聘编程工具团队的方式。本周你可以看到他买了什么。Michael Truell,25 岁的 Cursor 联合创始人兼 CEO,帮助发布了 Grok 4.6,并在公开文章中为它背书,称 4.6「将 Opus 级智能和精炼与极低成本和高速相结合」。Cursor 背后的 CEO 不会公开为 Musk 的最新模型站台。

Grok Bot 在前一天发布,定位为 AI teammates,能够「登录你的工具,像你一样使用它们,然后带着完成的工作回来」。工程师 Kun Chen 花了一天时间拆解它,发现底层是 Cursor。每个用户都获得一台云虚拟机,Mac 和 iOS 应用是瘦客户端,任何真正的编码工作都交给 Cursor 的云 agent 来处理。Grok Bot,他写道,「显然是为 Grok 打造并重新命名的」。

所以 SpaceXAI 现在拥有了算力、模型、agent 框架,以及数亿可以交付的用户。

算力是其他任何人都无法去建造的部分。Musk 将算力和电力视为约束这一理念植入了 SpaceX,彭博社报道仅 Anthropic 一家现在每月就向 SpaceXAI 支付 12.5 亿美元。今年春天,SpaceXAI 自己的模型只使用了可用算力的 11%,而 Anthropic 则在应对算力紧张。

Elon 不需要赢得模型竞赛。他只需要跟上。同样,开源权重实验室也不必赢得前沿。他们只需要设定它的价格。

这里有一些说起来容易做起来难的建议:选一个开源权重模型,用真实工作跑一跑。不是因为 Codex 或 Claude 要消失了。而是因为那份价目表里的每一个折扣之所以存在,都是因为可下载模型给了买家另一个选择(所以试试那些选择)。

Original source

本文由 AI 翻译整理自 The New Stack,原文版权归原作者所有。

阅读英文原文
上一篇
RAG 系统如何学会说「不确定」
下一篇
DeepSeek模型集成指南:覆盖主流AI编程工具