Meta 正式推出 Muse Code 编程 Agent,代号 Spark 1.3,发布节奏与 Google Gemini 贴身竞争,被称为 Meta 迄今最大编程能力飞跃,定位对标 OpenAI Codex。
我们很高兴你在这里。你可以期待 TNS 最好的内容在周一至周五送达,让你紧跟新闻、保持最佳状态。
查看你的收件箱,收到确认邮件后可以调整偏好设置,甚至加入其他群组。
在你最喜欢的社交网络上关注 TNS。
在 LinkedIn 上成为 TNS 粉丝。
在等待你的第一封 TNS 时事通讯时,看看最新的精选和热门故事。
本周 Meta 在 AI 领域动作频频,正式推出了 Muse Code 编程 Agent,附带三个新的订阅计划。随后在周三晚些时候,公司发布了 Muse Spark 1.3,这是其低成本推理模型的最新版本,Meta 声称这是其在编程和 Agent 任务上迄今为止最大的进步。
Muse Spark 1.3 通过 Muse Code 和 Meta Model API 提供服务,是 Meta 今年四月首次推出的推理模型的最新迭代,距离 Muse Spark 1.2 的发布还不到一个月。Meta CEO 马克·扎克伯格在社交媒体上为新版本造势,称其实现了"便宜到难以计量"的前沿性能。
"这是我们在编程和 Agent 工作上迄今为止最大的一次飞跃。"
"这是我们在编程和 Agent 工作上迄今为止最大的一次飞跃,"扎克伯格在 X 上写道。
开源权重版本"即将发布"
扎克伯格还确认 Muse Spark 的开源权重版本将"很快发布",此举可以让开发者在自己的基础设施上下载和运行模型,绕过 Meta 的托管 API。
不过,具体会有多开放还不清楚,因为 Meta 尚未公布伴随该版本发布的许可证条款。此前 Meta 的开源权重模型在使用权上都有不同程度的限制,因此这些细节将决定 Spark 可以多自由地被修改、再分发或部署。
值得注意的是,扎克伯格还预告了 Meta 被大肆宣传的下一代模型,代号为 Watermelon(西瓜),使用了颇为贴切的西瓜表情。
Muse Spark 1.3 今日上线,实现便宜到难以计量前沿性能。这是我们在编程和 Agent 工作上迄今为止最大的一次飞跃。可以在 Muse Code 和我们的 API 中试用。下一个是 🍉,Muse Spark 开源权重版本即将发布。https://pic.twitter.com/XQQEDEJGD7
Muse Spark 1.3 今日上线,实现便宜到难以计量前沿性能。这是我们在编程和 Agent 工作上迄今为止最大的一次飞跃。可以在 Muse Code 和我们的 API 中试用。下一个是 🍉,Muse Spark 开源权重版本即将发布。https://pic.twitter.com/XQQEDEJGD7
据悉,该模型比 Spark 大得多,据当时的 Business Insider 报道,它在七月时仍在训练中。目前还没有关于 Watermelon 何时面世的确切消息,不过从扎克伯格的暗示来看,时间不会太长。
不过眼下,Meta 对 Spark 1.3 本身做出了一些相当大的声明。扎克伯格配合他的帖子附上了一张基准测试表,将其与 OpenAI 的 GPT-5.6 Sol 和 Anthropic 的 Claude Opus 5 在编程、Agent、计算机使用和长上下文测试中进行了对比。
其中亮眼的数据包括:Muse Spark 1.3 在 DeepSWE 编程基准测试中得分 75.4%,在 MRCR 长上下文测试 512K-1M 版本中得分 98.1%。
Muse Spark 1.3:基准测试结果

不过,这些是 Meta 自行汇总的结果。该公司表示,Spark 1.3 的分数是通过 Meta Model API 生成的,而对比数据则混合了 Meta 自己的评测、官方排行榜以及竞争对手模型提供商报告的结果。Meta 还将其对第三方模型的测试描述为"尽力而为",这意味着不应将该表视为在相同条件下进行的单一独立对比测试。
这些结果还有另一个注意事项:Meta 在头条对比中使用了新的"max"推理级别运行 Spark 1.3,而目前开发者通常可用的最高推理级别是"xhigh"。Max 仍处于限预览状态,等待 Meta 完成额外安全测试。
"手套摘了":Spark 1.3 的实际表现
Artificial Analysis 的独立测试确实提供了一个有用的外部视角。这家总部位于旧金山的公司专注于 AI 模型和提供商的基准测试,给公开可用的 Muse Spark 1.3 xhigh 在其 Intelligence Index 上打出 61 分,比 Spark 1.2 高出 4 分,与 GPT-5.6 Sol max、Grok 4.6 high 和 Claude Opus 5 high 持平。该公司还测试了限预览版的 max 版本,得分 62,在发布时其对比的模型中仅次于 Claude Fable 5.1 和 Claude Opus 5。
Artificial Analysis Intelligence Index(图片来源:Artificial Analysis)

云基础设施公司 CoreWeave 的 AI 布道者 Alex Volkov 指出,这张图证明了 Meta 与领先模型之间的差距缩小得有多快。
"该死,手套彻底摘了!" Volkov 在 X 上写道,称这一表现是 Meta "相当有力的宣言",并预测"接下来几周会很热闹!"
"该死,手套彻底摘了!"
成本是 Meta 宣传的另一个重点。Artificial Analysis 将 Spark 1.3 xhigh 描述为"其智能水平上性价比最高的模型",其 61 分的 Intelligence Index 得分加上相对较低的每次任务成本,使其处于该公司的帕累托线上。
Intelligence Index vs. 每 Intelligence Index 任务成本(图片来源:Artificial Analysis)

Artificial Analysis 计算出 Spark 1.3 xhigh 每次 Intelligence Index 任务的成本约为 0.55 美元,是其指数上得分 59 及以上任何模型中最低的。与 Spark 同为 61 分的 GPT-5.6 Sol max 和 Grok 4.6 high 分别为 0.95 美元和 0.94 美元。
Spark 1.3 每次任务成本仍然高于 Spark 1.2 的 0.40 美元,Artificial Analysis 将这一增长主要归因于新模型在 Agent 评估中消耗的输入令牌增加了约 57%。
每 Intelligence Index 任务成本(图片来源:Artificial Analysis)

Muse 对阵 Gemini:一场"沙盒之争"
值得注意的是,在 Meta 发布 Muse Spark 1.3 之前不久,Google 自己发布了一款新的低成本模型:Gemini 3.8 Flash,这是六周内第三个 Flash 版本。Google 还将其定位为迄今为止最好的推理和编程 Flash 模型,同时保持入门价格不变,每百万输入令牌 0.75 美元、每百万输出令牌 3.75 美元。
Artificial Analysis 最初将 Gemini 3.8 Flash(high)置于其 Intelligence-versus-Cost 帕累托前沿——本质上这是一个模型群体,其中没有任何替代方案既能更强又能更便宜。Gemini 在 Intelligence Index 上得分 59,每次任务成本 0.58 美元。
然而,仅几个小时后,Muse Spark 1.3 xhigh 以 61 分和每次任务 0.55 美元登场,在两个指标上都击败了 Gemini 3.8 Flash,将其挤出了前沿。
"Google 只领先了几个小时。"
这一点在 AI 社区中引起了不少关注。事实上,AI 研究员 Benjamin Marie 在 X 上指出,"Google 只领先了几个小时。
Google 只领先了几个小时。而且 Meta 即将发布权重。https://t.co/nEZU29qM1o
AI 基础设施和研究公司 Prime Intellect 的研究工程师 Florian Brand 也简洁地总结了这次逆转。
"Gemini 3.8 在帕累托前沿的位置持续了查看笔记 3.5 小时," Brand 在 X 上写道。
Meta 首席 AI 官 Alexandr Wang 本人也加入了讨论,特意在 Artificial Analysis 报告的基础上对 Google 进行了一番嘲讽。
真的忍不住要说……Gemini 是谁?🏎️💨 https://t.co/Umv4CVqgre
不过,云和 AI 成本管理公司 Duckbill 的联合创始人兼首席云经济学家 Corey Quinn 很快嘲讽了这场交锋,暗示 Meta 和 Google 都没有在 AI 军备竞赛中真正掌握节奏。"Meta 在 AI 领域嘲讽 Google 就是 MMA 冠军赛外的一场幼儿园打架," Quinn 在 X 上写道。
Muse Code 登场
先交代一下背景:Muse Spark 1.3 是 Meta 自四月以来发布的第四个版本,前有七月的 Muse Spark 1.1 和随后一个月的 1.2。不过,Meta 攻势中更重要的部分可能是围绕该模型构建的 Agent 载体。
那就是 Meta 的 Muse Code,一款基于终端的编程 Agent,在八月初 Spark 1.2 发布时进入 Beta 测试。它在周二正式发布,全新订阅计划起价仅 5 美元/月,新的 SDK 也进入了开发者预览。
因此,虽然 Meta 明显在 Muse Spark 系列展现的进步中试图与前沿实验室在模型质量上竞争,但它也在更高一层追赶他们——在那里,Anthropic 的 Claude Code 和 OpenAI 的 Codex 已经为开发者日常如何与 Agent 协作设定了标准。
这就解释了为什么 1.3 版本中有如此多的宣传语言专门围绕编程和 Agent 工作展开。该模型是 Meta 正在大力推进的更广泛开发者平台的关键一环,而且在价格和能力上都下了重注。