Meta 第四款 Muse 模型发布,Agent 基准测试提升最大但仍落后 Claude Fable 5.1,最大亮点是每任务仅 0.55 美元,价格低于所有同类竞品。
Meta 发布了 Muse Spark 1.3。xhigh 级别目前已可用,而更强大的 max 版本目前以有限预览模式运行。
该模型在 Agent 任务上提升最为明显,但在大多数基准测试中仍落后于 Claude Fable 5.1 等顶级竞品。
每次任务收费 $0.55,目前是其性能级别中最便宜的模型。Meta 还表示将推出开放权重版本。
Meta 通过 Muse Code 和 Meta Model API 发布了 Muse Spark 1.3,这是该系列在五个月内的第四款模型。独立测试显示其在 Agent 任务上有明显提升,但与榜首的差距依然存在。这款模型的真正卖点是价格。
Muse Spark 1.3 的核心卖点是价格竞争力
Muse Spark 1.3 通过 Muse Code 和 Meta Model API 发布。该系列于四月启动,七月推出 1.1,八月推出 1.2。据 Artificial Analysis 报道,xhigh 级别目前已可用,而需要更多算力的 max 级别则在完成进一步安全测试后才会上线,目前仅供部分合作伙伴预览。
输入和输出 token 的价格分别为每百万 token $1.25 和 $4.25(与之前持平),每次索引任务成本为 $0.55。没有一款得分在 59 分及以上的模型比它更便宜,同等索引级别的竞品收费在 $0.94 到 $1.23 之间。Muse Spark 1.3 确实比 1.2 版更贵,后者的成本为 $0.40。
收益集中在索引加权的领域
在 Intelligence Index 上,max 得分 62 分,xhigh 得 61 分,而八月为 57 分,七月为 53 分。这一跃升源于索引的权重设计。GDPval-AA v2 占 20%,Terminal-Bench 2.1 占 16%,τ³-Bench Banking 占 14%,Meta 最大的进步恰恰落在这三项测试上。
在 τ³-Banking 测试中(Agent 在模拟银行场景中操作工具),max 达到 52%。据 Artificial Analysis 数据,这是目前的第一名,也是该模型唯一一项绝对领先。已开放的 xhigh 级别达到 47%,与 Claude Fable 5.1 (max) 和 GLM-5.3-Flash 持平,而非领先。前代 1.2 仅为 35%。
Terminal-Bench 2.1 测试终端编码能力,xhigh 从 80% 提升到 85%,max 为 86%,但 Claude Fable 5.1 仍占据榜首,其 max 级别为 91.4%,xhigh 为 91.0%,high 为 89.9%。在索引权重最高的测试 GDPval-AA v2 上,Meta 从 1,615 提升到 1,709 和 1,754(量表以人类专家表现为 1,000 分,涵盖 220 个真实专业任务)。Claude Fable 5.1 (max) 为 1,853。Meta 用算力换取 max 版本的领先,燃烧的推理 token 比 xhigh 多 62%。

在 Agent 任务之外,该模型仍处于中游水平
在 GPQA Diamond 测试(考察专家级科学问题)中,Muse Spark 从 90% 提升到 94%。这已进入第一梯队,但仍低于 Gemini 3.8 Flash (high) 的 95.3% 和 Grok 4.6 (high) 的 94.9%。CoverPt(研究物理方向)从 18% 跃升至 26%,大幅落后于 GPT-5.6 Sol (max) 的 32.3% 和 Claude Fable 5.1 (xhigh) 的 31.1%。
有两项指标实际上比 1.2 有所下降。AA-LCR 从 83% 降至 79%。AA-Omniscience 的事实准确性下滑最多达三个百分点,原因是模型在不确定时更倾向于拒绝回答。
Meta 和 Artificial Analysis 都尚未公布 max 版本的价格。更大型的模型和开放权重版本已在路上。