Muse Code 是由 Muse Spark 1.2 驱动的终端编程 Agent,支持后台子代理、可恢复事件日志和隔离 Git worktree 并行执行。其低价贡献者套餐允许训练数据使用,开发者需在成本优势与代码隐私之间权衡。
Meta Superintelligence Labs 于 2026 年 8 月 5 日发布了 Muse Code——一款由全新 Muse Spark 1.2 模型驱动的终端 coding agent。乍看之下,它只是 coding agent 竞赛中的又一位选手;如今,这条赛道上已经有 Claude Code、Codex、Gemini CLI 和 Grok Build。但深入观察后,你会发现它有两个方面与此前所有产品都不一样。
📖 在 AgentConn 阅读包含图表和嵌入来源的完整版本 →
首先,如果你允许 Meta 使用你的 prompt 和 completion 进行训练,就能获得 20 倍的 token 折扣。贡献者层级的输入价格为 $0.10/Mtok,输出价格为 $0.20/Mtok;相比之下,标准层级分别为 $1.25 和 $4.25。两者之间的差价——每百万输入 token 大约 $1.15——就是 Meta 眼中你的代码作为训练数据的价值。此前还没有其他主流实验室明确为开发者产出标上价格。
其次,Spark 1.1 到 1.2 的 benchmark 提升主要来自 harness 创新,而不是单纯扩大模型规模。持久运行的后台 sub-agent、用于崩溃后安全恢复的本地事件日志,以及在隔离 Git worktree 中扇出的并行 worker,都是真正有价值的工程创新。无论 Muse Code 最终能否得到广泛采用,整个行业都会研究这些设计。

在 X 上查看原帖 →
对于今天正在评估 Muse Code 的团队来说,真正的问题并不是“Muse Code 比 Claude Code 更好吗?”,而是:你应该用钱为 coding agent 买单,还是用自己的代码买单?
每家 AI 实验室都提供数据保留开关。OpenAI 和 Anthropic 允许企业客户选择不让自己的数据用于训练。Meta 则颠倒了这个叙事框架:不再是“付费保护数据隐私”,而是“如果你愿意分享数据,就能通过折扣获得报酬”。
这组数字对比鲜明:
贡献者层级采用滚动的五小时速率窗口,并且只在部分国家开放。你的 prompt 和 completion“可能被用于改进 Meta 产品”。按照这样的费率,原本按标准价格每月需要花费 $500 的重度 coding agent 工作负载,成本会降至大约 $25。
正如 Kilo.ai 的分析所说:“Meta 并没有给模型打折,而是给你的代码仓库标了价,并用算力支付报酬。”该文章根据两个定价层级之间的差额估算,对 Meta 来说,开发者代码的价值约为每百万输入 token $1.15。这绝不是可以忽略不计的零头,而是目前尚存的最有价值训练数据所形成的市场出清价格——这些代码能够通过编译结果、测试结果以及人类验收信号为自己打分。

在 Kilo.ai 上查看原帖 →
“改进 Meta 产品”到底意味着什么?Meta 的贡献者条款允许将 prompt 和 completion 用于模型训练和产品改进。其范围不只包括对 Spark 进行 fine-tuning,还可能为 Meta 的任何 AI 产品提供信息。与此同时,Meta 现在也通过企业协议接受“零数据保留请求”,与 OpenAI 和 Anthropic 的做法保持一致。这形成了三个选择:支付全价,让 Meta 不使用你的数据训练;通过企业协议申请零数据保留;或者只支付十分之一的费用,同时交出完整交互记录。

在 X 上查看原帖 →
贡献者层级让 AI 经济中的一种全新交易方式成为常态:用知识产出来支付算力费用。此前,“用数据换折扣”的交易已经存在于消费级产品中——例如 Facebook 和 Google,用户本身就是产品——但它从未以明确、量化的 API 费率表形式出现。
如果这种模式行得通,每家实验室都会面临推出相同方案的压力。当 Meta 以 $0.20/Mtok 提供同等档次的输出 token 时,一家创业公司为什么还要为 Claude 的输出 token 支付 $4.25/Mtok?答案可能是信任、质量和治理能力。但对于那些资金有限、又在原型迭代中大量消耗 token 的团队来说,这笔经济账很难忽视。
Hacker News 上的讨论串获得了 323 点赞和 255 条评论,完美体现了其中的矛盾。一位评论者指出:“不管你每月的账单是多少,Meta 都不可能不拿你的数据训练。”Simon Willison 则从法律角度反驳称,这种违约行为将招致诉讼。另一位评论者表示,愿意拿 $1,000 做慈善赌注,赌“从现在起 18 个月内,会出现某篇报道或某位吹哨人”,曝光数据被意外使用的情况。

在 Hacker News 上查看原帖 →
这种信任赤字确实存在,但价格优势同样真实。对于处理非专有代码的团队——例如开源贡献者、教育项目,以及不涉及竞争敏感性的内部工具——贡献者层级实际上等同于免费获得前沿级算力。
Meta 声称,Muse Spark 1.2 在 Terminal-Bench 2.1 上获得了 82.9% 的成绩,落后于运行 Opus 5 的 Claude Code(86.7%),但领先于运行 GPT-5.6 Terra 的 Codex(81.8%)。这些数字值得仔细审视。
Kingy.ai 对已验证成绩的分析发现,Muse Spark 1.2 和 Opus 5 都没有出现在 Terminal-Bench 官方排行榜的独立验证结果中。Muse 上一个经过验证的版本 Spark 1.1,发布时宣称成绩为 80.0%,但实际验证结果只有 76.2%,相差 3.8 个百分点。Meta 的对比对象也是 Opus 5 和 GPT-5.6 Terra,而不是真正经过验证的领先者——83.8% 的 Fable 5 和 83.1% 的 GPT-5.5。
更重要的是,Spark 1.1 到 1.2 的提升——Terminal-Bench 增加 6.7 个百分点,DeepSWE 增加 6.3 个百分点——受到了 harness 切换的干扰。Spark 1.1 是在通用 mini-SWE-agent harness 中进行 benchmark 的,而 Spark 1.2 则直接运行在 Muse Code 内部。这里有多少提升来自模型质量,又有多少来自 harness 质量?Meta 无法将二者分开——而这恰恰才是重点。
⚠️ 这个 benchmark 告诉你的其实不是正确的问题。如果 Muse Code 的 harness 为 6.7 个百分点的提升贡献了其中 3~4 个百分点,那么模型本身的进步其实比较有限。但对实际使用者来说,harness 带来的提升比模型提升更有价值——因为它随产品一起交付,你无需额外付费。整个行业正在形成一种共识:真正的前沿指标,是长时间跨度下的 agentic 工具调用能力,而不是 benchmark 上的智力分数。Latent Space 也指出,Meta“创新性的 harness 设计”才是故事的主角,而不是那些分数。
即使你永远不会使用 Muse Code,它引入的三种架构模式也值得研究:
大多数 coding agent 都会针对每项任务创建 sub-agent,并在任务完成后将其销毁。Muse Code 则会让专门化的后台 agent 在整个 session 期间保持活跃。它们会“自行选择何时向主 agent 反馈”,而这种持久性能够“降低延迟,并减少困难、多步骤任务对人工引导的需求”。
这更接近人类工程团队的工作方式——专业人员会一直留在房间里,不断积累上下文,而不是每次都从头听取任务说明。我们曾在关于 agent 集群编排的深度分析中探讨过这一模式。
每一次模型调用、工具运行、审批和编辑操作,都会被追加到本地事件日志中。这个 runtime 能够做到“精确重放和安全重启:发生崩溃后,agent 可以准确地从停止的位置继续运行”。
对于长时间运行的任务来说,这是一项颠覆性的能力。Meta 展示过一个案例:Muse Code 在 NVIDIA Hopper 硬件上连续运行 24 小时,通过 1,000 多次工具调用优化 GPU kernel。如果任务在第 20 个小时崩溃,你也不会损失任何进度。
大型任务会被拆分成多个并行 sub-task,每个 sub-task 都在自己的 Git worktree 中运行。不会发生文件冲突,也不存在锁竞争。sub-task 完成后,各自的改动会被合并回来。这原本是 CI/CD 系统处理并发构建的方式,如今被应用到了 agent 执行中。
Meta 使用 Muse Code 的 harness 对 Muse Spark 1.2 进行了协同训练,其中采用了“经过拒绝采样的 harness 轨迹,以及针对目标、compaction 和 sub-agent 优化的训练方案”。说得更直白一些:他们生成 coding task,让这些任务在早期版本的 harness 中运行,保留 agent 成功完成任务的执行轨迹,然后用这些成功记录来训练模型。
这让模型与 harness 形成了紧密耦合:模型在这个特定 harness 中表现最好,而 harness 也专门用于挖掘模型的最佳性能。

在 X 上查看原帖 →
Cline 通过提取 Muse Code system prompt 中的指令,并让 Spark 1.2 在自己的 harness 中运行,对这一说法进行了测试。结果表明,协同训练确实很重要——一旦脱离原生环境,Spark 1.2 的表现就达不到 benchmark 所展示的水平。一条由 harness 构成的护城河正在形成。
根据目前可获得的数据,截至发布当天,Muse Code 在整个市场中的位置如下:
如果比较标准层级的价格,Muse Code 的 token 成本大约比 Codex 低 8~12 倍,也远低于 Claude Code 的订阅模式。在贡献者定价下,它更是独一档的存在。
但产品成熟度同样重要。Claude Code 覆盖终端、IDE、桌面端和 Web 端;Codex 覆盖 CLI、IDE 扩展和云端执行;Muse Code 则仅支持终端,仅支持 macOS/Linux,而且仍处于 beta 阶段。它不支持 Windows,没有 IDE 集成,也没有 Web 界面。多位 Hacker News 评论者还指出,CLI 在发布当天就遇到了登录 bug。一位用户报告称,该模型“连一个简单任务都无法完成——它一直卡在使用 grep/search tools 的阶段”。

在 X 上查看原帖 →
对于已经深度采用 Claude Code 或 Codex 工作流的团队来说,Muse Code 目前还不能作为替代品。它更像是一个值得持续关注的对象——你可以安装它,在支线项目中进行测试,并用自己的真实工作负载做 benchmark。它的 harness 架构最有可能影响你今后使用现有工具的方式。
⚠️ 看好贡献者层级的前提是信任,但 Meta 还没有赢得这种信任。
贡献者定价是透明的——你知道自己放弃了什么。但 Meta 在用户数据方面的历史,包括 Cambridge Analytica、FTC 同意令以及多次隐私和解,意味着每个企业合规团队都会对此亮起红灯。正如一位 Hacker News 评论者所说:“无论它有多好,都不会有人使用,因为没有人信任他们。”
反方观点是:如果 Meta 未经同意就使用标准层级的数据训练,它将面临巨大的法律风险。明确的主动选择加入机制,正是为了建立法律层面的可辩护性。而对于非专有工作负载来说,信任问题其实无关紧要——因为根本没有需要保护的内容。
真正的风险在于选择偏差。如果只有非专有代码、教学代码和开源代码会通过贡献者层级流入 Meta,那么它获得的训练集就无法充分代表生产环境中的实践、企业架构和专有框架。模型最终学到的,是人们不在乎是否需要保护的代码——而这些代码未必能让模型更擅长完成人们真正重视的工作。
多位用户报告称,贡献者层级在美国之外不可用。受到 GDPR 和《AI Act》约束的欧盟开发者,即使愿意也无法主动选择加入。这就形成了一个双层全球市场:美国开发者能够以大宗商品般的价格获得前沿级 token,而其他地区的开发者则要为同一个模型多支付 10~20 倍的费用。
对于构建跨供应商 agent 队列的团队来说,这种地域限制很重要。如果你的编排层会把任务路由到价格最低的可用模型,那么贡献者层级的 Spark 1.2 会在每次成本比较中胜出——但前提是任务在美国执行。国际团队所需的路由逻辑不能只考虑价格,还必须考虑各定价层级在不同地区是否可用。
如果你大规模运行 coding agent,而且代码不是专有资产:立即测试贡献者层级。按照 $0.10/$0.20 每 Mtok 的价格,你可以让 Muse Code 长时间运行——包括那些需要 1,000 多次工具调用的长时间跨度任务——其成本甚至只会成为云服务账单中可以忽略的噪声。开源维护者、教育机构和内部工具团队都应该认真评估这一方案。
如果你拥有专有代码:标准层级 $1.25/$4.25 的价格具备竞争力,但并不突出。你应该根据当前配置评估 Muse Code 的 harness 功能,例如持久运行的 agent 和事件日志。如果你已经在使用 Claude Code 或 Codex,除非 Muse Code 的特定架构能解决你眼下的痛点——比如长时间运行任务的崩溃恢复——否则切换成本很可能高于它所节省的费用。
如果你在构建 agent harness:研究事件日志模式和持久化 sub-agent 架构。这些都是可以迁移的理念。尤其是事件日志——只追加、可精确重放、重启安全——无论底层采用什么模型,它都应该成为每个长时间运行 agent 系统的标准模式。我们在此前的分析中解释过,为什么真正的护城河是 harness 而非模型,而 Muse Code 进一步印证了这一观点。
如果你在观察市场:贡献者层级是一个领先指标。如果 Meta 的训练飞轮能够运转起来——廉价 token 吸引开发者,开发者代码改进模型,更好的模型再吸引更多开发者——那么可以预期 Claude 和 OpenAI 会在未来 12 个月内推出自己的“数据换折扣”计划。700 万用户的争夺战,如今又多了一个定价维度。
Meta 发布了一款仍处于 beta 阶段的 coding agent,它既有真正的架构创新,也采用了一种迫使每个团队回答长期回避问题的定价模式:作为训练数据,你的代码到底值多少钱?
它的 harness 很有意思。benchmark 尚未得到验证,但成绩看起来可信。模型有竞争力,但并不领先。然而,这些都不是 Muse Code 真正重要的原因。
Muse Code 的重要之处在于,主流实验室第一次发布了一份费率表,明确把开发者代码作为商品定价——每百万 token $1.15,并以算力折扣的形式支付。无论你是否接受这笔交易,价格都已经被确定下来。整个行业接下来必须决定:是匹配这个价格、给出更高报价,还是主张他们所获得的代码价值更高。
Muse Code 不是当今最好的 coding agent,但它或许是最坦诚地告诉你“它想从你这里得到什么”的那个。
最初发表于 AgentConn
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。