Meta基于Muse Spark 1.2模型推出终端编码Agent,支持异步后台Agent、append-only事件日志实现重启恢复,长周期仓库级任务训练。
Meta AI 发布了 Muse Code(Beta):一款由全新 Muse Spark 1.2 模型驱动的终端编程 Agent
Meta AI 发布了 Muse Code(Beta),这是一款由全新 Muse Spark 1.2 模型驱动的终端编程 Agent。Meta 将这一组合定位为迈向前沿的下一步,后续还会有更大的模型。Muse Code 瞄准大型代码仓库中的复杂软件工程:它规划变更、编写代码并验证结果。一组异步后台 Agent 在整个会话期间保持活跃,而不是每个任务都重新启动。本地追加写入(append-only)事件日志记录每一次模型调用、工具运行、审批和编辑,Meta 称之为"精确回放"和"重启安全"。Muse Spark 1.2 是与测试工具链(harness)共同训练的。Meta 还发表了一个内核优化案例研究,在长达 24 小时内运行了 1000+ 次工具调用。
是的。Muse Code 以 Beta 形式发布,支持 macOS 和 Linux,安装方式为 curl -fsSL https://dev.meta.ai/install.sh | bash。Muse Spark 1.2 可在 Muse Code 和 Meta Model API 中使用,并已扩展至全球访问。发布公告未提及可下载的权重,因此请将其视为托管服务依赖。
公司层面:API 路径适合任意规模。Muse Code 路径适合已在沙箱中运行 Agent 并设有审核关卡(review gates)的团队。
行业:软件与 SaaS、开发者工具、金融科技工程、GPU 与推理基础设施、半导体与 HPC。
应用:仓库级重构与迁移、长时运行 bug 分流测试、生成以及 GPU 内核优化。
Muse Code 运行一个简单的 Agent 循环加上一组异步后台 Agent。这些专业 Agent 在每个会话期间保持活跃。它们不会为单个任务而重新启动,Meta 表示这避免了重复的信息收集。它们执行下一步操作,并选择何时向主 Agent 回报。Meta 表示,这种持久化设计降低了对困难多步骤任务的延迟和引导成本。
Muse Code 使用本地事件日志。每一次模型调用、工具运行、审批和编辑都会被追加写入日志。Meta 称这个单一事实来源为"精确回放"和"重启安全"。崩溃后,Agent 可以精确地从停止处恢复,让长时运行的任务在故障中存活下来。
三个默认技能随 Agent 一起交付。/plan 将任务转化为需要审批的计划。/grill 对该计划进行压力测试直至其成立。/goal 致力于成功完成指定目标。
Muse Spark 1.2 是对 Muse Spark 1.1 的一次编程聚焦更新。Meta 报告在代码生成、复杂调试、代码库理解以及端到端开发者工作流方面有所提升。研究团队在编程任务上大幅增加了训练算力,并扩展了环境多样性。该模型在其他领域(包括通用 Agent)保持了自己的优势。
三个重要的训练细节:
与工具链共同训练(Co-training with the harness):Muse Spark 1.2 是与 Muse Code 共同训练的。训练包含基于 rejection-sampled 的工具链轨迹以及对目标、压缩和子 Agent 的配方优化。Muse Code 工具集被集成进来以最大化工具链兼容性。
长时域训练(Long-horizon training):训练覆盖全代码仓库生成、大型端到端项目以及自动研究。该模型使用规划、目标条件化和上下文压缩来维持进展。
自我改进(Self-improvement):Muse Spark 1.1 生成了挑战性的编程环境和指令遵循模板,然后根据这些要求对候选解决方案进行评分。这为 1.2 产生了一个可扩展的训练数据集。
https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2

Meta 的方法论报告异常具体。Terminal-Bench 2.1 使用全部 89 个任务,pass@1 五次尝试。DeepSWE v1.1 覆盖 113 个任务,分布于 91 个代码仓库和五种语言。Meta Internal Coding Bench 包含 440 个任务,衍生自真实的内部 Pull Request。运行在隔离的 Daytona 云沙箱中执行。对比对象包括 Grok 4.5、Claude Opus 5、GPT-5.6 Terra、Gemini 3.6 Flash 和 Kimi K3,每者均配有各自的 Agent 产品。Meta 指出其工具链可能未针对第三方模型进行调优。作为参考,Meta 的模型页面列出 Muse Spark 1.1 在 Terminal-Bench 2.1 上得分为 80.0。
Meta 测试了迭代 GPU 内核优化,历经 1000+ 次工具调用,运行时间长达 24 小时。该模型编写、编译、分析性能,并针对提供的基准线逐步改进内核。基准测试覆盖了 NVIDIA Hopper GPU 上的 KDA 和 MLA 内核。对于 KDA,基准是 FLA Triton 实现,禁止使用第三方内核库。Muse Spark 1.2 搭配了一个分块并行准备内核与顺序块间扫描。对于 MLA,参考是 PyTorch,批量大小为 1、64 个头、序列长度 8192、潜在维度 512。该模型构建了一个两内核 Triton 流水线,将共享的 KV 潜在向量同时用作 K 和 V。
Muse Code 是一款面向 macOS 和 Linux 的 Beta 终端编程 Agent,由 Muse Spark 1.2 驱动。
持久化异步后台 Agent 取代了每个任务重新启动的设计,以减少重复的信息收集。
追加写入本地事件日志使运行时实现"精确回放",并在崩溃后"重启安全"。
Muse Spark 1.2 与工具链共同训练,并在长时域、仓库级工作上进行了训练。
内核案例研究在 NVIDIA Hopper KDA 和 MLA 内核上,历经 24 小时执行了 1000+ 次工具调用。