前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8483
  • RAG 排序不能只靠余弦相似度
  • 生产级 Prompt 的七类隐蔽问题
  • 让 RAG 拒绝使用劣质上下文
  • TypeScript Agent 的四层注入防线
  • 用 LangGraph.js 实现持久化人工审批
  • Node应用如何精确核算LLM成本
  • Token防火墙削减35%上下文成本
  • Qwen3.8 Max性能追近Opus
  • 伪造审查备注绕过AI反诈检测
  • 用 MCP 为纯文本编程智能体补上视觉
  • Cloudflare推出网站智能体就绪度指标
  • Cloudflare构建开放智能体互联网协议
  • Cloudflare推出私有数据AI搜索
  • 一键为现有网站接入WebMCP
  • Kitesurf:运行在Workers上的智能体浏览器
  • 新版MCP转向无状态架构
  • 让过期的 Agent 上下文直接阻断 CI
  • 昇腾适配 Ling-3.0 并推出 PyPTO
  • 让编程 Agent 用你熟悉的语言写脚本
  • 数据库索引提速背后的写入代价
  • Meta低价模型与可恢复编程Agent登场
  • 如何构建 Agent 难以作弊的评测
  • Claude Code 迁移 OpenCode 踩坑实录
  • RAG向量数据库的真实成本陷阱
  • 编码代理缺失的其实是产品定义
  • 用熔断机制约束失控的 AI Agent
  • 别让 AI 任务止步于聊天记录
  • 人类审核仍漏掉三分之一智能体威胁
  • OpenAI智能体曾秘密协同攻击
  • AI 工作流为何会在无改动时失效
  • 开源本地化求职管理平台 FitPilot
  • 在一次性沙箱中测试编程 Agent 越界
  • 别把系统提示词写成规则仓库
  • Agent 审批卡的盲签名陷阱
  • 为真实项目编写AGENTS.md的经验
  • 用固定语料阻止AI审查能力回退
  • 为AI代码变更建立分阶段权限门禁
  • 别让LLM评测工具测到自身拥塞
  • AI自动扫描将放大密钥泄露风险
  • GPT-5.6 Sol能力升级并扩大免费开放
  • 人脸识别的94%匹配为何不可信
  • 如何测试具备工具权限的完整Agent链路
  • 多Agent共享状态为何会静默丢失
  • 一次失控编程Agent如何烧掉138美元
  • 一条命令统一九类触觉传感器数据
  • VS Code 1.132强化智能体开发体验
  • 用对话式设计Agent生成流水线契约
  • 精简智能体规则文件的实用原则
  • LLM 评审为何不能替代确定性校验
  • 用定时 Codex 任务生成可靠日报
  • 六智能体协作生成并部署游戏
  • 已加载 51 / 8483
8.0
热点
AI SCORE
编程提效2026-08-06 20:31

Meta低价模型与可恢复编程Agent登场

The Decoder#Meta#编程Agent#模型成本
Editor brief · 编辑速览

Meta发布Muse Spark 1.2及支持崩溃后续接任务的Muse Code,主打低价而非顶级性能。最低档输出每百万Token仅0.2美元,但用户须同意数据用于训练,且现有基准测试存在明显缺项。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Meta 发布了全新的 Muse Spark 1.2 模型,以及首款专用 coding agent。最便宜的套餐中,每百万输出 token 仅需 0.2 美元,但用户需要以自己的数据作为交换。此外,其 benchmark 还存在一个非常明显的缺口。

据 Meta 介绍,Muse Spark 1.2 主要是今年早些时候发布的 Muse Spark 1.1 的编程能力升级版。该公司声称,新模型在代码生成、调试以及理解和推理大型代码库方面均有所提升。Meta 为编程任务投入了更多训练算力,并扩大了训练环境的数量。

该模型主要针对长时间运行的任务进行训练,例如生成完整的代码仓库或独立开展研究。为了在这些长时间会话中始终沿着正确方向推进,它会提前规划步骤、围绕固定目标开展工作,并压缩此前的上下文,而不是直接将其截断。

部分训练数据来自上一代模型本身。Muse Spark 1.1 负责生成编程任务和指令模板,然后对尝试得到的解决方案进行评分,评估其满足要求的程度。Meta 表示,这一过程能让 1.2 比上一代模型更准确地遵循复杂指令。

Image: Meta

Meta 引用了 Terminal-Bench 2.1、DeepSWE v1.1,以及来自其自有代码库的 440 项任务作为依据,并将 Spark 1.2 与 Grok 4.5、Claude Opus 5、GPT-5.6 Terra(并非 OpenAI 更强的 Sol 模型)和 Gemini 3.6 Flash 进行了比较。Spark 1.2 相较 Spark 1.1 有明显进步,但并非总能缩小与顶尖模型之间的差距。

Image: Meta

Meta 自己公布的方法说明也承认,这套测试环境并未针对竞品模型进行调优,因此可能无法反映它们的最佳成绩。查看其他排行榜也能证实这一点:例如,Opus 5 在其他榜单上的得分比 Meta 图表中的成绩高出约两个百分点。Kimi K3 也出现在 Meta 的方法说明文档中。该公司称自己测试了这款开放模型,但已发布的 benchmark 中却没有 K3。在 Terminal-Bench 2.1 上,K3 仅以微弱差距落后于 Opus 5,同时大幅领先 Spark 1.2。

DeepSWE 的测试结果同样无法与官方排行榜直接比较,因为每个模型都运行在各自的 Agent 中。这是因为 Meta 在发布新模型的同时,也推出了自家的 Agent,作为 Claude Code 和 OpenAI Codex 的替代方案。

Agent 崩溃后会从中断处原样继续

Muse Code 在终端中运行,只需一条命令即可安装,与 Claude Code 和 OpenAI Codex 类似。它的规划模式也会让人感到熟悉:/plan 会生成一份需要用户批准的计划。较为少见的是与之配套的 /grill,它会在执行前对计划进行压力测试,找出其中的薄弱环节。此外还有 /goal,用于推动 Agent 朝着固定目标前进。

真正的新功能在于这款工具处理 sub-agent 的方式。Meta 的辅助 Agent 会在整个会话期间保持活跃,并在有内容需要分享时主动汇报,而不是为某项子任务临时启动,完成后便立即关闭。这应该可以减少重复研究。

Muse Code 还提供了崩溃后的快速恢复功能。Agent 会把每一次模型调用、每一次批准操作和每一项变更都记录到本地协议文件中。竞争对手同样会保留完整日志,但 Meta 声称自己的记录更加精确:Muse Code 在崩溃后可以从中断的确切位置继续,而无须重新读取完整上下文。

用训练数据换取折扣

Wang 表示,Meta 的竞争重点是价格,而非能力。标准定价与 1.1 版本相同:每百万输入 token 1.25 美元,每百万输出 token 4.25 美元,价格相对便宜。新推出的套餐则把每百万输出 token 的价格降至仅 0.2 美元,但要求用户共享数据,用于改进模型。

西方竞争对手对每百万输出 token 的收费在 10 至 30 美元之间,而中国服务商的起步价为 0.18 美元。Kimi K3 是 Meta benchmark 中最显眼的缺席者,其价格为每百万输入 token 3 美元、每百万输出 token 15 美元,不过命中缓存后,输入价格会降至仅 0.3 美元。

Meta 的股价上周下跌了 10%。该公司 98% 的收入来自广告业务。

没有炒作的 AI 新闻——由人工精选

订阅 THE DECODER,即可享受无广告阅读、每周 AI 新闻通讯、每年六期独家前沿报告 “AI Radar”、完整档案访问权限,以及评论区访问权限。

继续阅读,了解完整情况。订阅我们,获取不炒作的报道。

访问 THE DECODER 的全部文章。

不受干扰地阅读——没有 Google 广告。

访问评论和社区讨论。

每周 AI 新闻通讯。

每年 6 期:“AI Radar”——深度解析关键 AI 议题。

参加 KI Pro 在线活动最高可享 25% 优惠。

访问我们完整的十年档案。

获取 The Decoder 最新的 AI 新闻。

Original source

本文由 AI 翻译整理自 The Decoder,原文版权归原作者所有。

阅读英文原文
上一篇
数据库索引提速背后的写入代价
下一篇
如何构建 Agent 难以作弊的评测