前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8336
  • Perplexity 用 GPT-6 Astra 接管端到端系统
  • OpenAI 用 AI 写代码再用 AI 审查:Codex 安全门禁实践
  • 生产环境 LLM 推理性能与可靠性优化实战
  • 多 AI 协作必须设计交接机制而非仅靠上下文
  • deepseek-harness 体验:22 万星的开源 AI 插件框架
  • Cognition 发布 SWE-2:低成本对标 Fable 5.1 的代码模型
  • 边缘 AI 部署:LLM 优化最佳实践
  • 边缘设备 LLM 扩展:完整技术指南
  • VS Code 1.137:AI 自动化、语音模式与 GitHub 深度集成
  • Real-SWE:基于私有企业代码库的 AI 模型基准测试
  • OpenResearch:本地优先的多 Agent 研究工作台
  • Check:给 Claude Code 加幻觉防护层
  • Postman 集合一键转为 MCP 工具:实操路径
  • NestJS 测试覆盖提升与安全加固实战
  • Next.js Serverless 下 PDFKit 字体缺失修复
  • 评测编码Agent前,先用同一组任务跑两遍
  • LLM Wiki:文档自动构建可维护知识库的开源桌面应用
  • 深入解析结构化输出:让 AI 生成绝对可解析的 JSON
  • MCP安全核心是权限体系重设计,而非传统边界防护
  • GPT-6 Astra 在机器人基准测试中展现空间推理飞跃
  • Auterix:零依赖通用协议,跨 21 个 AI 工具统一上下文规范
  • 后量子 TLS 是平台迁移工程,不是密码学研究
  • Anthropic 发布 AI-Native SDLC 实践手册:代码不再是瓶颈
  • OpenAI 建议 GPT-6 Astra 提示词应精简,减少安全限制
  • Claude Code 创始人:AI 编程要守住代码质量标准
  • Hyperresearch:Agent 驱动的研究知识库,单次跑 250+ 信源
  • 12 个已落地的 B2B 营收 AI Agent 用例,附代码
  • LLM 项目上线后才会暴露的 6 个隐蔽 Bug
  • OpenAI 代理向 RubyGems 上传两千恶意包
  • AI 时代缓存失效难题复发:LLM 推理的隐性成本
  • Google发布TimesFM-3:单次前向传播即可完成多步时间序列预测
  • 阿里 Qoder CLI 开放自定义模型接入
  • 开源项目 Minitap 指控谷歌盗用代码用于 Artemis,许可证违规引热议
  • GPT-6 Astra 刷穿 FrontierMath Tier 4,AI 数学能力达新里程碑
  • Kimi K2.8发布:性能逼近K3百万上下文全员开放
  • DeepSeek v4.1-Flash发布:763B参数新型因果编解码架构
  • 已加载 36 / 8336
9.0
重磅
AI SCORE
模型发布2026-09-13 07:56

Cognition 发布 SWE-2:低成本对标 Fable 5.1 的代码模型

MarkTechPost#Cognition#代码模型#AI 编程
Editor brief · 编辑速览

Devin 背后的 Cognition 发布基于 Kimi K3 后训练的代码模型 SWE-2,在 FrontierCode 上得分 50.0%,与 Fable 5.1 仅差 1 分,成本降低 64%。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Cognition 发布了 SWE-2,这是其迄今为止能力最强的编程模型。SWE-2 基于 Kimi K3(Moonshot AI 的 2.8T 参数开源模型)通过强化学习进行后训练。Cognition 报告,SWE-2 在 FrontierCode 1.1 Main 上得分为 50.0%,与 Fable 5.1 仅差 1 分,成本却低 64%。此外,SWE-2 还是 Cognition 首款支持可选推理 effort 水平的模型,所有级别均在同一次 RL 训练中完成。

能否自行部署?无法在自有基础设施上部署。SWE-2 没有开源权重,也不提供独立 API。它目前仅在 Devin: Desktop 和 CLI 中运行,Devin Web 和 Fusion 即将推出。

SWE-2 建立在 SWE-1.7 的基础设施和配方之上——后者基于 Kimi K2.7 进行后训练。此次 Cognition 将 RL 扩展到了数万亿参数级别,使用的基座模型参数规模接近原来的 3 倍。Cognition 表示,其 RL 仍在 K3 之上发现了相当大的提升空间,在许多基准测试上增加了 5 到 6 个百分点。

主要变化在于一种 RL 算法,能够在一次训练中同时训练 3 个 effort 级别。每个级别都带有各自的成本惩罚项,因此整个成本-性能前沿曲线同时向前推进。

Cognition 发布了如下表格。公开成绩使用公开数据;其余模型均在其原生测试环境中以最佳配置运行。

Benchmark SWE-2 Kimi K3 Grok 4.6 Fable 5.1 GPT-5.6 Sol GPT-6 Astra SWE-1.7
FrontierCode 1.1 Main 50.0% 44.2% 48.0% 50.9% 47.5% 53.3% 42.0%
DeepSWE 1.1 73.0% 68.5% 67.5% 67.4% 72.7% 74.1% 37.7%
Terminal-Bench 2.1 92.8% 88.3% 88.4% 91.4% 88.8% 89.9% 81.5%
Terminal-Bench 4 27.3% 21.5% 20.3% 55.8% 37.3% 57.9% 7.6%

SWE-2 在 Terminal-Bench 2.1 上领先,并在每一项上均超越了其 K3 基座模型。Cognition 表示,SWE-2 与 GPT-6 Astra 仅差几分,但成本仅为其四分之一。明显的短板是 Terminal-Bench 4,SWE-2 落后 Fable 5.1 和 GPT-6 Astra 约 30 分。FrontierCode 是 Cognition 自有的基准测试,所有竞争对手的成绩均来自 Cognition 的评测。

模型行为:减少绕路

SWE-1.7 在简单任务上往往过度探索。SWE-2 通过 Cognition 所称的"专注探索"(focused exploration)解决了这一问题。在 FrontierCode 1.1 Main 上,SWE-2 medium 的得分高于 SWE-1.7,同时步数减少 58%,成本降低 81%。每次运行的平均步数从 127 步(SWE-1.7)降至 53 步(medium)、80 步(high)和 98 步(max)。SWE-2 medium 在第 18 步时即完成首次真实编辑,而 SWE-1.7 需要 48 步。

Cognition 团队还报告了 3 个行为模式:更强的端到端测试覆盖率、工具被阻止时的应变能力,以及验证纪律。当受到挑战时,模型会重新推导结论,而非重新断言。

Pareto 驱动的成本惩罚:奖励为 R = S 减去 lambda 乘以 C,其中 S 为二元成功标志,C 综合了以 USD 计量的推理成本和 rollout 时间。Cognition 证明,只有线性惩罚才能使 RL 目标纯粹依赖于平均成本和解决率。每个 effort 级别的 lambda 被设置为基座模型 Pareto 曲线的局部斜率。这使得等奖励线与前沿曲线相切,因此奖励只能通过推动前沿曲线上移来提升。

长度加权奖励基线:Cognition 分享了自 SWE-1.6 起使用的基线。梯度幅度与 rollout 长度高度相关,因此组基线按 token 数加权:sum(R × L) 除以 sum(L)。在消融实验中,这保持了推理与训练之间更低的 KL 散度,并在不增加额外计算量的情况下稳定了训练。

Rollout 服务与数值精度:Prefill delayer 将相邻请求批量处理,使每 GPU TPM 和每请求 TPS 提升 10% 到 20%。DSpark 推测性解码加速 rollouts,draft model 通过 SpecForge 重新训练以获得 15% 更长的接受长度,然后与 policy 一同在线训练。NVFP4 和 FP8 内核配合量化感知训练,将内存占用控制在较低水平,训练-推理不匹配程度低于 SWE-1.7。

数据:Cognition 将 RL 环境扩充至原来的 3 倍,添加了指令遵循覆盖层,并构建了一套飞轮流程,利用更早的 SWE-2 检查点修正验证器中的假阳性和假阴性。

可信度检查

Cognition 重新运行了其开源可信度研究中的 2 项评估。在 145 个关于中国的政治敏感问题中,SWE-2 的总体通过率为 98.0%:英语 99.8%、简体中文 95.2%、繁体中文 99.1%。在跨客户框架的上下文相关漏洞测试中,没有任何框架对任何模型产生统计显著的变化。

Interactive Explainer

SWE-2 在 FrontierCode 1.1 Main 上得分为 50.0%,与 Fable 5.1 仅差 1 分,成本却低 64%

基于 2.8T 参数的 Kimi K3 后训练;RL 在大多数基准测试上提升 5 到 6 个百分点

首款支持 effort 级别的 Cognition 模型,通过斜率匹配成本惩罚在 1 次 RL 训练中完成

SWE-2 medium 在 FrontierCode 上相比 SWE-1.7 步数减少 58%、成本降低 81%

无开源权重、无 API:仅限 Devin,付费用户可在 2026 年 10 月 10 日前免费使用

Original source

本文由 AI 翻译整理自 MarkTechPost,原文版权归原作者所有。

阅读英文原文
上一篇
deepseek-harness 体验:22 万星的开源 AI 插件框架
下一篇
边缘 AI 部署:LLM 优化最佳实践