Devin 背后的 Cognition 发布基于 Kimi K3 后训练的代码模型 SWE-2,在 FrontierCode 上得分 50.0%,与 Fable 5.1 仅差 1 分,成本降低 64%。
Cognition 发布了 SWE-2,这是其迄今为止能力最强的编程模型。SWE-2 基于 Kimi K3(Moonshot AI 的 2.8T 参数开源模型)通过强化学习进行后训练。Cognition 报告,SWE-2 在 FrontierCode 1.1 Main 上得分为 50.0%,与 Fable 5.1 仅差 1 分,成本却低 64%。此外,SWE-2 还是 Cognition 首款支持可选推理 effort 水平的模型,所有级别均在同一次 RL 训练中完成。
能否自行部署?无法在自有基础设施上部署。SWE-2 没有开源权重,也不提供独立 API。它目前仅在 Devin: Desktop 和 CLI 中运行,Devin Web 和 Fusion 即将推出。
SWE-2 建立在 SWE-1.7 的基础设施和配方之上——后者基于 Kimi K2.7 进行后训练。此次 Cognition 将 RL 扩展到了数万亿参数级别,使用的基座模型参数规模接近原来的 3 倍。Cognition 表示,其 RL 仍在 K3 之上发现了相当大的提升空间,在许多基准测试上增加了 5 到 6 个百分点。
主要变化在于一种 RL 算法,能够在一次训练中同时训练 3 个 effort 级别。每个级别都带有各自的成本惩罚项,因此整个成本-性能前沿曲线同时向前推进。
Cognition 发布了如下表格。公开成绩使用公开数据;其余模型均在其原生测试环境中以最佳配置运行。
| Benchmark | SWE-2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra | SWE-1.7 |
|---|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50.0% | 44.2% | 48.0% | 50.9% | 47.5% | 53.3% | 42.0% |
| DeepSWE 1.1 | 73.0% | 68.5% | 67.5% | 67.4% | 72.7% | 74.1% | 37.7% |
| Terminal-Bench 2.1 | 92.8% | 88.3% | 88.4% | 91.4% | 88.8% | 89.9% | 81.5% |
| Terminal-Bench 4 | 27.3% | 21.5% | 20.3% | 55.8% | 37.3% | 57.9% | 7.6% |
SWE-2 在 Terminal-Bench 2.1 上领先,并在每一项上均超越了其 K3 基座模型。Cognition 表示,SWE-2 与 GPT-6 Astra 仅差几分,但成本仅为其四分之一。明显的短板是 Terminal-Bench 4,SWE-2 落后 Fable 5.1 和 GPT-6 Astra 约 30 分。FrontierCode 是 Cognition 自有的基准测试,所有竞争对手的成绩均来自 Cognition 的评测。
SWE-1.7 在简单任务上往往过度探索。SWE-2 通过 Cognition 所称的"专注探索"(focused exploration)解决了这一问题。在 FrontierCode 1.1 Main 上,SWE-2 medium 的得分高于 SWE-1.7,同时步数减少 58%,成本降低 81%。每次运行的平均步数从 127 步(SWE-1.7)降至 53 步(medium)、80 步(high)和 98 步(max)。SWE-2 medium 在第 18 步时即完成首次真实编辑,而 SWE-1.7 需要 48 步。
Cognition 团队还报告了 3 个行为模式:更强的端到端测试覆盖率、工具被阻止时的应变能力,以及验证纪律。当受到挑战时,模型会重新推导结论,而非重新断言。
Pareto 驱动的成本惩罚:奖励为 R = S 减去 lambda 乘以 C,其中 S 为二元成功标志,C 综合了以 USD 计量的推理成本和 rollout 时间。Cognition 证明,只有线性惩罚才能使 RL 目标纯粹依赖于平均成本和解决率。每个 effort 级别的 lambda 被设置为基座模型 Pareto 曲线的局部斜率。这使得等奖励线与前沿曲线相切,因此奖励只能通过推动前沿曲线上移来提升。
长度加权奖励基线:Cognition 分享了自 SWE-1.6 起使用的基线。梯度幅度与 rollout 长度高度相关,因此组基线按 token 数加权:sum(R × L) 除以 sum(L)。在消融实验中,这保持了推理与训练之间更低的 KL 散度,并在不增加额外计算量的情况下稳定了训练。
Rollout 服务与数值精度:Prefill delayer 将相邻请求批量处理,使每 GPU TPM 和每请求 TPS 提升 10% 到 20%。DSpark 推测性解码加速 rollouts,draft model 通过 SpecForge 重新训练以获得 15% 更长的接受长度,然后与 policy 一同在线训练。NVFP4 和 FP8 内核配合量化感知训练,将内存占用控制在较低水平,训练-推理不匹配程度低于 SWE-1.7。
数据:Cognition 将 RL 环境扩充至原来的 3 倍,添加了指令遵循覆盖层,并构建了一套飞轮流程,利用更早的 SWE-2 检查点修正验证器中的假阳性和假阴性。
Cognition 重新运行了其开源可信度研究中的 2 项评估。在 145 个关于中国的政治敏感问题中,SWE-2 的总体通过率为 98.0%:英语 99.8%、简体中文 95.2%、繁体中文 99.1%。在跨客户框架的上下文相关漏洞测试中,没有任何框架对任何模型产生统计显著的变化。
SWE-2 在 FrontierCode 1.1 Main 上得分为 50.0%,与 Fable 5.1 仅差 1 分,成本却低 64%
基于 2.8T 参数的 Kimi K3 后训练;RL 在大多数基准测试上提升 5 到 6 个百分点
首款支持 effort 级别的 Cognition 模型,通过斜率匹配成本惩罚在 1 次 RL 训练中完成
SWE-2 medium 在 FrontierCode 上相比 SWE-1.7 步数减少 58%、成本降低 81%
无开源权重、无 API:仅限 Devin,付费用户可在 2026 年 10 月 10 日前免费使用