Nous Research 发布 14B 参数开源编码模型,性能媲美更大模型,对追求开源/本地部署的程序员有直接价值。
Nous Research 是一家获得加密货币风投公司 Paradigm 支持的开源人工智能初创公司。本周一,该公司发布了一款全新的竞赛编程模型,并称其性能足以媲美、甚至超越多款规模更大的闭源系统——而它只用了 48 块 Nvidia 最新的 B200 GPU,训练时间仅为四天。
这款名为 NousCoder-14B 的模型,是拥挤的 AI 编程助手赛道中的又一位新选手。不过,它出现的时机尤其引人注目:自元旦以来,竞争对手 Anthropic 推出的 Agent 编程工具 Claude Code 一直占据着社交媒体的讨论中心,开发者纷纷发布情绪激动的使用感言,盛赞它的能力。这两件几乎同时发生的事,凸显出 AI 辅助软件开发的演进速度有多快,也体现了大大小小的公司正在展开多么激烈的竞争——许多人相信,这项技术最终将成为软件开发方式的基础设施。
在 LiveCodeBench v6 上,NousCoder-14B 达到了 67.87% 的准确率。LiveCodeBench v6 是一项标准化评测,用于测试模型解决 2024 年 8 月至 2025 年 5 月期间发布的竞赛编程题目的能力。根据 Nous Research 随模型一同发布的技术报告,这一成绩比它所基于的基础模型——Alibaba 的 Qwen3-14B——提高了 7.08 个百分点。
“我把问题描述交给 Claude Code,它在一个小时内就生成了我们去年花时间构建的东西。”Google 首席工程师、Gemini API 负责人 Jaana Dogan 上周在 X 上的一篇爆款帖子中写道。这句话很好地概括了当下人们对 AI 编程工具的普遍感受。Dogan 所说的是一套分布式 Agent 编排系统,她的团队为此开发了整整一年,而 Claude Code 只根据一段三段式 prompt,就做出了近似的系统。
这种对比颇具启发意义:Anthropic 的 Claude Code 凭借端到端软件开发能力的演示吸引了无数关注,而 Nous Research 则押注于这样一种可能——在可验证问题上训练的开源替代方案能够缩小差距,而且构建这些模型时所采用方法的透明度,与模型的绝对能力同样重要。
NousCoder-14B 与众多竞争对手发布的模型相比,最大的不同在于其彻底的开放性。Nous Research 不仅发布了模型权重,还公开了完整的强化学习环境、基准测试套件和训练框架。这套系统基于该公司的 Atropos 框架构建,使任何拥有足够算力的研究人员都可以复现或扩展这项工作。
“将 Atropos 技术栈开源,为可复现的奥林匹克竞赛级推理研究提供了必要的基础设施。”一位观察者在 X 上写道,总结了这次发布对学术界和开源社区的重要意义。
该模型由 Nous Research 驻场研究员 Joe Li 训练,他本人曾经也是一名竞赛程序员。Li 的技术报告展现了一个出人意料的个人视角:他将模型的进步轨迹,与自己在竞赛编程平台 Codeforces 上的成长经历进行了比较。在 Codeforces 上,参赛者会根据比赛表现获得相应的 Rating。
根据将 LiveCodeBench 分数映射到 Codeforces Rating 的粗略估算,Li 计算得出,NousCoder-14B 从大约 1600~1750 Rating 提升到 2100~2200 Rating。这一跨越与他自己从 14 岁到 16 岁、经过近两年持续练习后取得的进步相当。而模型只用了四天,就完成了同等程度的提升。
“看着最后一轮训练逐步展开,是一种相当超现实的体验。”Li 在技术报告中写道。
不过,Li 很快指出了一个重要前提,而这也触及了关于 AI 学习效率的更广泛问题:在那两年里,他大约解决了 1,000 道题,而模型则需要 24,000 道题。至少就目前而言,人类仍然是样本效率高得多的学习者。
NousCoder-14B 的训练过程,为我们提供了一个观察窗口,让我们得以了解研究人员如何利用日益复杂的强化学习技术来提升 AI 的推理能力。
这套方法依赖于研究人员所谓的“可验证奖励”:模型生成代码解法,系统针对测试用例执行这些解法,然后向模型提供一个简单的二元信号——正确或错误。这套反馈循环在概念上很直接,但要实现大规模运行,就需要大量基础设施支持。
Nous Research 使用云计算平台 Modal 并行运行沙箱化的代码执行任务。24,000 道训练题平均每道都包含数百个测试用例,系统必须验证生成的代码能否在时间和内存限制内产生正确输出——相应限制分别为 15 秒和 4GB。
训练采用了一种名为 DAPO(Dynamic Sampling Policy Optimization,动态采样策略优化)的技术。研究人员在实验中发现,它的表现略优于其他替代方案。其中一项关键创新是“动态采样”:如果模型每次尝试都能成功解决某道题,或者每次尝试都无法解决,就丢弃这类训练样本,因为它们无法为学习提供有效的梯度信号。
研究人员还采用了“迭代式上下文扩展”:首先使用 32,000 token 的上下文窗口训练模型,随后将其扩展到 40,000 token。在评测阶段,进一步将上下文扩展到大约 80,000 token 时取得了最佳结果,准确率达到 67.87%。
也许最重要的是,这套训练流水线让推理与验证过程相互重叠:模型一生成某道题的解法,就会立刻开始处理下一道题,同时由系统检查前一个解法。通过这种流水线机制,再结合多个模型实例并行工作的异步训练方式,系统能够最大限度地提高昂贵 GPU 集群的硬件利用率。
Li 的技术报告中隐藏着一项对 AI 未来发展影响重大的发现:NousCoder-14B 的训练数据集,已经涵盖了“所有现成可用、可验证,并且采用标准化数据集格式的竞赛编程题目中的相当大一部分”。
换句话说,在这个特定领域,研究人员正在逼近高质量训练数据的极限。
“互联网上竞赛编程题目的总数量,与我们用于训练的 24,000 道题大致处于同一个数量级。”Li 写道,“这意味着,在竞赛编程领域,我们已经接近高质量数据的极限。”
这一观察与 AI 行业日益增长的数据约束忧虑不谋而合。算力可以继续按照已经得到充分理解的经济规律和工程原则扩展,但正如 Li 所说,训练数据却“越来越有限”。
“未来一些最重要的研究,似乎需要集中在合成数据生成,以及数据高效的算法与架构等领域。”他总结道。
对于竞赛编程而言,这项挑战尤其严峻,因为这个领域需要具有已知正确答案、并且能够自动验证的题目。自然语言任务可以依靠人工评估或代理指标,但代码要么能运行,要么不能运行——这使合成数据生成变得困难得多。
Li 指出了一条潜在路径:不仅训练模型解决问题,还要训练模型生成可解的问题,从而实现一种自我博弈。这与在游戏 AI 系统中取得成功的技术类似。“一旦解决了合成题目生成问题,自我博弈就会成为一个非常有趣的方向。”他写道。
Nous Research 已经在 AI 领域确立了一个鲜明的定位:这是一家致力于发布开源模型的公司,而这些模型能够与闭源替代方案竞争,有时甚至可以超越它们。
2025 年 4 月,该公司在一轮融资中筹集了 5,000 万美元,由专注于加密货币的风投公司 Paradigm 领投。Paradigm 由 Coinbase 联合创始人 Fred Ehrsam 创办。根据部分报道,Nous Research 的融资总额已经达到 6,500 万美元。这笔投资反映出市场对去中心化 AI 训练方式的兴趣不断增长,而 Nous Research 已经在这一方向上开发了 Psyche 平台。
该公司此前发布的模型包括 Hermes 4。我们曾报道,这一系列模型“在没有内容限制的情况下超越 ChatGPT”。此外还有 DeepHermes-3,该公司将它描述为首个“可按需开启推理的模型”——用户可以根据需要启用扩展思考能力。
Nous Research 建立起了独特的审美风格和社区文化,但这也引发了一些质疑:风格是否会盖过实质?“我当然会相信一家用动漫头像的公司。别他妈再刷榜了。”一位批评者在 X 上写道。他所指的是 Nous Research 的动漫风格品牌形象,以及行业中专门针对基准测试优化性能的做法。
其他人则提出了技术层面的问题。“从基准测试来看,Nemotron 更好。”一位评论者指出。Nemotron 是 Nvidia 的语言模型系列。还有人询问 NousCoder-14B 是“专注于 Agent,还是只做‘一次性’编程”——对于实际的软件开发而言,这一区别至关重要,因为根据反馈反复迭代,通常会比一次性尝试获得更好的结果。
此次发布列出了未来工作的多个方向,也暗示了 AI 编程研究接下来可能的发展路径。
多轮强化学习位居首位。目前,模型生成解法后只会收到最终的二元奖励——通过或失败。但竞赛编程题通常会提供公开测试用例,从而产生中间反馈,例如编译错误、输出错误和超出时间限制。训练模型在多次尝试中吸收并利用这些反馈,可能会显著提高模型性能。
控制回答长度同样是一项挑战。研究人员发现,错误解法往往比正确解法更长,而且在训练过程中,回答长度会迅速占满可用的上下文窗口——他们尝试了多种算法调整,但都未能解决这一问题。
Li 提出的“题目生成与自我博弈”可能是其中最雄心勃勃的方向——训练模型同时具备解题和出题能力。这将允许模型生成自己的训练课程,从而直接应对数据稀缺问题。
“人类非常擅长为其他竞赛程序员设计有趣且有用的问题,但在创造性地生成问题方面,LLM 的能力似乎仍然存在明显差距。”Li 写道。
该模型现已在 Hugging Face 上发布,采用 Apache 2.0 许可证。对于希望在这项工作基础上继续开发的研究人员和开发者,Nous Research 也同时发布了完整的 Atropos 训练技术栈。
Li 在少年时期投入了两年时间,才从 Codeforces 上 1600 Rating 的新手成长为 2100 Rating 的竞赛选手;AI 只用了 96 个小时,就复现了同样的进步。他需要解决 1,000 道题,模型则需要 24,000 道。但用不了多久,这些系统或许就能学会为自己出题、自我教学,并最终彻底超越人类制定的基准。
现在的问题已经不再是机器能否学会编程,而是:它们是否很快就会成为比我们人类更优秀的老师?