JetBrains 发布 12B 参数的 Mellum2 MoE 模型,作为 IDE 厂商进军 AI 的重要举措,预期会增强代码补全和 AI 编程功能。
Mellum2 是一个拥有 120 亿参数的 Mixture-of-Experts 模型,基于自然语言和代码从零开始训练。
该模型处理每个 token 时仅激活 25 亿参数,因此能够实现高吞吐、低延迟的推理。Mellum2 可用于路由、RAG、摘要生成、sub-agent、高吞吐量的编程功能,以及私有化部署。
该模型采用 Apache 2.0 许可证发布。
与规模相近的模型相比,Mellum2 在基准测试中表现出了有竞争力的性能,同时推理速度提升了两倍以上。
在 Hugging Face 上下载模型:https://huggingface.co/collections/JetBrains/mellum-2
如需了解架构细节、训练配置、基准测试及评估方法,请阅读完整的技术报告:https://arxiv.org/pdf/2605.31268
今天,我们正式发布 Mellum2——一个针对低延迟文本与代码工作负载优化的开放式 Mixture-of-Experts 模型。
Mellum 最初是一个代码补全模型。在 Mellum2 中,我们将这一基础能力扩展到了更广泛的自然语言和软件工程任务,同时依然专注于高效推理和易部署性。
现代 AI 系统越来越依赖多次模型调用,包括路由、检索、摘要生成、规划、验证和工具使用。其中许多操作对延迟十分敏感,却并不需要调用现有规模最大的模型。Mellum2 瞄准的正是这些工作负载。
在技术报告中,我们从代码生成、推理、科学和数学等基准测试维度对 Mellum2 进行了评估。Mellum2 的表现足以与规模相近的开放模型竞争,同时推理速度提升了两倍以上,因此非常适合高吞吐量的生产工作负载。
Mellum2 是一个 Mixture-of-Experts 模型。
MoE 架构在保持较高模型总容量的同时,每个 token 只会激活一部分参数。这让推理更加高效,也有助于降低实时工作负载的服务成本。
Mellum2 有意专注于文本和代码,而不是多模态任务。这种专业化定位使模型能够保持紧凑,并高效处理软件工程工作负载。
在多模型系统中,Mellum2 非常适合作为轻量级的路由与编排模型,可用于 prompt 分类、工具选择以及中间控制流步骤。
该模型也非常适合对延迟敏感的检索流水线,包括上下文压缩、摘要生成和检索结果后处理。
Mellum2 可用于 Agent 的各类子任务,例如规划、验证、转换和上下文准备,从而减少在中间操作中调用更大模型的必要性。
由于 Mellum2 是开放模型,而且部署服务效率较高,因此可以部署在涉及专有代码或内部数据的自托管环境中。
随着 AI 系统逐渐成熟,最有效的架构正在变得不再那么单体化。
单个 frontier model 固然可以非常强大,但生产系统往往需要多个专业组件协同工作,例如检索器、路由器、具备代码理解能力的模型、验证器、工具调用模型,以及规模更大的推理模型。
我们将 Mellum2 视为一种“焦点”模型:它速度快、职责边界清晰,专门针对大型 AI 系统内部的高频任务进行了优化。
其目标并不是取代技术栈中的所有模型,而是让整个技术栈运行得更快、成本更低,也更容易控制。
如果你正在构建面向软件工程的 AI 系统——无论是在 IDE 内部、RAG 流水线中、Agent 工作流里,还是私有基础设施上——现在都可以开始尝试 Mellum2。
本文提到的模型:1
本文提到的 Collections:1
· 注册或登录后发表评论
本文提到的模型:1
本文提到的 Collections:1