该2.52B参数模型在34项基准平均53.9分,工具调用和编码Agent表现突出,GGUF格式最小仅1.56GB,支持vLLM/SGLang/llama.cpp/Ollama/MLX。
OpenBMB 发布了 MiniCPM5-2B,这是 MiniCPM5 系列的第二个检查点,也是 MiniCPM5-1B 的后续版本。它是一个密集型因果语言模型,拥有 2,516,756,480 个参数,其中 1,981,982,720 个位于 embedding 层之外。它采用 42 层结构,使用分组查询注意力机制(16 个查询头和 2 个键/值头),原生上下文窗口为 131,072 个 token。架构采用标准 LlamaForCausalLM,因此主流引擎可以在不依赖自定义内核和无需 fork 模型代码的情况下直接加载。
是的,可以部署。权重采用 Apache 2.0 协议,可通过 vLLM、SGLang、Transformers、llama.cpp、Ollama、LM Studio、MLX 和 FlagOS 运行。
OpenBMB 将 MiniCPM5-2B 与同量级的 LFM2.5-2.6B、Qwen3.5-2B 和 Gemma-4-E2B-it 进行比较,并列出了 Qwen3.5-4B、granite-4.2-3B、Nemotron-3-Nano-4B、Gemma-4-E4B-it 和 LFM2.5-8B-A1B 作为参考。在 34 个基准测试横跨比较中,MiniCPM5-2B 平均得分为 53.9。该基准集中表现最好的基线模型是 Qwen3.5-4B,得分 51.1,其次是 granite-4.2-3B(42.7)和 LFM2.5-2.6B(33.2)。
在代码推理方面,MiniCPM5-2B 在 LiveCodeBench v6 上获得 69.1 分(基线为 56.4),在 SWE-bench Verified 上获得 46.4 分(基线为 33.6)。工具使用是差距最大的领域:τ²-Bench Telecom 97.1 分,BFCL v4 66.6 分,τ³-Bench Banking 20.8 分(基线仅为 6.8)。长上下文表现分化,NoLiMa 上 68.1 分对比 43.5 分,但 AA-LCR 上 59.0 分对比 61.0 分,LongBench v2 上 43.7 分对比 47.3 分。通用知识领域是参数规模差距体现最明显的地方:MMLU-Pro 上 70.8 分对比 78.0 分,Humanity's Last Exam 上 8.9 分对比 9.9 分。OpenBMB 将来自 Artificial Analysis 的基准数据与内部复现的结果分开标注。
训练遵循原始研究中描述的 UltraData 分层数据管理方法。基础训练包含稳定阶段和衰减阶段,然后中间训练将模型适配到目标数据分布。后训练从 400B token 的深度思考 SFT 开始,然后使用基于批评者的 JustRL II 算法为数学、代码、agent 任务和写作训练专业 RL 教师模型。
最后一步是线上策略蒸馏(OPD)。OPD 将 16 个 RL 专家(其中 5 个是 agent 相关的)合并到一个最终模型中。在每个响应位置,它计算学生和教师 logits 之间的全词汇表反向 KL 散度作为优势估计,替代基于验证器的优势估计。它复用 RL prompts 作为蒸馏数据,因此无需构建新的语料库。OpenBMB 测量 RL 加 OPD 阶段在推理和通用基准上平均提升 10.96 分,在 agent 相关基准上提升 6.96 分。
除权重外,OpenBMB 还发布了 Ultra-FineWeb、Ultra-FineWeb-L3、UltraX、UltraData-Code、UltraData-Math、UltraData-SFT-2605、UltraData-SFT-Agent-2609(包含 500K agent 样本)以及 UltraData-RL-2609(包含超过 80K RL 样本)。中间检查点也已发布,涵盖 Base、Midtrain 和仅 SFT 阶段,因此可以直接测量每个阶段的贡献。
MiniCPM5-2B 是一个可信的端侧 agent 和工具调用工作负载选项,而非通用知识模型。其优势在工具使用、编码 agent 和 NoLiMa 风格的长上下文检索上最为明显,在 MMLU-Pro、GPQA-Diamond 和 MATH-500 上则落后于更大的模型。开源数据和中间检查点使得 RL 加 OPD 的 claim 可被验证,这比标题的平均分数更有意义。