小米开源了 MiMo-V2.6 系列模型,包含 Pro/Flash/UltraSpeed 三个版本,宣称在综合基准上领先所有开源模型,并公开了 RL 训练环境与代码。
Xiaomi 开源 MiMo-V2.6:万亿参数模型登顶开源权重排行榜
Originally published at AI Frontier Post.
过去两天,这家从手机厂商转型为 AI 实验室的企业发布了 MiMo-V2.6——两款全模态模型,其中旗舰款号称在复合行业基准上超越了所有其他开源权重模型。模型检查点已无门槛地上传至 Hugging Face,采用 MIT 许可证:任何人都可以下载、微调和商业使用。
对外宣传的分数是厂商自报数据,所以应该视为一种声明而非定论:Artificial Analysis Intelligence Index v4.3 上得分 46.32。更难忽视的是权重包之外配套发布的所有内容。Xiaomi 将产生这两个模型的六天强化学习运行过程全程直播,随后与检查点一起发布了训练环境和 RL 代码。这是一个被设计成可复现的发布,而不仅仅是供人瞻仰。
该系列有三个版本。MiMo-V2.6-Pro 是旗舰款,Xiaomi 称其为迄今为止最强大的模型。MiMo-V2.6-Flash 是更轻量、更便宜的兄弟款,专为高吞吐量任务构建。而 MiMo-V2.6-Pro-UltraSpeed 是一种服务选项,在大约十倍价格下将输出速度提升至 20 倍——适用于延迟就是一切的workflows。
在底层实现上,Pro 是一个稀疏的混合专家模型:总计 1.02 万亿参数,每个 token 约 420 亿活跃参数,分布在 384 个路由专家中,任何给定 token 会激活其中 8 个。主干网络是 70 层,混合了滑动窗口注意力和全局注意力,专用的视觉塔处理图像,独立的编码器处理音频。两个模型都接受文本、图像、视频和音频作为输入,并输出文本,上下文窗口达 100 万 token。通过 Xiaomi API 进行的独立速度测量记录了约每秒 130 个输出 token。
基准测试情况(及其注意事项)
Xiaomi 拿来当招牌的数字是 Artificial Analysis Intelligence Index:Pro 得分 46.32,领先于 Z AI 的 GLM-5.3(45)和 Moonshot 的 Kimi K3(44)——是该排行榜上开源权重的最高分。作为参照,同一排行榜将闭源的 Grok 4.7 列为 46 分,而 Artificial Analysis 估算 Pro 的推理成本约为每次 Index 任务 0.13 美元——这个数字会引起 CFO 们的关注。
Xiaomi 自己的声明更大胆:称 Pro 在大多数 agent 基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当。但其自有表格中的细则就不那么光彩了。在 GDPval 2.1 上,Pro 得 1673,而 Claude Fable 5.1 为 1735,Opus 5 为 1708。在 DeepSWE v1.1 上,它落后于 DeepSeek V4.1 Flash(74.2)、Opus 5(74.0)和 GPT-6 Astra(74.0),仅为 71.9。客观评价:开源模型中的最佳,但仍不及闭源系统中的最佳。以上均为厂商自报数据,有待独立评估方复现验证。
API 定价与 V2.5 系列保持不变——Pro 输入 token 每百万 0.435 美元,输出 token 每百万 0.87 美元;Flash 为 0.14 美元和 0.28 美元。Xiaomi 的说法是 intelligence 提升了而价格原地踏步,将成本-性能前沿向外推移。
比分数更重要的部分
基准测试是营销;训练栈才是护城河。而在这方面 Xiaomi 做了一件真正不寻常的事:它将生产级强化学习运行过程实时直播了。在不到六天内,Flash 和 Pro 各完成了 30 个 RL 步骤,涵盖约 75 万条轨迹,报告成本分别约为 85 万美元和 262 万美元。在训练任务上的平均通过率分别相对提升了 25% 和 12%,而在保留的软件工程基准 DeepSWE v1.1 上,Flash 从 48.8 攀升至 65.68,Pro 从 58.4 攀升至 72.57。
背后的工程十分激进:全异步架构,每次更新处理 1568 个样本,每步处理 35 亿至 37 亿个 token,跨编码、一般 agent、视觉和网络安全工作的多任务套件,以及基于组的奖励信号来强化反馈。值得注意的是,Xiaomi 还记录了针对奖励黑客的明确防御措施——冻结路由器以限制漂移、对手评估、异常检测,以及验证器之间的交叉检查——这类工程细节通常是实验室秘而不宣的。
然后公司将这些全部公开了:技术报告、超过 7000 个任务环境,以及 RL 代码,被塑造成一个可扩展强化学习和模型自我改进的可复现实验。一位观察者指出,这次发布是权重优先的——检查点和模型卡在 Xiaomi 自家博客发布任何公告之前就出现在 Hugging Face 上。仓库先出现;叙事后跟上。
一款登顶开源权重排行榜的 MIT 许可证模型改变了构建的经济学。现在任何人都可以自托管一个处于开源系统顶级梯队的模型,而不是按 token 租用——或者从其权重开始进行专业化微调。模型已上线 AI Studio、MiMo Code、MiMo Desktop(随此版本退出早期访问)、Xiaomi API 平台和 OpenRouter。
Xiaomi 的演示超越聊天机器人,进入其所谓的"Vibe World":协调多个 agent 构建和可视化测试交互式 3D 场景、生成 Blender 资产、从摄像头馈送闭环控制 Franka Panda 机械臂、生成前端界面和演示文稿、组装视频,以及谱写音乐——包括模型自己评分并转换为 MIDI 的管弦乐作品。两项研究展示更进一步:与公司材料专家合作设计用于捕获 PFAS 化学物质的金属有机框架候选物,以及对"周期三蕴含混沌"定理的 6000 多行 Lean 4 形式化,该形式化被 Lean 内核验证,无未完成的证明。
首先,复现。Xiaomi 向社区提供了环境和代码;如果独立团队能复现 RL 配方,这就会成为整个开源生态系统的 playbook,而不仅仅是一个检查点分发。
其次,追赶。Kimi K3、GLM-5.3 和 Qwen3.8 Max 现在有了一个新的领导者要追赶。中国的开源权重竞赛是 AI 中变动最快的排行榜,它刚刚被重置。
第三,闭源实验室的回应。当开源前沿的定价为每百万输入 token 0.435 美元时,每个闭源提供商都必须证明其溢价的合理性——在可靠性上、在特性上,或者在开源模型仍然做不到的事情上。