前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8742
  • GPT-6 Sol/Luna 登场:价格腰斩,定位细分
  • TypeSafe Jev:让AI返回结构化决策而非段落文本
  • Text-to-SQL访问控制:身份决定Schema可见性
  • Jev 1.13实测:工单分类精度达100%,对比规则引擎和本地LLM
  • GitHub Copilot应用支持OpenTelemetry可观测性配置
  • 两款 AI 代码审查基准测评结论相反
  • AI 编码提速后:验证环节成为新瓶颈
  • AI 审查同一 PR 给出不同结论:确定性判定器来解决
  • AI计量工具审计启示:独立交易ref是防重复计费的关键
  • OpenAI发布GPT-6 Sol/Luna:API价格下调50%
  • GPT-6/Claude 5.5 同日发布:价格战开打,Luna 成本腰斩
  • GitHub Copilot 大幅提升C++代码索引速度
  • Anthropic和OpenAI同时推出性价比新模型
  • GPT-6 提示缓存重大升级:更高命中率与可诊断性
  • 六边形架构的端口在撒谎:HTTP 不等于业务语义
  • GPT-5.6 价格策略解读:Luna 降价 80%,多版本差异化定位
  • 高通骁龙8 Gen6端侧跑300亿参数MoE模型,吞吐330 Token/s
  • Claude Opus 5.5评测:智商极高但费用惊人
  • 小米开源 MiMo-V2.6:万亿参数开源模型登顶榜
  • AI Agent 工具 API 设计指南
  • 一个浏览器扩展权限即可劫持五大 AI Agent
  • Claude Opus 5.5 主打端到端代码补全而非起步
  • GPT-6 Sol发布:对齐能力逼近Astra,价格仅五分之一
  • GPT-6 Sol/Luna编程能力比肩Claude,成本降80%
  • Claude Opus 5.5发布:性能对标Fable 5.1,成本低40%
  • Claude Opus 5.5:编程修复成功率达97.5%,成本降40%
  • 开源工具llm 0.36支持GPT-6 Sol/Luna
  • JetBrains押注Agent开发:称其为26年最重要一步
  • 为 AI 代理添加预算守卫的实战方案
  • OpenAI GPT-6 Sol和Luna模型上线Amazon Bedrock
  • OpenAI发布GPT-6 Sol和Luna,API价格减半
  • OpenAI 发布 GPT-6 Sol/Luna 模型,Token 价格减半
  • GPT-6 Sol/Luna 正式发布:成本更低、错误更少
  • OpenAI 发布 GPT-6 Sol/Luna,主打低成本低幻觉
  • Claude Opus 5.5 登陆 Google Cloud,在 Model Garden 可用
  • Claude Opus 5.5 现已在 AWS Bedrock 可用
  • Strands Evals + Bedrock AgentCore:Agent 技能选择评估指南
  • llm-anthropic 0.29支持Claude Opus 5.5
  • Claude Opus 5.5发布:性能持平Fable 5.1,定价直降40%
  • GitHub Copilot上线Claude Opus 5.5,支持长时Agent任务
  • GitHub Copilot 新增 GPT-6 Sol/Luna 模型选项
  • Claude Opus 5.5 智能/性能/价格深度分析
  • Anthropic发布Opus 5.5降价20%,但Agent调用可能暗中路由至旧模型
  • Anthropic称Opus 5.5为「史上最强」,定价更低的Fable级性能
  • Anthropic 发布 Claude Opus 5.5:强化网络安全防护,遏制越狱行为
  • Claude Opus 5.5 正式发布:832 分成社区热议
  • 生产级 AI 语音 Agent 架构:WebSocket 与延迟优化实战
  • Permission Envelope:让 AI 权限自动过期的安全控制机制
  • llm-typesafe插件支持Jev模型二元判断
  • 已加载 49 / 8742
8.0
热点
AI SCORE
开源项目2026-09-23 04:24

小米开源 MiMo-V2.6:万亿参数开源模型登顶榜

dev.to · AI#小米#开源模型#强化学习
Editor brief · 编辑速览

小米开源了 MiMo-V2.6 系列模型,包含 Pro/Flash/UltraSpeed 三个版本,宣称在综合基准上领先所有开源模型,并公开了 RL 训练环境与代码。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Xiaomi 开源 MiMo-V2.6:万亿参数模型登顶开源权重排行榜

Originally published at AI Frontier Post.

过去两天,这家从手机厂商转型为 AI 实验室的企业发布了 MiMo-V2.6——两款全模态模型,其中旗舰款号称在复合行业基准上超越了所有其他开源权重模型。模型检查点已无门槛地上传至 Hugging Face,采用 MIT 许可证:任何人都可以下载、微调和商业使用。

对外宣传的分数是厂商自报数据,所以应该视为一种声明而非定论:Artificial Analysis Intelligence Index v4.3 上得分 46.32。更难忽视的是权重包之外配套发布的所有内容。Xiaomi 将产生这两个模型的六天强化学习运行过程全程直播,随后与检查点一起发布了训练环境和 RL 代码。这是一个被设计成可复现的发布,而不仅仅是供人瞻仰。

该系列有三个版本。MiMo-V2.6-Pro 是旗舰款,Xiaomi 称其为迄今为止最强大的模型。MiMo-V2.6-Flash 是更轻量、更便宜的兄弟款,专为高吞吐量任务构建。而 MiMo-V2.6-Pro-UltraSpeed 是一种服务选项,在大约十倍价格下将输出速度提升至 20 倍——适用于延迟就是一切的workflows。

在底层实现上,Pro 是一个稀疏的混合专家模型:总计 1.02 万亿参数,每个 token 约 420 亿活跃参数,分布在 384 个路由专家中,任何给定 token 会激活其中 8 个。主干网络是 70 层,混合了滑动窗口注意力和全局注意力,专用的视觉塔处理图像,独立的编码器处理音频。两个模型都接受文本、图像、视频和音频作为输入,并输出文本,上下文窗口达 100 万 token。通过 Xiaomi API 进行的独立速度测量记录了约每秒 130 个输出 token。

基准测试情况(及其注意事项)

Xiaomi 拿来当招牌的数字是 Artificial Analysis Intelligence Index:Pro 得分 46.32,领先于 Z AI 的 GLM-5.3(45)和 Moonshot 的 Kimi K3(44)——是该排行榜上开源权重的最高分。作为参照,同一排行榜将闭源的 Grok 4.7 列为 46 分,而 Artificial Analysis 估算 Pro 的推理成本约为每次 Index 任务 0.13 美元——这个数字会引起 CFO 们的关注。

Xiaomi 自己的声明更大胆:称 Pro 在大多数 agent 基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当。但其自有表格中的细则就不那么光彩了。在 GDPval 2.1 上,Pro 得 1673,而 Claude Fable 5.1 为 1735,Opus 5 为 1708。在 DeepSWE v1.1 上,它落后于 DeepSeek V4.1 Flash(74.2)、Opus 5(74.0)和 GPT-6 Astra(74.0),仅为 71.9。客观评价:开源模型中的最佳,但仍不及闭源系统中的最佳。以上均为厂商自报数据,有待独立评估方复现验证。

API 定价与 V2.5 系列保持不变——Pro 输入 token 每百万 0.435 美元,输出 token 每百万 0.87 美元;Flash 为 0.14 美元和 0.28 美元。Xiaomi 的说法是 intelligence 提升了而价格原地踏步,将成本-性能前沿向外推移。

比分数更重要的部分

基准测试是营销;训练栈才是护城河。而在这方面 Xiaomi 做了一件真正不寻常的事:它将生产级强化学习运行过程实时直播了。在不到六天内,Flash 和 Pro 各完成了 30 个 RL 步骤,涵盖约 75 万条轨迹,报告成本分别约为 85 万美元和 262 万美元。在训练任务上的平均通过率分别相对提升了 25% 和 12%,而在保留的软件工程基准 DeepSWE v1.1 上,Flash 从 48.8 攀升至 65.68,Pro 从 58.4 攀升至 72.57。

背后的工程十分激进:全异步架构,每次更新处理 1568 个样本,每步处理 35 亿至 37 亿个 token,跨编码、一般 agent、视觉和网络安全工作的多任务套件,以及基于组的奖励信号来强化反馈。值得注意的是,Xiaomi 还记录了针对奖励黑客的明确防御措施——冻结路由器以限制漂移、对手评估、异常检测,以及验证器之间的交叉检查——这类工程细节通常是实验室秘而不宣的。

然后公司将这些全部公开了:技术报告、超过 7000 个任务环境,以及 RL 代码,被塑造成一个可扩展强化学习和模型自我改进的可复现实验。一位观察者指出,这次发布是权重优先的——检查点和模型卡在 Xiaomi 自家博客发布任何公告之前就出现在 Hugging Face 上。仓库先出现;叙事后跟上。

一款登顶开源权重排行榜的 MIT 许可证模型改变了构建的经济学。现在任何人都可以自托管一个处于开源系统顶级梯队的模型,而不是按 token 租用——或者从其权重开始进行专业化微调。模型已上线 AI Studio、MiMo Code、MiMo Desktop(随此版本退出早期访问)、Xiaomi API 平台和 OpenRouter。

Xiaomi 的演示超越聊天机器人,进入其所谓的"Vibe World":协调多个 agent 构建和可视化测试交互式 3D 场景、生成 Blender 资产、从摄像头馈送闭环控制 Franka Panda 机械臂、生成前端界面和演示文稿、组装视频,以及谱写音乐——包括模型自己评分并转换为 MIDI 的管弦乐作品。两项研究展示更进一步:与公司材料专家合作设计用于捕获 PFAS 化学物质的金属有机框架候选物,以及对"周期三蕴含混沌"定理的 6000 多行 Lean 4 形式化,该形式化被 Lean 内核验证,无未完成的证明。

首先,复现。Xiaomi 向社区提供了环境和代码;如果独立团队能复现 RL 配方,这就会成为整个开源生态系统的 playbook,而不仅仅是一个检查点分发。

其次,追赶。Kimi K3、GLM-5.3 和 Qwen3.8 Max 现在有了一个新的领导者要追赶。中国的开源权重竞赛是 AI 中变动最快的排行榜,它刚刚被重置。

第三,闭源实验室的回应。当开源前沿的定价为每百万输入 token 0.435 美元时,每个闭源提供商都必须证明其溢价的合理性——在可靠性上、在特性上,或者在开源模型仍然做不到的事情上。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
Claude Opus 5.5评测:智商极高但费用惊人
下一篇
AI Agent 工具 API 设计指南