微软为 GitHub Copilot 推出的 MAI Code 1.1 Flash 成本仅为前代 1/4 且效率提升 25%,但基准测试显示 Deepseek V4 Flash 在价格和性能上均显著领先,揭示微软倾向用自有差模型保护利润而非选最优开源模型。
Microsoft 发布了 MAI Code 1.1 Flash,这是一款面向 GitHub Copilot 的代码模型。但很难看出微软 MAI 模型的价值所在——它们在价格和性能两方面都落后于开源权重模型,而微软一直声称自己是开源模型的"超级粉丝"。
Microsoft 表示,新模型编写的代码质量更高,token 效率提升了 25%,成本比 6 月的前代产品低了四分之三。开发者对其输出的接受率提升了 4%。训练过程涉及"GitHub Copilot 中数十万个强化学习环境"。在基准测试中,它略微超越了前代产品以及 Anthropic 和 OpenAI 的小模型,但被 Deepseek-V4-Flash-0731 大幅碾压。
比之前便宜,但仍然比 Deepseek 贵
MAI-Code-1.1-Flash 纸面上看起来是一款经济型模型,但在价格和性能两方面都落后于能力更强的 Deepseek。如果不考虑使用效率,单看每 token 成本并不能说明全部情况,但无论怎么看,Deepseek 的优势差距都可能是显著的。
这或许解释了为什么微软在模型卡中隐藏了基准测试结果,而在官方公告中只宣传一些模糊的改进指标("代码存活率提升 4%,回访量增加 9%"),跳过了任何直接对比。
微软的开源 AI 论调与其模型策略不符
这一切都与微软最近把自己塑造成开源 AI champion 的举动不相符。该公司没有采用 Deepseek-V4-Flash 等能力更强、可免费使用的替代方案,而是将资源投入到一个更弱、更贵且专有的内部模型上,而且很可能不会发布开源权重版本。
原因可能与微软最近的 Copilot 重组有关——当时它用更便宜的 MAI 替代方案替换了 OpenAI 和 Anthropic 的模型,以降低成本。代价是性能下降,但利润率提高。
MAI-Code-1.1-Flash 符合同样的模式:微软生态系统的客户仍然可以根据应用和使用场景选择不同的模型,但微软几乎肯定会最终将自己的模型设为默认选项。仅仅这一点就能锁定一大块市场份额,因为大多数用户从来不会主动选择特定的 AI 模型。
AI News Without the Hype – Curated by Humans
Subscribe to THE DECODER for ad-free reading, a weekly AI newsletter, our exclusive "AI Radar" frontier report six times a year, full archive access, and access to our comment section.