Kimi K3以1679分登顶Arena前端编程榜单,超越Claude Fable 5(1631)和GPT-5.6 Sol(1618);采用2.8T参数的MoE架构和百万token上下文。
这个月我写的每篇开源权重文章都有一个相同的注脚: impressive,但实际并未达到前沿水平,或者无法运行,或者好的许可证只给了小模型。Kimi K3 是那个去掉了能力注脚的存在。它位居 Arena 前端代码排行榜榜首——1679 分,领先于 1631 分的 Claude Fable 5 和 1618 分的 GPT-5.6 Sol——而且它是开源权重。不是「与……持平」,是领先。在一个公开的、对抗性的、而非厂商自家基准测试的排行榜上。
这是值得铭记的第一次,而且不同于发布日的基准测试,这个数字是我真正信任的。

我花了整整一个月告诉你要忽略自我报告的基准测试,所以让我保持一致地解释为什么这一个有所不同。Arena 的排行榜是头对头的、盲测的、由用户在真实提示词上投票的——不是模型制造商挑选和配置的基准测试。月之暗面(Moonshot)无法选择任务或对比设置。Kimi K3 通过赢下对决攀升到前端编码榜首,而且它是第一个占据该位置的 Chinese 模型,更重要的是,这是第一个占据该位置的开放权重模型。
它背后的规格是认真的:2.8T 参数的混合专家架构、百万 token 上下文、原生视觉能力、权重于 7 月 27 日发布。在其托管平台上的定价是 $3/$15,有 90% 的缓存折扣,但定价几乎不是重点——权重可以下载,所以真正的底价是你自己的硬件或任何低于其他人的托管商。
在过去的两年里的大部分时间,「使用开源权重」意味着接受能力税——你用一些质量换取控制权、隐私或成本。Kimi K3 在真实编码排行榜上登顶意味着,至少对于前端工作而言,那项税收几乎降到了零。你现在可以选择开源模型,因为它在任务上表现最好,而不是尽管它是开源的却还能接受,同时保留开源权重给你的东西:没有按 token 计量、没有数据离开你的环境、没有供应商能够在你脚下废弃这个模型。
这重新排序了决策。问题不再是「开源选项是否足够好以接受降级」,而是「为什么我要为一个开源模型做得更好的东西向闭源供应商付费」。对于一个以前端为主的工作流来说,这与一个月前相比是截然不同的计算。
我不会因为一个数字偏爱了开源一方就抛弃我自己的规则,所以在写这篇文章之前我去读了许可证。它不是早期 Kimi 版本所使用的「修改版 MIT」——K3 有自己的文件,称为「Kimi K3 License」。授权条款读起来像 MIT,但有两个条款不同:如果你运行模型即服务业务,且在十二个月内收入超过两千万美元,你必须与月之暗面签署一份单独协议;以及基于它构建的产品如果月活超过一亿(或月收入两千万美元),必须在其界面中显著显示「Kimi K3」。需要肯定的是,月之暗面自己的材料始终使用「开放权重」而非「开源」。这两个门槛今天都不是我的问题,也许也不是你的——但这是一个 Llama 形状的许可证,数字更友好,不是纯粹的 MIT,你应该知道这一点。
实际的注意事项是 usual ones。2.8T MoE 不是大多数人会轻易自托管的——要运行好它意味着真正的推理基础设施或托管商,所以要检查一个托管商在你的量级上考虑缓存折扣后的实际收费。而且排行榜衡量的是一块——前端代码——而不是你的全部工作负载。一个榜首是一个强信号,而不是对所有事情的加冕。
但这个里程碑是真实的,而且这正是我一直在公开押注的方向:模型层级不断商品化,而现在商品化的那个,至少在一个真实任务上,是最佳选项而非廉价选择。这就是「我应该使用开源权重吗」这个辩论悄然结束,而「哪个开源权重」这个辩论开始的时刻。
如果你已经在真实的前端工作中将闭源模型换成了 Kimi K3,我希望听听排行榜位置是否在你的实际代码库中保持了——那才是真正唯一重要的基准。