Kimi K3 成全球最大开源模型之一
Kimi K3 2.8T-A50B 发布 50B 参数版本,性能媲美 Opus 4.8 但价格仅为 Sonnet 5 级别。重大模型发布,直接影响程序员的模型选型和成本决策。
Kimi K3 2.8T-A50B 发布 50B 参数版本,性能媲美 Opus 4.8 但价格仅为 Sonnet 5 级别。重大模型发布,直接影响程序员的模型选型和成本决策。
开放模型的好日子还在继续。
Z.ai GLM 最近风头太盛,该是 Kimi K3 反击的时候了!要理解今天开放模型发布的规模并不容易,但幸运的是 Moonshot AI 为我们做了这个工作。
他们的宣传视频完全由 Kimi K3 剪辑而成,值得一看:
你可以读 SimonW 和 Arena 的标准观点和排名,考虑到模型的巨大规模,这些都不会出现什么意外的结果,但这张图最好地总结了从 K2.5 到 K3 的飞跃:
AI 新闻 7/15/2026-7/16/2026。我们检查了 12 个子版、544 个 Twitter 账户,没有进一步的 Discord。AINews 网站让你搜索所有过往的问题。提醒一下,AINews 现在是 Latent Space 的一部分。你可以选择加入/退出邮件频率!
Moonshot AI 发布了 Kimi K3,作为一个前沿级开放权重模型,官方声明将其置于顶级闭源模型附近,并高于先前的开放竞争对手。
Moonshot 官方推出了 Kimi K3 作为"开放前沿智能",拥有 2.8T 总参数、1M 令牌上下文、原生多模态输入、Kimi Delta Attention (KDA) 和 Attention Residuals,并表示该模型已在 Kimi.com、Kimi Work、Kimi Code 和 API 上线,开放权重承诺在 2026 年 7 月 27 日前发布 @Kimi_Moonshot
Moonshot 还强调了围绕长视角智能体编码和自演化工作流的产品定位,以及在代码和截图之间迭代的"视觉在循环"编码/游戏构建工作流 @Kimi_Moonshot
在正式公告之前,多个账户流传了泄露的或应用源的细节,称 K3 拥有 2.8T 参数,如果权重如承诺的那样发布,将是有史以来最大的开放权重模型 @scaling01, @eliebakouch
官方 Kimi 博客稍后上线,被广泛分享为主要技术来源 @Jianlin_S, @scaling01, @Yulun_Du
Moonshot 自身的措辞承认了一个限制:尽管整体上具有很高的竞争力,K3 相对于 Claude Fable 5 和 GPT-5.6 Sol 仍然存在"明显的用户体验差距" @scaling01
Arena 宣布 Kimi K3 进入了 Agent Arena,以及 Text、Vision、Document 和 Frontend Code Arena,社区评估将随之进行 @arena
Arena 随后报告了一个重要的早期结果:Kimi K3 以 1679 分成为 Frontend Code Arena 的第一名,超过了 Claude Fable 5,从第 18 位(K2.6)跃升至第 1 位,在 7 个前端领域中的 6 个排名第一,在游戏领域排名第二 @arena
Arena 后来补充说 K3 在 Frontend Code Arena 中的配对胜率为 76%,而 Fable 5 为 63%,GPT-5.6 Sol 为 58% @arena
在 Text Arena 中,K3 以 1486 分在第 9 位着陆,从第 38 位跃升,在创意写作、编码和指令跟随中有前 10 名的排名,在多个职业类别中排名第一 @arena
Artificial Analysis 发布了一项独立评估,将 K3 在 AA Intelligence Index 上排名第 57,称其与 Opus 4.8 和 GPT-5.5 相当,但在整体上仍落后于 Fable 5 和 GPT-5.6 Sol @ArtificialAnlys
AA 还报告 K3 在 GDPval v2 上的 Elo 为 1668,在 AutomationBench-AA 上达到 53%/第一名,AA-Briefcase 上的 Elo 为 1547,每个任务的成本为 $0.94,在整个 Intelligence Index 运行中,输出令牌比 K2.6 减少了大约 21% @ArtificialAnlys
此次发布立即引发了工程师和模型观察者的强烈反应,他们将 K3 称为与早期 DeepSeek 时刻相媲美的开放模型里程碑 @kimmonismus, @nrehiew_, @eliebakouch
官方规格:2.8T 总参数、1M 上下文、原生多模态输入(文本 + 图像)、文本输出、7 月 27 日前开放权重 @Kimi_Moonshot, @ArtificialAnlys
K3 使用 Kimi Delta Attention (KDA),Moonshot 表示这能在百万令牌上下文中实现最高 6.3 倍的更快解码 @Kimi_Moonshot
它还使用了 Attention Residuals (AttnRes),据称能提供约 25% 的更高训练效率,额外成本低于 2% @Kimi_Moonshot
社区读者从博客中提取了其他架构细节:LatentMoE / Stable LatentMoE,896 个中的 16 个激活专家,暗示激活比率不到 2% @nrehiew_, @eliebakouch
社区从博客/报告讨论中提取的更多细节:按头部 Muon、QB 负载均衡/分位数负载均衡,以及一种名为 SiTU(Sigmoid Tanh Unit)的新激活函数 @eliebakouch
一位工程师指出该架构因结合 KDA + LatentMoE + AttnRes 而值得注意,同时相对于先前的 Kimi 模型扩展超过 2 倍 @teortaxesTex
KDA 有很长的孵化周期:设计据报于 2025 年 1 月开始,耗时约 1.5 年才达到前沿规模 @zxytim
K3 价格据报为 $3 / 1M 输入令牌和 $15 / 1M 输出令牌,缓存输入打折 90% 至 $0.30 / 1M @scaling01, @ArtificialAnlys
多个发帖者将该价格与 Sonnet 5 进行了比较,有些人指出 Sonnet 在 8 月末前暂时更便宜,之后价格对齐得更紧密 @kimmonismus
80% 输入 / 20% 输出的混合估计得出 $5.40 / 1M 令牌,而 Opus 4.8 为 $9,GPT-5.5 为 $10 @jaminball
Artificial Analysis 估计每个 Intelligence Index 任务的平均成本为 $0.94,而 GPT-5.6 Sol 为 $1.04,Opus 4.8 为 $1.80 @ArtificialAnlys
早期实时服务观察:通过 OpenRouter 上的 Moonshot API 约为 28 tok/s @scaling01,另一位观察者看到 26 tok/s,称其比 Opus 更慢,推测推测解码尚未启用 @nrehiew_
Moonshot 的博客据报推荐在具有 64+ 加速器的超级节点配置上部署以获得最佳推理效率 @teortaxesTex
vLLM 表示 Moonshot 直接向 vLLM 贡献了 KDA 前缀缓存实现,在官方发布时第 0 天就可以支持 @vllm_project
Moonshot 的 KDA 贡献被认为很重要,因为 KDA 破坏了传统前缀缓存背后的假设,所以需要进行上游运行时更改 @vllm_project
Moonshot 的官方基准消息,由其他人总结,将 K3 定位在仅次于 Claude Fable 5 和 GPT-5.6 Sol 的位置,在测试模型中领先于 Claude Opus 4.8 @scaling01, @Yuchenj_UW
一个引用的数字:GDPval-AA v2 上的 1687,高于 Opus 4.8,在该比较中低于 GPT-5.6 Sol 的 1747.8 @scaling01
Artificial Analysis 的独立数字:
AA Intelligence Index:57
GDPval v2 Elo:1668
AutomationBench-AA:53%,第一名
AA-Briefcase Elo:1547
AA-Omniscience:+18,准确率 46% 相对于 K2.6 的 33%,但幻觉率恶化至 51%(从 39%)@ArtificialAnlys
AA 还报告了 K3 在整个 Intelligence Index 中消费的 132M 输出令牌,相比 K2.6 的 166M,即减少了 21%,同时获得了 13 个指数点 @ArtificialAnlys
Arena 的前端结果特别突出,因为它是配对人类偏好竞技场,而不仅仅是静态基准,K3 的前端第一名排名成为了主要发布标题之一 @arena
社区帖子还强调了在内核优化任务上的强大结果,有些说 K3 在某些内核/代码生成设置中与 Fable 相匹配或击败了 Fable @nrehiew_, @scaling01
一个基准警告来自 ProgramBench 作者 Ofir Press,他表示 Kimi 使用了他们不推荐的指标:对实现百分比进行平均而不是计算完全工作的程序,这可能会高估有用性 @OfirPress
Kimi K3 由 Moonshot 官方宣布 @Kimi_Moonshot
官方披露的规格包括 2.8T 参数、1M 上下文、原生多模态输入、KDA、AttnRes、7 月 27 日前开放权重 @Kimi_Moonshot
Artificial Analysis 独立将 K3 评分为 57 Intelligence Index,具有详细的任务、成本、令牌和基准数据 @ArtificialAnlys
Arena 独立将 K3 排名为 Frontend Code Arena 中的第一名,后来报告了其 76% 的配对胜率 @arena
vLLM 确认 Moonshot 为 KDA 前缀缓存贡献了运行时支持 @vllm_project
"DeepSeek 时刻"、"美中 AI 竞赛的开始"和"一切都改变了"是观察者的编辑解释,不是既定事实 @kimmonismus, @scaling01
K3"在 14 个基准中的 11 个上击败 GPT-5.6 Sol"和"在 6 个中击败 Fable"的声明是聚合的社区总结,应该被视为取决于基准集和确切方法 @scaling01
关于这意味着 Dario/Anthropic 边际压力、地缘政治转折点或接近奇点超级智能的断言是投机评论 @teortaxesTex, @Jason
多个"蒸馏"暗示被明确框架为笑话或推测而非证据 @yacinelearning, @dejavucoder
许多工程师称 K3 为真正的前沿开放模型,尤其是因为它似乎优于 Opus 4.8,同时价格接近 Sonnet,计划发布开放权重 @kimmonismus, @cline, @nrehiew_
支持者强调这不再是"对开源很好",而是与顶级公开闭源模型相竞争 @tokenbender, @TheAhmadOsman
有些人将此次发布视为开放模型现在距离前沿仅几周或几个月内的证据 @nrehiew_
其他人主张这在物质上提高了未来 AGI 级系统开源的概率 @MaorShlomo
Artificial Analysis 给出了更克制的观点:K3 与 Opus 4.8 和 GPT-5.5 相当,但在整体智能上仍然落后于 Fable 5 和 GPT-5.6 Sol @ArtificialAnlys
Simon Willison 将 K3 描述为重大的,但也将读者指向细致的笔记和基准警告,而不是简单的排行榜炒作 @simonw
Ethan Mollick 的亲身印象:非常好的开放权重模型,但不是 Sol Max 或 Fable @emollick
一位用户说 K3 的智能很强,但它很慢,有时过度检查,在品味/美学上仍然落后于 Claude @nrehiew_
Bindu Reddy 警告称,除非在隐藏/未污染的评估(如 LiveBench)上验证,否则 K3 的基准故事可能会被夸大,并主张如果模型"思考永远",实际成本可能不太有利 @bindureddy
ProgramBench 维护者反对 Moonshot 的指标选择,说它可能相对于完全工作的程序夸大部分信用性能 @OfirPress
Artificial Analysis 还标记了一个真正的弱点:尽管准确率有所提高,AA-Omniscience 上的幻觉率有所恶化 @ArtificialAnlys
多位用户指出 K3 目前似乎思考很多,保留长推理历史,可能需要比简单的聊天优先 API 更仔细的工具支持 @scaling01, @Xianbao_QIAN
一些怀疑专注于经济学和可部署性:2.8T 开放权重令人印象深刻,但实际自托管可能仍然限于资金充足的团队 @mbusigin
一个广泛的推文集群将 K3 框架化为中国实验室不再落后的证明,美国领先优势正在缩小 @tszzl, @kimmonismus, @scaling01
其他人对这一权衡,认为 K3 在可用性/产品化方面仍然似乎落后于最好的西方模型,即使原始能力接近 @RyanGreenblatt, @scaling01
有些人辩称开放的中国模型通过压缩边际和商品化能力对美国实验室造成经济压力 @francoisfleuret
其他人将不可避免的下一步视为在工具、产品和部署系统上更多的竞争,而不仅仅是原始模型权重 @AravSrinivas, @theo
K3 之所以值得注意,不仅因为原始规模,还因为将非标准的注意堆栈扩展到前沿级模型:KDA + AttnRes + 稀疏 MoE 吸引了技术素养的观察者的重复关注 @scaling01, @eliebakouch
此次发布也是一个系统故事:长上下文服务、前缀缓存、KDA 运行时支持,以及在大型加速器超级节点上的部署,如果权重是实际可用的,这些都很重要 @vllm_project, @teortaxesTex
对内核优化、芯片设计、智能体编码和环境模拟的强调表明 Moonshot 正在优化 AI 改进 AI 的工作流,而不仅仅是聊天机器人基准 @18jeffreyma, @yong_zhengxin
最强烈的重复主题:前沿级性能,价格明显低于顶级闭源模型,尽管不是廉价的开放模型价格 @kimmonismus, @cline, @jaminball
Artificial Analysis 的任务成本框架对从业者特别相关:如果 K3 接近 GPT-5.6 Sol 的每任务成本,并低于 Opus 4.8,真正的问题就变成了它如何融入智能体栈、编码平台和自托管基础设施 @ArtificialAnlys