Atomic Labs推出Kimi K3的1-bit量化版本,从2.8T参数压缩至590GB,保留78.7%性能和全1M上下文。可在4张B200GPU上运行,提供多精度选项(2.1bits达87.2%协议对齐)。
Atomic Labs 的 1-bit 量化方案将 Kimi K3 的 2.8 万亿参数压缩到 590GB,这是一次 62% 的体积削减。该模型保留了原始模型 78.7% 的质量和完整的 1M 上下文窗口,根据 @rohanpaul_ai 的报告。权重已在 Hugging Face 上提供。
关键指标:
Atomic Labs 已发布了 Kimi K3 的 1-bit 量化版本,将这个 2.8 万亿参数的模型压缩到 590GB 的占用空间。这是一次 62% 的体积削减,同时保留了原始模型 78.7% 的质量和完整的 1M token 上下文窗口,根据 @rohanpaul_ai 的说法。权重可在 Hugging Face 上获得。
该版本包括多个精度级别,每个都有不同的质量与占用空间权衡。在 2.1 bits 时,模型增长到 769GB,但与原始模型的一致性跳升到 87.2%。推进到 3.4 bits 会再增加 428GB,但质量收益仅为 0.5 个百分点——一个明显的收益递减崖,表明 2.1 bits 是大多数部署的实际最佳点。
1-bit 变体的 78.7% 保留率值得注意,但真正的故事在于上下文窗口。大多数激进的量化方案首先牺牲长上下文性能;在 1-bit 精度下维持完整的 1M tokens 表明量化方案正在保留注意力机制的数值范围,而不仅仅是前馈层。

该报告包含一个 HTML 3D 物理基准测试,所有四个量化模型都成功处理了下落物理。但是,只有本地运行的 K3 构建了请求的工作绞车——一个功能差距,将 1-bit 和 2.1-bit 变体与更高精度版本分开。团队演示了 1-bit 模型在 4 个 NVIDIA B200 GPU 上运行。
这对边缘推理来说是一个有意义的数据点。590GB 的模型可以装进一个具有 NVLink 的单个高端服务器节点,而原始的 2.8T 模型需要一个多节点集群。内存占用空间的 62% 削减直接转化为更低的每 token 推理成本,尽管该报告未披露 token 生成吞吐量或延迟数字。
要注意 Atomic Labs 在 MMLU 和 HumanEval 等标准测试套件上发布基准分数,这些当前报告中省略了。还要追踪 2.1-bit 变体是否会成为推荐的默认设置,考虑到它相比 1-bit 有 8.5 个百分点的质量提升,而仅增加 179GB。在消费者硬件上的第三方复制将决定实际可行性。
[已于 8 月 2 日更新,来源:gn_gpu_cluster]
该版本发布之际,有报告称 Kimi K3 基础模型的开发商 Moonshot AI 正通过阿里巴巴的云平台在 20,000 个英伟达芯片上运行其训练,根据 Startup Fortune。华盛顿据称指控该安排违反了出口管制,但尚未确认正式指控。Atomic Labs 的 1-bit 量化工作独立于 Moonshot 自身的部署,但这一争议可能会影响两个实体对高端硬件的未来访问。
原文发布于 gentic.news