PrismML 发布三元权重版 Qwen3.8 27B,仅 5.9GB(vs 原版 53.8GB),保留 98.2% 基准性能,支持图像和 262K token 上下文,Apache 2.0 开源。
PrismML 发布了 Ternary Bonsai 2 27B,这是 Qwen3.8 27B 的三值权重版本。该语言模型占用 5.93 GB,而 FP16 精度则需要 53.80 GB。PrismML 报告称,在 20 个基准测试中,该模型保留了母模型平均性能的 98.2%。该模型接受文本和图像输入,支持 262K token 的上下文长度。PrismML 演示了它在 RTX 5090 上驱动 Cline 编程 Agent 和 computer use。距离首个 Bonsai 27B 发布仅两个月,当时其三值版本保留了约 95% 的性能。
能。Apache 2.0 权重现在可以在 16 GB 内存的笔记本或单块 24 GB 显存的 GPU 上运行。你需要 PrismML 的 llama.cpp fork 或其 MLX 运行时。
该模型保持了 Qwen3.8 27B 的架构不变,拥有 27.36B 参数。其中 24.35B 为语言主干,2.54B 为嵌入层和 LM head,0.47B 为视觉塔。主干网络使用混合注意力机制,约 75% 为线性注意力层,25% 为全注意力层。
三值权重覆盖了嵌入层、注意力投影、MLP 投影和 LM head。只有 26.2M 参数,即 0.0976%,保持更高精度。这些是循环状态路径和归一化权重。在 GGUF 格式中,视觉塔作为独立的 0.63 GB 文件分发,仅在图像输入时加载。
每个权重取 3 个值之一:-1、0 或 +1。每组 128 个权重共享 1 个 FP16 缩放因子。一个三值携带 log2(3),即约 1.585 比特。每 128 个权重加 16 比特缩放因子,得到每个权重 1.71 比特。计入高精度张量后,模型达到 1.72 比特。
实际内核需要紧凑布局,因此白皮书描述了 2 种 GGUF 打包方式。PTQ1_0 将三值密集打包,每个权重 1.76 比特,共 5.93 GB。PQ2_0 将每个三值存储在 2 比特槽中,共 7.25 GB,解包成本更低。
权重也以旋转基存储。PrismML 在三值赋值前应用块级哈达玛旋转,块大小为 1,024。运行时在每次乘法前对激活值应用匹配的变换。白皮书引用了 SpinQuant 的这一思路。PrismML 未公布三值赋值的具体方法。
PrismML 在 H100 GPU 上使用 EvalScope 和 vLLM 对所有模型进行了思考模式评估。
| 能力 | Qwen3.6 27B | Qwen3.8 27B | Ternary Bonsai 2 27B | 保留率 |
|---|---|---|---|---|
| 知识和推理 | 84.71 | 86.66 | 83.95 | 96.9% |
| 数学 | 94.64 | 97.06 | 96.57 | 99.5% |
| 编程 | 82.57 | 82.17 | 81.58 | 99.3% |
| Agent 工具调用 | 80.05 | 79.74 | 77.57 | 97.3% |
| 指令遵循 | 74.53 | 81.25 | 82.66 | 101.7% |
| 视觉 | 79.82 | 81.64 | 78.59 | 96.3% |
| 总体(20 项) | 83.6 | 85.4 | 83.9 | 98.2% |
与传统量化的对比更为亮眼。Qwen3.8 27B 的 IQ2_XXS 构建版本平均得 75.2,体积 7.3 GB。在 AIME26 上得 78.6,而 Bonsai 2 得 95.83。在 LiveCodeBench v6 上差距为 70.05 对比 90.07。
98.2% 是平均值,损失并不均衡。视觉保留 96.3%,知识和推理保留 96.9%。
长程 Agent 工作进一步下降。Bonsai 2 在 Terminal-Bench 2.1 上得 52.8,而 Qwen3.8 27B 得 69.7。在 SWE-bench Verified 上得 60.8 对比 80.6。保留率约 75%,两者都未纳入 20 项基准测试的平均值。
推理投入也有影响。在中等投入下该模型平均得 79.3,而 FP16 基线得 82.6。不支持低投入。所有结果均来自 PrismML 自身,尚未被独立复现。
数据为 PrismML 定制内核的 batch size 1 解码测量,测量日期为 2026 年 9 月 16 日。RTX 5090 在每 token 0.582 mWh 功耗下达 142.5 tokens/秒。RTX 4090 使用 PTQ1_0 达 96.7,72 W L4 达 32.1。在苹果笔记本上,M5 Max 达 46.8,M5 Pro 达 27.7。
两种打包方式各有优势。PTQ1_0 在 Ada 代显卡和 L4 上更快。PQ2_0 在 Blackwell、Hopper、Ampere 和苹果芯片上更快,且在所有硬件上处理 prompt 时都更快。
PrismML 研究团队还声称能效比全精度 8B 模型高 40%。
GGUF 文件需要 PrismML 的 llama.cpp fork。原生 llama.cpp 无法加载 PTQ1_0 和 PQ2_0 类型。Bonsai-demo 仓库是官方支持路径。运行 ./setup.sh,然后运行 ./scripts/start_llama_server.sh 即可在 localhost:8080 使用聊天、视觉和工具。
Mac 用户可以使用 MLX 包,需要其配套的加载器。WebGPU 演示可在浏览器内运行模型。