仅7.89GB的2位GGUF量化版Qwen3.8-27B,在工具调用任务上超越54GB原版,适合本地部署到消费级硬件。
人工智能
Conway Research 旗下的端侧助手 Underdog 发布了采用 Apache 2.0 许可证的 Saluki 27B。Underdog Saluki 27B 是 Qwen3.8-27B 的 2-bit GGUF 版本,文件大小仅为 7.89 GB,而完整的 BF16 模型需要 54 GB。Underdog 针对压缩过程进行了调优,重点保留工具调用能力——正是这项能力,让聊天模型成为 Agent。对开发者来说,这意味着一个可以直接在原版 llama.cpp 中运行的 27B 级 Agent 模型。
规模:27B 稠密参数。GGUF 文件为 7.89 GB,BF16 版本为 54 GB。
运行环境:原版 llama.cpp 及基于它构建的应用,支持将模型完整卸载到 GPU。可选配 629 MB 或 928 MB 的视觉附加组件。
性能:相较于完整的 Qwen3.8-27B,在 9 项 benchmark 上平均保留了 96% 的性能。
最佳表现:并行工具调用得分为 42,完整模型为 35,性能保留率达到 120%。
最弱表现:AIME 2025 得分为 79.2,完整模型为 96.7,性能保留率约为 82%。
核心结论:最强之处,是用不到 8 GB 的文件,在工具调用上击败了 54 GB 的原版模型。最弱之处,是竞赛数学和多步推理得分下降了 12 至 18 分。
最强之处:用不到 8 GB 的文件,在工具调用上击败了 54 GB 的原版模型。
最弱之处:竞赛数学和多步推理得分下降了 12 至 18 分。
Saluki 27B 是面向本地 Agent 构建的 Qwen3.8-27B 2-bit 混合精度 GGUF 版本。它叠加了三层工作:
第一层是基础模型 Qwen3.8-27B,这是 Qwen 团队推出的一个 27B 稠密模型。它有 64 层,混合使用 Gated DeltaNet 线性注意力和门控注意力,原生支持 262,144 tokens。
第二层是 ISTA-DASLab 的 Qwen3.8-27B-GSQ-RCO-GGUF。GSQ 为每个 tensor 学习精确的低位标量量化网格。RCO 则在固定的文件大小预算下,为每个 tensor 分配一种量化类型。ISTA 最小的文件是 IQ2_XS,大小为 8.4 GB,每个权重占 2.50 bits。
第三层是 Underdog 自己的处理。它将文件缩小到 7.89 GB,并重点优化工具调用。文件名为 IQ2-mix,带有 imatrix 标签。Underdog 尚未公开这一轮处理的完整方法。
Underdog 将测试结果分为两组。
第一组使用同一套评测框架运行两个模型:
Underdog Bench:从 BFCL v4 中选取 120 项任务,在测试前冻结任务集。关闭 Thinking,temperature 设为 0。Saluki 得分为 88,完整模型为 84,PrismML 的 Bonsai 2 为 70。
并行工具调用:使用官方检查器评测 100 项 BFCL v4 并行任务。Saluki 得分为 42,完整模型为 35。
SWE-bench Verified:测试 50 个 issue。Saluki 修复了 30 个,完整模型修复了 33 个。
第二组将 Saluki 的成绩与公开的完整模型成绩进行比较:
| Benchmark | Saluki 27B | Qwen3.8-27B(公开成绩) |
|---|---|---|
| IFEval (prompt-loose) | 93.5 | 91.5 |
| IFBench (prompt-loose) | 72.7 | 71.0 |
| MBPP+ | 78.0 | 83.9 |
| MuSR | 67.5 | 79.6 |
| AIME 2025 (avg@4) | 79.2 | 96.7 |
| AIME 2026 (avg@4) | 80.0 | 94.6 |
| 特性 | Underdog Saluki 27B | Qwen3.8-27B (BF16) | ISTA GSQ-RCO IQ2_XS | PrismML Bonsai 2 27B (PTQ1_0) |
|---|---|---|---|---|
| 开发组织 | Underdog(Conway Research) | Qwen 团队 | ISTA-DASLab | PrismML |
| 参数量 | 27B | 27B | 27B | 27.36B |
| 文件大小 | 7.89 GB | 54 GB | 8.4 GB | 5.95 GB |
| 每个权重的位数 | 未披露(2-bit 混合精度) | 16 | 2.50 | 1.75 |
| 上下文长度 | 未披露 | 原生支持 262,144 | 未披露 | 262K |
| 视觉能力 | 附加组件,629 或 928 MB | 原生支持 | 0.9 GB mmproj | 可选 0.63 GB |
| 运行环境 | 原版 llama.cpp | Transformers、vLLM、SGLang | 原版 llama.cpp、Ollama、LM Studio | PrismML 的 llama.cpp fork |
| Underdog Bench(共 120 项) | 88 | 84 | 未披露 | 70 |
| 厂商主打指标 | 9 项 benchmark 平均保留 96% 性能 | 基准模型 | 零样本性能恢复率 100.3% | 14 项 benchmark 达到 FP16 性能的 98.2% |
| 许可证 | Apache 2.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 |
Bonsai 2 的体积更小,并报告称,在 14 项 Thinking 模式 benchmark 上保留了 98.2% 的性能。它的数学成绩也更强,其中 AIME25 得分为 95.00。不过,它需要使用 PrismML 的 llama.cpp fork,因为原版 llama.cpp 不接受它的打包格式。Saluki 则可以在原版 llama.cpp 中运行。各家厂商使用各自的评测框架,因此不同厂商的分数不能直接比较。
Saluki 27B 将 Qwen3.8-27B 从 54 GB 压缩到了 7.89 GB。
它在工具调用上击败了完整模型:88 对 84。
并行工具调用得分从 35 提升到了 42。
数学和推理受到的影响最大,性能保留率降至约 82% 至 85%。
它可以在原版 llama.cpp 中运行,采用 Apache 2.0 许可证。
欢迎查看 Hugging Face 上的 Model Card、Underdog 发布页面,以及 X 上的公告。所有功劳都归于这个项目的研究者。也欢迎在 Twitter 上关注我们,别忘了加入我们拥有 150k+ 成员的 ML SubReddit,并订阅我们的 Newsletter。等等!你使用 Telegram 吗?现在也可以在 Telegram 上加入我们了。
Michal Sutter 是一名数据科学专业人士,拥有帕多瓦大学的数据科学理学硕士学位。他在统计分析、机器学习和数据工程方面基础扎实,擅长将复杂的数据集转化为可付诸行动的洞察。