BottleCap AI对Qwen3.8-27B微调,12个基准上思考token减少37.2%,准确率仅下降0.86pp;长上下文AA-LCR提升2.25pp,支持vLLM/SGLang直接替换。
来源:MarkTechPost
BottleCap AI 发布了 ThinkingCap-Qwen3.8-27B,这是 ThinkingCap 系列的第二个模型。该模型基于 Qwen 团队的 Qwen3.8-27B 进行微调,目标只有一个:缩短推理过程。在 12 个基准测试中,平均思考 token 数量减少了 37.2%。宏平均精度从 86.65% 降至 85.79%,仅下降 0.86 个百分点。
能否部署?完全可以。它可以直接替换 Qwen3.8-27B,支持 vLLM 或 SGLang,以及 FP8、NVFP4、GGUF 和 MLX 构建版本。仓库设有访问限制,商业使用超出小企业许可证范围需签订 BottleCap 协议。
推理模型在处理问题时,往往会产生超出必要范围的思考 token。BottleCap 的观点是:这些额外消耗的 token 中,有相当一部分对最终答案没有影响。该系列首个模型就是基于这一思路对 Qwen3.6-27B 进行优化的。
这次的目标刻意保持保守。BottleCap 并未试图增加知识或改变回答风格。推理能力、指令遵循和安全行为应保持不变。研究团队还重点关注了数学、推理、长上下文和 agentic 基准测试。
所有主要数据均使用 reasoning_effort=xhigh,即聊天模板默认值。每个基准测试的思考量都有所下降,降幅从 10.7% 到 65.5% 不等。
知识和多语言任务的压缩幅度最大。MMMLU 下降 65.5%(从 1,656 降至 571 tokens),MMLU-Pro 下降 57.3%。GPQA-Diamond 从 12,772 降至 7,267 tokens,降幅 43.1%。IFBench 思考量减少 46.4%,准确率几乎持平(79.75% 到 79.71%)。
长上下文检索有所改善。AA-LCR 准确率提升 2.25pp,从 81.75% 升至 84.00%,同时思考 token 减少 38.6%。LiveCodeBench v6 准确率微升 0.07pp,思考量减少 20.3%。
Agentic 结果与基线接近。τ²-bench 牺牲 1.01pp 换来 30.9% 的 token 削减。Terminal-Bench 2.1 损失 0.56pp,在 ±4.26 区间内,token 削减 10.7%。
最昂贵的交换出现在 AIME 2026。准确率下降 3.85pp,从 98.13% 降至 94.27%,思考量减少 30.2%。
请注意,37.2% 是 12 个基准测试削减量的平均值。聚合平均思考 token 从 15,735 降至 12,144。
BottleCap 还报告了一条预算曲线。在每响应 16K token 上限下,ThinkingCap 得分高于基线模型。被截断的轨迹从 0.51% 降至 0.34%,循环从 0.06% 降至 0.05%。
Qwen3.8-27B 暴露了 reasoning-effort 设置,压缩效果可与其叠加。以下所有 delta 均相对于基线模型在 xhigh 下的表现,取 11 个基准测试的平均值。
在 medium 下,基线模型削减 52.1% 思考量,对应 -9.16pp。ThinkingCap 削减 60.2%,对应 -9.90pp。在 low 下,基线为 -55.4% 和 -9.71pp,ThinkingCap 为 -62.3% 和 -10.79pp。关闭思考时,ThinkingCap 落后基线 5.7pp。
BottleCap 团队建议使用 xhigh 以获得最佳精度-tokens 平衡。他们表示未来版本会关注单独思考模式。
两个模型在同一测试框架、NVIDIA H200 + vLLM 0.29.0 上运行。采样参数完全一致:temperature 1.0、top_p 0.95、top_k 20、min_p 0.0。多种子准确率为带 95% 置信区间的均值。种子数量从 AIME 2026 的 32 个到 MMLU-Pro 和 MMMLU 的 1 个不等。MMMLU 使用固定的 10,000 题样本;其余 11 个基准测试运行完整集合。
MTP 推测解码(3 个 draft tokens)在 AIME 2026 上被测量为准确率中性。它接受了 53% 的 draft tokens,约每步 2.6 tokens,与基线模型相当。
bf16 检查点有 28B 参数,接受图像和文本输入。BottleCap 发布了 5 个量化构建版本:
服务使用基线模型的配方:--reasoning-parser qwen3 配合 vLLM 上的 qwen3_xml tool-call 解析器。思考内容返回在单独的 reasoning 字段中。
许可证为 PolyForm Small Business 1.0.0 加 BottleCap 个人使用授权。上游 Qwen 材料保持 Apache-2.0。Hugging Face 上尚未有推理提供商托管该模型。
Michal Sutter 是数据科学专业人士,拥有帕多瓦大学数据科学硕士学位。在统计分析、机器学习和数据工程方面基础扎实,擅长将复杂数据集转化为可操作的洞察。