Qwen 3.8 27B 是一款 Apache 2 许可的视觉语言模型,在 M5 Max MacBook Pro 和 DGX Spark 上均可运行。默认的 xhigh 推理强度导致过度思考,可通过 reasoning_effort 参数调低至 low/medium/high。
周五发布的大事是 Qwen 3.8 27B,这是一款来自阿里云通义千问研究实验室的 270 亿参数、Apache 2 许可、支持视觉的 LLM。我对这款模型期待已久:270 亿参数是一个非常适合在配置不错的笔记本电脑上运行的规模,而它的前身 Qwen 3.6 27B 已经令人印象深刻。
Qwen 自我报告的该模型基准测试数据令人瞩目。相比 Qwen 3.6 27B 和闭源模型 Qwen 3.7-Plus 有明显提升——就在今年 5 月,Qwen 3.7-Plus 还是同尺寸级别中最强的模型之一。独立基准测试对这款模型的评价如何,将很有意思。
我一直在两台不同的机器上运行这个模型:一台是 128GB 的 M5 Max MacBook Pro,另一台是 NVIDIA DGX Spark。两台机器上我都用 LM Studio 运行其 17GB Q4_K_M 量化版本。我也在 Spark 上直接用 llama-server 试过。
Qwen 的文档将该模型描述为默认推理努力程度为 xhigh,LM Studio 的 GGUF 版本保留了这个默认值:
Qwen3.8 官方支持 reasoning_effort,可用于调整推理深度和控制成本:
xhigh(默认):适用于需要深入分析的复杂任务
medium:在准确性和速度之间取得平衡
low:高效推理,优化速度和成本
这是一个非常离谱的默认设置。在消费级硬件上运行模型时,这绝不是一个好的方式。我发现结果非常有趣。
我很快遇到了 LM Studio 默认 8,192 token 上下文限制的问题——Qwen 哪怕在处理最简单的问题时都会把 token 用完。我把模型加载到了完整的 262,144 最大上下文长度,这个问题就消失了。
以下是我在增加上下文长度后第一次尝试得到的企鹅骑自行车的 SVG。它用了 21 分钟生成,消耗了 22,276 个推理 token 来产出 3,223 个输出 token。你可以在此处阅读推理过程。

这是我目前能在本地机器运行的模型上生成的最好的企鹅 SVG——而且 Qwen 体积很小,磁盘上只有 17GB 文件。有很多值得称道的地方:
自行车框架形状正确
它在自行车两侧都有腿——这非常罕见
企鹅喉囊清晰好看
翅膀延伸到握住车把!
运动线在后面,不是在前面
有雅致的背景——不错的太阳、云朵、山丘、花朵和草地。
值得等 21 分钟吗?绝对不值得。
这是同一个 prompt 关闭推理后的结果——记录在此。这个产出 3,715 个 token,用时 137 秒——大约两分钟多一点。
为了完整性,我还用 OpenRouter 通过大得多的 Qwen 3.8 2.4T-A95B(上周发布)运行了同样的 prompt,得到了这个炫酷的动态 SVG:

Your browser does not support HTML5 video.
我尝试了一个简单得多的 prompt,同样使用那个默认的超高设置:
draw an svg of a circle
Qwen 的推理过程开始是这样的:
用户要求绘制一个圆的 SVG。简单的请求——但我想把它做成一个精心雕琢的作品。让我做一些超越简单 <circle> 的东西:一个有特色的独立 SVG 文件——也许是一个几何"圆研究",带有微妙的动画、分层环和独特的调色板。
保持范围正确:他们要的是圆的 SVG。所以核心是一个圆。但我可以加上工艺:同心辅助圆(像罗盘/几何绘图那样)、刻度线、主圆上的柔和渐变填充、克制的环境动画(缓慢旋转的虚线环、脉动的光晕)。尊重 prefers-reduced-motion?这更适用于 CSS;SVG SMIL 或 SVG 内嵌 CSS 可以做到。
调色板选项:暖纸上的深青色墨水?或者是米白底上的明亮朱红圆——包豪斯/罗盘绘图风格。让我采用"几何研究"的外观:冷 slate 背景,或者明亮的纸白?如果不是奶油色和陶土色的组合,纸白也可以。[...]
几分钟后,它生成了这个绝对美丽的动态圆,但这完全不是我要求的!
Your browser does not support HTML5 video.
测试视觉模型的一个有趣方式是看它能多好地返回照片中物体的边界框。我之前的 Qwen 模型在这方面表现不错,所以我决定用它来为一些企鹅画边界框。
我之前见过要求 0-1000 比例能得到不错的结果。我这样尝试:
llm -a https://static.inaturalist.org/photos/714731804/large.jpg \
-m lmstudio/qwen/qwen3.8-27b \
'Return JSON bounding boxes for the pelicans in this photo, 0-1000 scale for each dimension'
这是推理过程,产生了这个结果:
[
{"bbox_2d": [195, 290, 370, 780], "label": "pelicans"},
{"bbox_2d": [445, 320, 675, 850], "label": "pelicans"}
]
这是一个非常好的匹配。以下是这些框叠加在照片上的可视化:

边界框的可视化是我让 Qwen 3.8 27B 在我的笔记本电脑上离线构建的一个新自定义工具完成的。
我忘了调低思考努力程度,所以它严重过度设计了,但它确实从这一个 prompt 中产生了这个完整的界面:
[
{"bbox_2d": [195, 290, 370, 780], "label": "pelicans"},
{"bbox_2d": [445, 320, 675, 850], "label": "pelicans"}
]
构建一个 HTML 页面,有一个输入框接受图片 URL,一个文本区域接受上述风格的 JSON。
它将图片附加到页面,测量其宽度和高度,然后将 bbox_2d 中的坐标视为从 0-1000 缩放,并针对实际宽度和高度进行缩放,然后在图片上渲染带标签的框。
这张截图展示了一个我没有要求的功能——一个演示场景,以防你没有照片来测试这个工具:

以下是推理过程中相关的片段,它决定自己画企鹅——仅仅是因为我在 prompt 中给出的示例 JSON 里用了"pelicans"这个标签:
也要一个"加载示例"的功能,以防没有照片可以测试这个工具?不能依赖外部图片,但……图片 URL 输入是用户提供的;我可以添加一个"尝试示例"按钮[...] 嗯,我可以在 canvas 上画一个简单的场景,导出为 data URL,然后加载到图片——这是独立可演示的![...] 但用户的坐标是针对实际企鹅图片的;生成的占位符仍然可以演示缩放效果。生成一个 1000x1000 的占位符:渐变水面 + 两只Blob状的"企鹅"剪影放在给定的 bbox 位置(使用相同的比例——有趣:剪影在精确的 0-1000 位置上,展示框对齐)。这是一个有趣且独立的演示。保持简单:天空渐变、太阳、水、两只企鹅形状(椭圆身体、圆形头部、喙)。放在 bbox 中心。
(我有点担心世界各地的模型可能会因为近两年接触我自己的愚蠢基准测试而产生在任何机会下画企鹅的偏见。)
所有这些过度思考有必要吗?也许有,至少有那么一点。我关闭推理尝试了一下,得到了这个版本(记录在此),它几乎可以工作,但框的位置显示错误:

所以没有推理它没能一次成功构建一个可用的工具。我相信通过一些后续 prompt 可以做到,但这是推理如何产生影响的一个很好的例子。
围绕本地模型最大的问题之一是它们是否有足够的算力成功运行一个编码 Agent 循环。编码 Agent 需要长上下文、强大的代码生成支持和可靠的工具调用。理论上 Qwen 3.8 27B 三者兼备,所以它能胜任吗?
我使用 Pi 进行的初步实验非常有前景。我选择 Pi 是因为它的系统 prompt 比大多数其他选项短,这使得它更适合尝试较小的模型。
我配置 Pi 使用在 Spark 上通过 LM Studio 运行的 Qwen 3.8 27B(通过 tailscale serve 共享),在 ~/.pi/agent/models.json 中添加:
{
"providers": {
"spark": {
"baseUrl": "https://spark-18b3.tail68a31.ts.net/v1",
"api": "openai-responses",
"apiKey": "dummy",
"models": [
{
"id": "qwen3.8-27b",
"reasoning": true
}
]
}
}
}
然后在我的 ~/dev/datasette 文件夹中运行 pi --provider spark --model qwen3.8-27b,并 prompt:
经过一连串访问不同文件的推理和工具调用后,它产生了这个回复,非常扎实。
只有一个问题:我想分享那个记录。所以我让 Pi 和 Qwen 3.8 27B 指向 ~/.pi/agent/sessions/--Users-simon-Dropbox-dev-datasette-- 中的 JSONL 记录文件,然后 prompt:
Write Python code to convert this jsonl to markdown
它构建并测试了这个 pi_jsonl_to_md.py,效果正如我需要的那样。以下是那个会话记录,用它自己创建的工具发布了。
目前看来一切都非常有希望。我们有一个 17GB 的模型,可以在高端消费级硬件上运行,可以写代码、驱动工具、标注图片,而且可以做我从 LLM 那里完成实际工作所需的一切。
有一个非常重要的限制:它感觉很慢——特别是在开始过度思考时,但即使没有那个问题,速度也不快。
我从 LM Studio 那里得到了大约每秒 15-30 个 token。这不算太差,但慢到足以让我很难放弃托管 API 模型,因为后者可以快得多的返回结果。Artificial Analysis 追踪 token 速度,显示 OpenAI 5.6 Sol 为 74 token/秒,5.6 Luna 达到了令人印象深刻的 184 token/秒。
好消息是,自两天前模型首次发布以来,社区一直在探索加速的方法。
最有前景的优化之一内置在模型本身。Qwen 支持 Multi-Token Prediction,这是一种架构技巧,用一个更便宜的机制猜测后续几个 token,然后主模型快速验证这些猜测是否正确。这可以对推理性能产生相当显著的影响。
基于 llama.cpp 创建者 Georgi Gerganov 的这条推文,我在 Spark 上用 MTP 这样运行模型:
llama serve \
-hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \
-hfd ggml-org/Qwen3.8-27B-GGUF:Q4_0 \
--spec-default \
--spec-type draft-mtp \
--reasoning-preserve
果然,这给了我一个显著的提升。我让 GPT-5.6 在 Codex 上对 Spark 进行比较基准测试,--spec-type draft-mtp 服务器比 LM Studio 默认 GGUF 快了约 72%。
我预计在接下来的几周内会看到更多关于如何更快地服务这个模型的创新。MLX 社区可能也在酝酿一些技巧。
一个 17GB 的文件就能在我家里的机器上完成所有这些工作是一个奇迹。我再次对本地模型今年取得的进步感到高兴和惊讶。一年前这可以和最好最贵的专有模型竞争——今天它可以在功能不错的笔记本电脑上运行。
唯一阻碍它成为日常使用工具的是性能。它在 M5 Mac 和 DGX Spark 上都感觉相当慢。这是这些密集型(非混合专家)模型的通病——它们需要大量内存带宽才能良好运行,而我访问的这两台机器在内存带宽方面都不是顶级表现。
关于 Qwen 3.8 27B 最重要的是它所展示的。我们可以拥有一个开放权重通用模型,具有长上下文、有效工具调用、强大视觉能力和胜任的代码生成,而且我们可以把整个模型压缩到只有 17GB 的文件中。
这个规模的模型继续以令人印象深刻的速度变得更好。我们不需要花五十万美元购买数据中心级硬件来运行一个胜任的模型。
现在我们有了 OpenAI 意外攻击 Hugging Face 的时间线——2026 年 8 月 7 日
用 Claude Fable 5 一镜射击 Racoon Heist 游戏——2026 年 8 月 5 日
这就是 Simon Willison 的《Qwen 3.8 27B 很出色,但默认设置会导致疯狂过度思考》,发布于 2026 年 8 月 16 日。
系列文章:LLMs on personal devices
OpenAI 新的开放权重(Apache 2)模型真的很好——2025 年 8 月 5 日,晚上 8:33
Qwen3-4B-Thinking:"这是艺术——企鹅不骑自行车!"——2025 年 8 月 10 日,晚上 11:59
Mr. Chatterbox 是一个(弱)维多利亚时代经伦理训练的模型,你可以在自己的电脑上运行——2026 年 3 月 30 日,下午 2:28
Qwen 3.8 27B 很出色,但默认设置会导致疯狂过度思考——2026 年 8 月 16 日,晚上 10 点
上一篇:现在我们有了 OpenAI 意外攻击 Hugging Face 的时间线
每月赞助 $10 获取当月最重要 LLM 发展的精选邮件摘要。
付费让我给你发得更少!