前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9301
  • macOS 屏幕共享漏洞正遭活跃利用,可远程获取 Root 权限
  • Linux 7.2 稳定版发布:I/O 性能优化、AMD/Intel 显卡驱动改进
  • 2026年8月AI基础设施与推理平台定价对比:18款工具每日更新
  • EU AI Act水印规定生效:AI生成内容标记可被伪造吗
  • Java 21 + Spring Boot + React 19 构建AI提示词管理平台
  • 30个AI API价格实测:价差高达350倍
  • 向量数据库深度解析与DataLoader实现
  • Pizza-Builder 法则:结构化提示词设计避免 AI 反复猜错
  • Anthropic API Prompt Cache深度分析:22%命中率才回本
  • AI Agent 自报完成不可信:两种独立验证方法
  • AI生成代码的隐性风险:我们正在交付看不见的假设
  • Python 内容审核:Schema 门控批量分类 + 人工复核队列
  • Anthropic Claude 大规模宕机,多项服务受影响
  • 生产环境 LLM 选型:别只看基准分,场景上下文才是关键
  • AI写的汇编不可信:三行命令验证真伪
  • 崩溃路由迷信 0.97 置信度:单点模型决策的风险
  • AI编程代理55种低层代码失败案例与124个修复技能
  • TTFT 与 TTFB 的区别:45 个 AI API 四区域实测数据
  • Gemini 3.7 Flash 发布:编程+Agent 能力大幅提升,价格腰斩
  • LLM Agent 重试机制的可观测性设计实践
  • Qwen 3.8 27B 发布:本地运行出色但默认过度思考
  • 客服AI智能体架构详解:从问答型到工作流执行型
  • Anthropic在Claude输出中嵌入水印引发写作伦理争议
  • 免费AI接口429错误被吞?用Relay转发元数据
  • 用AI高效写API文档的5个实战技巧
  • 我用Python写了个检测硬编码密钥的CLI工具
  • Stripe超70亿美元收购AI网关OpenRouter
  • AI Agent盘活多仓库遗留项目:OpenCode+SpecKit实战
  • AI Agent五层架构详解:Graph Engineering为何是缺失的那环
  • GhostSplice攻击:利用MCP协议碎片化提示窃取SSH密钥
  • 本地优先AI宣言:模型主权与隐私保护新思路
  • 紧急:SharePoint认证绕过漏洞CVE-2026-55040正被积极利用
  • Agent的State、Memory、Checkpointing不是一回事
  • 受监管行业LLM基础设施检查清单
  • 无限画布性能架构:视口虚拟化与空间索引
  • AI 编程 Agent 的 harness 才是决定因素:同一模型最大 23.8 分差距来自它
  • OpenCode 源码解读:MIT 开源 AI Agent Harness 内部机制全解析
  • AI Coding Agent 的 prompt 格式正在标准化:规则/流程/记忆如何引导代码修改
  • Same input, same receipt:让 AI 基准测试结果可验证、可复现
  • Claude Mythos + Project Glasswing 已发现超一万个高危漏洞
  • GraphQL N+1 排查新法:数 Resolver 调用次数而非响应延迟
  • Grok 4.6:后训练优化突破Scaling Law,成本不变性能跃升
  • 用免费模型从数据库迁移文件自动生成Seed数据,告别手写Fixture
  • AI生成服务的安全审计:systemd能力边界检查实战
  • Attention机制原理深度解析:逐行代码讲解Transformer核心
  • 2026年AI API成本实测:开源开发者的省钱指南
  • 9个多模态API实战对比:成本与效果实测
  • Kimi K3的2.8T参数不是最难部分:MoE推理系统工程分析
  • 做AI产品别先上RAG:汽车检测AI架构教训
  • 向量检索的精确匹配盲区:RAG检索架构补全方案
  • AI日报:DeepSeek调价、智谱发布最强代码模型、Anthropic隐藏模型
  • 已加载 51 / 9301
8.0
热点
AI SCORE
模型发布2026-08-17 06:00

Qwen 3.8 27B 发布:本地运行出色但默认过度思考

Simon Willison#Qwen#开源模型#本地部署
Editor brief · 编辑速览

Qwen 3.8 27B 是一款 Apache 2 许可的视觉语言模型,在 M5 Max MacBook Pro 和 DGX Spark 上均可运行。默认的 xhigh 推理强度导致过度思考,可通过 reasoning_effort 参数调低至 low/medium/high。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

周五发布的大事是 Qwen 3.8 27B,这是一款来自阿里云通义千问研究实验室的 270 亿参数、Apache 2 许可、支持视觉的 LLM。我对这款模型期待已久:270 亿参数是一个非常适合在配置不错的笔记本电脑上运行的规模,而它的前身 Qwen 3.6 27B 已经令人印象深刻。

Qwen 自我报告的该模型基准测试数据令人瞩目。相比 Qwen 3.6 27B 和闭源模型 Qwen 3.7-Plus 有明显提升——就在今年 5 月,Qwen 3.7-Plus 还是同尺寸级别中最强的模型之一。独立基准测试对这款模型的评价如何,将很有意思。

我一直在两台不同的机器上运行这个模型:一台是 128GB 的 M5 Max MacBook Pro,另一台是 NVIDIA DGX Spark。两台机器上我都用 LM Studio 运行其 17GB Q4_K_M 量化版本。我也在 Spark 上直接用 llama-server 试过。

Qwen 的文档将该模型描述为默认推理努力程度为 xhigh,LM Studio 的 GGUF 版本保留了这个默认值:

Qwen3.8 官方支持 reasoning_effort,可用于调整推理深度和控制成本:

xhigh(默认):适用于需要深入分析的复杂任务

medium:在准确性和速度之间取得平衡

low:高效推理,优化速度和成本

这是一个非常离谱的默认设置。在消费级硬件上运行模型时,这绝不是一个好的方式。我发现结果非常有趣。

我很快遇到了 LM Studio 默认 8,192 token 上下文限制的问题——Qwen 哪怕在处理最简单的问题时都会把 token 用完。我把模型加载到了完整的 262,144 最大上下文长度,这个问题就消失了。

以下是我在增加上下文长度后第一次尝试得到的企鹅骑自行车的 SVG。它用了 21 分钟生成,消耗了 22,276 个推理 token 来产出 3,223 个输出 token。你可以在此处阅读推理过程。

A very pleasing image of a pelican riding a bicycle. The bicycle is red and has the correct frame shape. The pelican looks like a pelican and has its wing extended to the handlebars.

这是我目前能在本地机器运行的模型上生成的最好的企鹅 SVG——而且 Qwen 体积很小,磁盘上只有 17GB 文件。有很多值得称道的地方:

自行车框架形状正确

它在自行车两侧都有腿——这非常罕见

企鹅喉囊清晰好看

翅膀延伸到握住车把!

运动线在后面,不是在前面

有雅致的背景——不错的太阳、云朵、山丘、花朵和草地。

值得等 21 分钟吗?绝对不值得。

这是同一个 prompt 关闭推理后的结果——记录在此。这个产出 3,715 个 token,用时 137 秒——大约两分钟多一点。

为了完整性,我还用 OpenRouter 通过大得多的 Qwen 3.8 2.4T-A95B(上周发布)运行了同样的 prompt,得到了这个炫酷的动态 SVG:

The bicycle frame is a bad shape now. The pelican remains recognizable but has a less obvious pouch. The feet miss the pedal, there is no attempt to hold the handlebars.

Your browser does not support HTML5 video.

我尝试了一个简单得多的 prompt,同样使用那个默认的超高设置:

draw an svg of a circle

Qwen 的推理过程开始是这样的:

用户要求绘制一个圆的 SVG。简单的请求——但我想把它做成一个精心雕琢的作品。让我做一些超越简单 <circle> 的东西:一个有特色的独立 SVG 文件——也许是一个几何"圆研究",带有微妙的动画、分层环和独特的调色板。

保持范围正确:他们要的是圆的 SVG。所以核心是一个圆。但我可以加上工艺:同心辅助圆(像罗盘/几何绘图那样)、刻度线、主圆上的柔和渐变填充、克制的环境动画(缓慢旋转的虚线环、脉动的光晕)。尊重 prefers-reduced-motion?这更适用于 CSS;SVG SMIL 或 SVG 内嵌 CSS 可以做到。

调色板选项:暖纸上的深青色墨水?或者是米白底上的明亮朱红圆——包豪斯/罗盘绘图风格。让我采用"几何研究"的外观:冷 slate 背景,或者明亮的纸白?如果不是奶油色和陶土色的组合,纸白也可以。[...]

几分钟后,它生成了这个绝对美丽的动态圆,但这完全不是我要求的!

Your browser does not support HTML5 video.

测试视觉模型的一个有趣方式是看它能多好地返回照片中物体的边界框。我之前的 Qwen 模型在这方面表现不错,所以我决定用它来为一些企鹅画边界框。

我之前见过要求 0-1000 比例能得到不错的结果。我这样尝试:

llm -a https://static.inaturalist.org/photos/714731804/large.jpg \
  -m lmstudio/qwen/qwen3.8-27b \
  'Return JSON bounding boxes for the pelicans in this photo, 0-1000 scale for each dimension'

这是推理过程,产生了这个结果:

[
  {"bbox_2d": [195, 290, 370, 780], "label": "pelicans"},
  {"bbox_2d": [445, 320, 675, 850], "label": "pelicans"}
]

这是一个非常好的匹配。以下是这些框叠加在照片上的可视化:

A photograph of two pelicans on a rocky outcrop, with three other smaller birds. The pelicans both have bounding boxes exactly surrounding them, each with a label that says pelican.

边界框的可视化是我让 Qwen 3.8 27B 在我的笔记本电脑上离线构建的一个新自定义工具完成的。

我忘了调低思考努力程度,所以它严重过度设计了,但它确实从这一个 prompt 中产生了这个完整的界面:

[
   {"bbox_2d": [195, 290, 370, 780], "label": "pelicans"},
   {"bbox_2d": [445, 320, 675, 850], "label": "pelicans"}
]

构建一个 HTML 页面,有一个输入框接受图片 URL,一个文本区域接受上述风格的 JSON。

它将图片附加到页面,测量其宽度和高度,然后将 bbox_2d 中的坐标视为从 0-1000 缩放,并针对实际宽度和高度进行缩放,然后在图片上渲染带标签的框。

这张截图展示了一个我没有要求的功能——一个演示场景,以防你没有照片来测试这个工具:

Screenshot of bbox·lab, a dark-themed web tool that overlays object-detection bounding boxes on an image, with an input panel on the left and a stage on the right showing two labeled boxes around stylized pelicans in a sunset illustration. Header: bbox·lab — normalized 0–1000 coords → pixel overlay; status indicator: RENDERED · 2 BOXES. Panel 01 INPUT (URL + detections) contains an IMAGE URL field reading data:image/png;base64,iVBORw0KGgoAAAANSUhEUgAAA+, a DETECTIONS — JSON textarea reading  {"bbox_2d": 195, 290, 370, 780, "label": "pelicans"}, {"bbox_2d": 445, 320, 675, 850, "label": "pelicans"} , an orange RENDER BOXES button, and dashed boxes labeled DEMO SCENE and CLEAR. Panel 03 STAGE header: display 661 × 661 px · 1 unit = 0.661px x 0.661px · nat 1000×1000. The stage shows a flat-style illustration of two dark pelican silhouettes with orange beaks standing in calm water against an orange-to-purple sunset sky with a pale yellow sun and distant birds; an orange bounding box labeled 1 · pelicans surrounds the left pelican and a cyan bounding box labeled 2 · pelicans surrounds the right pelican. Footer: move the cursor over the image to read grid coords; boxes map 0–1000 → displayed px.

以下是推理过程中相关的片段,它决定自己画企鹅——仅仅是因为我在 prompt 中给出的示例 JSON 里用了"pelicans"这个标签:

也要一个"加载示例"的功能,以防没有照片可以测试这个工具?不能依赖外部图片,但……图片 URL 输入是用户提供的;我可以添加一个"尝试示例"按钮[...] 嗯,我可以在 canvas 上画一个简单的场景,导出为 data URL,然后加载到图片——这是独立可演示的![...] 但用户的坐标是针对实际企鹅图片的;生成的占位符仍然可以演示缩放效果。生成一个 1000x1000 的占位符:渐变水面 + 两只Blob状的"企鹅"剪影放在给定的 bbox 位置(使用相同的比例——有趣:剪影在精确的 0-1000 位置上,展示框对齐)。这是一个有趣且独立的演示。保持简单:天空渐变、太阳、水、两只企鹅形状(椭圆身体、圆形头部、喙)。放在 bbox 中心。

(我有点担心世界各地的模型可能会因为近两年接触我自己的愚蠢基准测试而产生在任何机会下画企鹅的偏见。)

所有这些过度思考有必要吗?也许有,至少有那么一点。我关闭推理尝试了一下,得到了这个版本(记录在此),它几乎可以工作,但框的位置显示错误:

BBox Studio screenshot - a solid UI but the yellow and green boxes do not cover the pelicans.

所以没有推理它没能一次成功构建一个可用的工具。我相信通过一些后续 prompt 可以做到,但这是推理如何产生影响的一个很好的例子。

围绕本地模型最大的问题之一是它们是否有足够的算力成功运行一个编码 Agent 循环。编码 Agent 需要长上下文、强大的代码生成支持和可靠的工具调用。理论上 Qwen 3.8 27B 三者兼备,所以它能胜任吗?

我使用 Pi 进行的初步实验非常有前景。我选择 Pi 是因为它的系统 prompt 比大多数其他选项短,这使得它更适合尝试较小的模型。

我配置 Pi 使用在 Spark 上通过 LM Studio 运行的 Qwen 3.8 27B(通过 tailscale serve 共享),在 ~/.pi/agent/models.json 中添加:

{
  "providers": {
    "spark": {
      "baseUrl": "https://spark-18b3.tail68a31.ts.net/v1",
      "api": "openai-responses",
      "apiKey": "dummy",
      "models": [
        {
          "id": "qwen3.8-27b",
          "reasoning": true
        }
      ]
    }
  }
}

然后在我的 ~/dev/datasette 文件夹中运行 pi --provider spark --model qwen3.8-27b,并 prompt:

经过一连串访问不同文件的推理和工具调用后,它产生了这个回复,非常扎实。

只有一个问题:我想分享那个记录。所以我让 Pi 和 Qwen 3.8 27B 指向 ~/.pi/agent/sessions/--Users-simon-Dropbox-dev-datasette-- 中的 JSONL 记录文件,然后 prompt:

Write Python code to convert this jsonl to markdown

它构建并测试了这个 pi_jsonl_to_md.py,效果正如我需要的那样。以下是那个会话记录,用它自己创建的工具发布了。

目前看来一切都非常有希望。我们有一个 17GB 的模型,可以在高端消费级硬件上运行,可以写代码、驱动工具、标注图片,而且可以做我从 LLM 那里完成实际工作所需的一切。

有一个非常重要的限制:它感觉很慢——特别是在开始过度思考时,但即使没有那个问题,速度也不快。

我从 LM Studio 那里得到了大约每秒 15-30 个 token。这不算太差,但慢到足以让我很难放弃托管 API 模型,因为后者可以快得多的返回结果。Artificial Analysis 追踪 token 速度,显示 OpenAI 5.6 Sol 为 74 token/秒,5.6 Luna 达到了令人印象深刻的 184 token/秒。

好消息是,自两天前模型首次发布以来,社区一直在探索加速的方法。

最有前景的优化之一内置在模型本身。Qwen 支持 Multi-Token Prediction,这是一种架构技巧,用一个更便宜的机制猜测后续几个 token,然后主模型快速验证这些猜测是否正确。这可以对推理性能产生相当显著的影响。

基于 llama.cpp 创建者 Georgi Gerganov 的这条推文,我在 Spark 上用 MTP 这样运行模型:

llama serve \
 -hf  ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \
 -hfd ggml-org/Qwen3.8-27B-GGUF:Q4_0 \
 --spec-default \
 --spec-type draft-mtp \
 --reasoning-preserve

果然,这给了我一个显著的提升。我让 GPT-5.6 在 Codex 上对 Spark 进行比较基准测试,--spec-type draft-mtp 服务器比 LM Studio 默认 GGUF 快了约 72%。

我预计在接下来的几周内会看到更多关于如何更快地服务这个模型的创新。MLX 社区可能也在酝酿一些技巧。

一个 17GB 的文件就能在我家里的机器上完成所有这些工作是一个奇迹。我再次对本地模型今年取得的进步感到高兴和惊讶。一年前这可以和最好最贵的专有模型竞争——今天它可以在功能不错的笔记本电脑上运行。

唯一阻碍它成为日常使用工具的是性能。它在 M5 Mac 和 DGX Spark 上都感觉相当慢。这是这些密集型(非混合专家)模型的通病——它们需要大量内存带宽才能良好运行,而我访问的这两台机器在内存带宽方面都不是顶级表现。

关于 Qwen 3.8 27B 最重要的是它所展示的。我们可以拥有一个开放权重通用模型,具有长上下文、有效工具调用、强大视觉能力和胜任的代码生成,而且我们可以把整个模型压缩到只有 17GB 的文件中。

这个规模的模型继续以令人印象深刻的速度变得更好。我们不需要花五十万美元购买数据中心级硬件来运行一个胜任的模型。


现在我们有了 OpenAI 意外攻击 Hugging Face 的时间线——2026 年 8 月 7 日

用 Claude Fable 5 一镜射击 Racoon Heist 游戏——2026 年 8 月 5 日

这就是 Simon Willison 的《Qwen 3.8 27B 很出色,但默认设置会导致疯狂过度思考》,发布于 2026 年 8 月 16 日。

系列文章:LLMs on personal devices

OpenAI 新的开放权重(Apache 2)模型真的很好——2025 年 8 月 5 日,晚上 8:33

Qwen3-4B-Thinking:"这是艺术——企鹅不骑自行车!"——2025 年 8 月 10 日,晚上 11:59

Mr. Chatterbox 是一个(弱)维多利亚时代经伦理训练的模型,你可以在自己的电脑上运行——2026 年 3 月 30 日,下午 2:28

Qwen 3.8 27B 很出色,但默认设置会导致疯狂过度思考——2026 年 8 月 16 日,晚上 10 点

上一篇:现在我们有了 OpenAI 意外攻击 Hugging Face 的时间线

每月赞助 $10 获取当月最重要 LLM 发展的精选邮件摘要。

付费让我给你发得更少!

Original source

本文由 AI 翻译整理自 Simon Willison,原文版权归原作者所有。

阅读英文原文
上一篇
LLM Agent 重试机制的可观测性设计实践
下一篇
客服AI智能体架构详解:从问答型到工作流执行型