阿里 Qwen 发布 27B 参数原生多模态模型,支持文本、图像、小时级视频理解,编程与 Agent 任务性能接近闭源大模型。
Alibaba 的 Qwen 团队刚刚发布了 Qwen3.8-27B,这无疑是今年最值得关注的开源权重模型之一。它是一个 27B 参数的稠密模型,原生支持图像和视频理解,具备灵活的"思考"控制能力,在 agent 和编程任务上的基准成绩足以让它与体积大得多的闭源模型同台竞技。
本文将深入介绍 Qwen3.8-27B 究竟是什么、如何构建的、与自家前辈及竞品的对比情况,以及如何实际运行它。
Qwen3.8-27B 是全新 Qwen3.8 系列中适合部署的紧凑成员,构建在 Qwen3.5 引入的架构之上。它是一个带视觉编码器的因果语言模型——这意味着它不是后期拧上去的多模态适配器,而是一个原生训练以推理文本、图像乃至长达一小时视频的模型。
核心特性:
reasoning_effort 参数调节(xhigh、medium、low)模型基于 Apache 2.0 许可证在 Hugging Face 发布,完全开放商业使用。
Qwen3.8-27B 的核心是一个相当特殊的混合架构,而非普通的 transformer 堆叠:
有趣的地方在于混合了线性注意力/全注意力的布局:大多数层使用 Gated DeltaNet(一种线性注意力变体),每四个子块插入一个完整的 Gated Attention 块。这在近期的高效 LLM 设计中很常见——它在保持长上下文工作负载的计算量和 KV-cache 成本可控的同时,仍保留困难推理任务所需的全剧精确注意力。
Qwen 公布了与另外三个模型的基准对比:自家前辈 Qwen3.6-27B 和 Qwen3.7-Plus、一款名为 Muse Glimmer-30B 的第三方模型,以及一款体量大得多的闭源模型 Opus4.6 Max,作为前沿参考点。
有几个数据值得关注:
从 Qwen3.6 到 Qwen3.8 的代际跨越很大。在 DeepSWE 1.1 上,Qwen3.8-27B 的得分是 Qwen3.6-27B 的三倍多(42.2 vs 13.3)。在 QwenSWEBench 上提升了近 30 分。
Qwen3.8-27B 在多个 agent 和编程基准上超越了 Opus4.6 Max——包括 SWE-bench Pro、DeepSWE、QwenSWEBench、CoWorkBench、LiveCodeBench,尽管它是一个小得多的开源权重稠密模型。
Opus4.6 Max 在广泛推理能力(GPQA Diamond、HLE)和纯终端 agent 执行(Terminal-Bench 2.1)上仍然领先,这与它作为前沿级参考模型的定位相符。
Muse Glimmer-30B 在所有有数据的项目上都落后,尽管它与 Qwen3.8-27B 规模相当。
这才是 Qwen3.8-27B 真正拉开差距的地方:在 agent 多模态任务上几乎全面胜出——电脑使用、浏览器使用、移动端使用、应用重建。有趣的是,在这些类别上它甚至大幅领先 Opus4.6 Max(例如 OSWorld 上 84.3 vs 72.7,AndroidWorld 上 81.9 vs 62.0)。然而在纯视觉感知任务(如文档理解或现实世界 QA)上,它的同门兄弟 Qwen3.7-Plus 略微胜出,这表明 Qwen3.7-Plus 可能更侧重于静态视觉理解,而 Qwen3.8-27B 则优化于对所见内容的行动执行。
注意:以上均为 Qwen 自报数据,评估主要基于其方法论说明中提到的 Claude Code harness,部分基准的真值由 Qwen 做了修正。对于厂商发布的基准数据,一如既往地应将其作为参考起点而非金科玉律——独立复现值得关注。
Qwen3.8-27B 可以接入标准的开源 serving 框架。
from transformers import pipeline
pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.8-27B")
messages = [
{
"role": "user",
"content": [
{"type": "image", "url": "https://example.com/image.jpg"},
{"type": "text", "text": "What's in this image?"}
]
}
]
pipe(text=messages)
pip install vllm
vllm serve "Qwen/Qwen3.8-27B"
pip install sglang
python3 -m sglang.launch_server --model-path "Qwen/Qwen3.8-27B" --host 0.0.0.0 --port 30000
两个框架都暴露了 OpenAI 兼容的 chat completions 端点,如果已经在用 OpenAI SDK,可以无缝替换。
Qwen3.8 默认启用推理,在最终答案前将内部思维链包裹在 <think>...</think> 中。通过两个旋钮来控制:
reasoning_effort:xhigh(默认,深思熟虑)、medium(均衡)或 low(快速/低成本)
enable_thinking:通过 chat_template_kwargs 设为 False,可在延迟敏感场景下完全跳过推理
还有 preserve_thinking,它能在多轮对话中保留之前轮次的推理痕迹——适用于 agent 需要跨步骤保持决策一致性的场景,同时也能提升 KV-cache 的复用率。
推荐采样参数
思考模式:temperature 1.0,top_p 0.95,top_k 20,repetition_penalty 1.0
非思考模式:temperature 0.7,top_p 0.80,top_k 20,presence_penalty 1.5
对于超过原生 262,144 token 窗口的输入,Qwen 推荐启用 YaRN RoPE scaling(vLLM、SGLang 和 TokenSpeed 均支持),而不是盲目调高 max_model_len,因为静态 YaRN 实现会在扩展范围和短上下文性能之间做权衡。
如果正在为项目选择模型,以下是大致的选择框架:
选择 Qwen3.8-27B 如果:需要一个可自托管的、Apache-2.0 许可的模型,用于编程 agent、电脑使用/浏览器使用自动化或长文档/视频理解,希望获得接近前沿模型的性能而不必承受前沿模型的价格或供应商锁定。
考虑 Qwen3.7-Plus 如果:工作负载更偏向静态文档/图像理解而非 agent 行动执行——在部分感知密集型基准上略胜 3.8。
考虑 Opus4.6 Max 如果:需要最强的通用推理能力(GPQA、HLE)或终端 agent 执行,且不介意使用闭源的托管前沿模型。
Qwen3.6-27B 现在显然已是上一代——如果已在使用,值得升级。
Qwen3.8-27B 最引人注目之处并非任何单一基准数字——而是一个 27B 的稠密模型能够与那些被认为体积大数倍的模型同台竞技(在 agent/电脑使用类别上甚至部分领先)。结合 Apache 2.0 许可证、原生多模态、百万 token 上下文上限以及可调节的推理力度,对于想要自托管而非完全依赖闭源 API 的编程 agent、电脑使用自动化或文档/视频理解场景的开发者来说,这是一个真正令人信服的选择。
如果正在尝试使用它,期待在评论区听到它在实际工作负载上的表现。
模型卡片和基准数据来源为 Hugging Face 上 Qwen3.8-27B 官方模型页面。