阿里Qwen团队发布的270亿参数视觉语言模型,DeepSWE 1.1得分42.2超越Claude Opus 4.6,API价格$0.45/百万token,支持本地在RTX 3090上运行。
🎯 核心要点(TL;DR)
Qwen3.8-27B 是阿里巴巴 Qwen 团队发布的全新 270 亿参数稠密模型——原生视觉语言模型,支持图片和视频理解,具备灵活的思维控制能力,权重采用 Apache 2.0 开源协议。
最大的亮点是本地模型尺寸下的 Agent 性能:Qwen3.8-27B 在 DeepSWE 1.1 得分 42.2(对比 Qwen3.6-27B 的 13.3),Terminal Bench 2.1 得分 73.0,并在 SWE-bench Pro、QwenSWEBench、LiveCodeBench v6、OSWorld 和 AndroidWorld 上超越了 Claude Opus 4.6 Max。
Qwen3.8-27B 原生支持 262,144 token 上下文窗口(通过 YaRN 可扩展至 1M),28B BF16 权重,思维模式默认开启,推理努力级别支持 xhigh/medium/low 三档。
在 OpenRouter 上,Qwen3.8-27B 的价格为每百万 token $0.45 / $3.20——Reddit 用户已在 RTX 3090、双 RTX 5080 和 16GB VRAM 显存的显卡上成功本地运行。
Qwen3.8-27B 架构与规格
Qwen3.8-27B 基准测试:Agent 能力的飞跃
Qwen3.8-27B 定价与 API 接入
本地运行 Qwen3.8-27B
Qwen3.8-27B vs 竞品对比
Qwen3.8-27B 是 Qwen3.8 家族的最新成员——官方模型卡称其为"Qwen 开源模型家族迄今为止能力最强的代际"。Qwen3.8-27B 基于 Qwen3.5 的架构构建,在编程、专业工作、科研和长周期 Agent 任务上实现了显著提升,同时封装在一个紧凑、适合部署的稠密模型中。
关键词是稠密。与 2026 年 8 月 8 日权重上线时登上头条的巨型 MoE 模型 Qwen3.8-Max(2.4T 参数)不同,Qwen3.8-27B 是一个 270 亿参数的稠密模型,专为个人实际拥有的硬件设计。正如 r/LocalLLaMA 的发布帖子所言,Qwen3.8-27B 是一款"备受喜爱的 Qwen 模型的重新诠释,实现了无与伦比的智能密度"。
Qwen3.8-27B 还是一个原生视觉语言模型:开箱即支持图片和视频理解——从 STEM 图表和文档到长达数小时的视频。它是该系列中首个具备完整多模态输入能力的 Qwen 模型,并配备了社区自 GPT-OSS 时代就期待的灵活思维控制功能:一位 Reddit 用户写道:"终于等到了!从 GPT-OSS 之后我一直在等其他本地模型原生支持低、中等推理!高水平用于规划,低水平用于执行和探索。"
💡 专业提示:Qwen3.8-27B 托管在 Hugging Face(Qwen/Qwen3.8-27B,9.47K 点赞,约 92K 月下载量,319 个量化变体)和 ModelScope。Qwen Cloud 上的托管版本即将上线,默认提供 1M 上下文并内置工具。
Qwen3.8-27B 架构与规格
以下是 Qwen3.8-27B 的核心配置:
混合架构结合了 Gated DeltaNet(用于低成本长上下文处理的线性注意力)与 Gated Attention 层,并配备多 token 预测(MTP)以加速解码。Qwen3.8-27B 默认开启思维模式,推理努力级别可在 xhigh(默认)、medium 和 low 之间调节,同时 preserve_thinking 能在多轮对话中保留推理上下文——官方模型卡称这一设计"提升了 KV 缓存利用率,优化了思维模式和非思维模式下的推理效率"。
对于超过 262K token 的超长任务,Qwen3.8-27B 推荐使用 YaRN RoPE 缩放,缩放因子为 4.0(若典型上下文约为 524K 则用 2.0)——在 vLLM、SGLang 和 TokenSpeed 中均支持。
✅ 最佳实践:在 Qwen3.8-27B 上执行 Agent 任务时,建议分配充足的输出长度:推理内容最多 262,144 token,最终回复最多 131,072 token。较低的推理努力级别并不总能减少任务总时间——分析不充分会导致更多重试。
Qwen3.8-27B 基准测试:Agent 能力的飞跃
Qwen3.8-27B 之所以在 r/LocalLLaMA 发布帖上引发"DeepSWE 的飞跃——我们有了新的本地编程冠军了吗?"这类评论,是因为它相比上一代实现了巨大的提升。以下是官方文本基准测试(标注 Claude Code harness 的项目):
DeepSWE 得分最为亮眼:Qwen3.8-27B 将前代得分提升了超过三倍(13.3 → 42.2),并在 SWE-bench Pro、QwenSWEBench、CoWorkBench 和 LiveCodeBench v6 上超越了 Opus 4.6 Max——尽管体积只是后者的一小部分。独立排行榜已与模型卡数据一致:datacurve 的 DeepSWE 排行榜列出 Qwen3.8-27B 为 42.2,ScaleAI 的 SWE-bench Pro 为 61.7。
Qwen3.8-27B 真正与其他本地模型拉开差距的地方是多模态 Agent:
Qwen3.8-27B 在 OSWorld、AndroidWorld、SWE-MM、MathVision、CharXiv、OmniDocBench、RealWorldQA 和 ERQA 上超越了 Opus 4.6 Max——计算机使用、移动端使用、文档智能和具身感知,全部集成在一个可运行于消费级 GPU 的模型中。
Qwen3.8-27B 定价与 API 接入
Qwen3.8-27B 已在 OpenRouter 上线,模型标识为 qwen/qwen3.8-27b:
早期生产流量说明了一切:Qwen3.8-27B 在 OpenRouter 上的热门应用依次是 Kilo Code(798 万 token)、Zed Editor(702 万)、pi(482 万)和 Hermes Agent(450 万)——全部是 Agent 编程工具。以 $0.45/$3.20 的价格,Qwen3.8-27B 比大多数前沿 API 便宜一个数量级,同时支持工具调用、结构化输出、图片和视频。
API 使用方面,Qwen3.8-27B 遵循标准 Qwen3.8 模式:默认开启思维模式(enable_thinking: True),推理努力级别支持 xhigh/medium/low,preserve_thinking 默认为 True。推荐采样参数:思维模式 temperature 1.0 / top_p 0.95;指令模式 0.7 / 0.8,presence_penalty 1.5。
⚠️ 注意:OpenRouter 目前通过单一提供商(AkashML)路由 Qwen3.8-27B,3 天内可用性为 79.65%,结构化输出错误率为 17.52%。如需生产级可靠性,建议等待 Qwen Cloud 托管版本或自托管。
本地运行 Qwen3.8-27B
这才是 Qwen3.8-27B 最亮眼之处——发布帖上最热的评论是"RTX 3090 用户们:启动!"社区反馈:
双 RTX 5080(总计 32GB):用户 n0head_r 运行了 unsloth Qwen38-27B-Q6_K GGUF,172K 上下文(kv q8_0),MTP + tensor-split,稳定约 100 tps,到 60–70K 上下文时降至约 95 tps(100K 时)。一个 150K token 的 Agent 循环——编写、构建、验证、修复错误——全程零工具调用失败完成。
RTX 4080 16GB:在 r/ollama 上,Qwen3.8-27B 以 12.6GB VRAM / 5.6GB CPU 运行 8K 上下文,完成了一个双工具 Agent 任务(数学求值 + 实时加密货币价格,两者均正确),耗时约 18 秒。
RTX 3090 24GB:预计是 Q4/Q6 量化的甜点区间,Q8_0 也有通过 unsloth 成功运行的报告。
Qwen3.8-27B 的部署选项:
Hugging Face Transformers — AutoModelForMultimodalLM.from_pretrained("Qwen/Qwen3.8-27B")
vLLM / SGLang / TokenSpeed — vllm serve "Qwen/Qwen3.8-27B" 用于 OpenAI 兼容服务
llama.cpp / Ollama / LM Studio — 通过 319 个社区量化变体(Q4_K_M、Q6_K、Q8_0 等)
Docker Model Runner — docker model run hf.co/Qwen/Qwen3.8-27B
✅ 最佳实践:若使用单张 16–24GB GPU,从 unsloth 下载 Q4 或 Q6 GGUF 量化版本;若拥有 32GB+ VRAM 或双卡,Q8_0 配合 tensor splitting 和 MTP 可实现最佳速度/质量平衡。
Qwen3.8-27B vs 竞品对比
Qwen3.8-27B 与被拿来比较的模型相比表现如何?
Reddit 的看法是:"以 270 亿参数,Qwen3.8-27B 非常接近 DeepSeek V4 Flash 0731(284B A13B)!"也有人指出"似乎比 900+B MoE 更好",并讨论 Qwen3.8-27B 是否能在 Agent 编程上超越 Minimax M2.7。目前的结论:Qwen3.8-27B 以极低的参数量提供了接近前沿的 Agent 和多模态性能,是 27B 级别以来最强的本地编程模型候选。
问:Qwen3.8-27B 是什么?
答:Qwen3.8-27B 是阿里巴巴 Qwen 的 270 亿参数稠密视觉语言模型,于 2026 年 8 月以 Apache 2.0 开源权重发布。支持图片和视频理解,具备灵活的思维控制能力,专注于编程、专业工作、科研和长周期 Agent 任务。
问:Qwen3.8-27B 的价格是多少?
答:在 OpenRouter 上,Qwen3.8-27B 每百万输入 token 收费 $0.45,每百万输出 token 收费 $3.20。Apache 2.0 协议下也可免费自托管,Qwen Cloud 托管版本(1M 上下文)即将上线。
问:Qwen3.8-27B 的上下文长度是多少?
答:Qwen3.8-27B 原生支持 262,144 token(262K),通过 YaRN RoPE 缩放可在 vLLM、SGLang 或 TokenSpeed 中扩展至 1,000,000 token。
问:Qwen3.8-27B 支持图片和视频吗?
答:支持。Qwen3.8-27B 是原生视觉语言模型,支持图片和视频输入——从 STEM 图表和文档到长达数小时的视频——并具备计算机使用和浏览器使用能力(OSWorld-Verified 84.3,WebArena-Verified 64.8)。
问:我能本地运行 Qwen3.8-27B 吗?
答:可以。Qwen3.8-27B 可运行于消费级 GPU:已报告的配置包括 RTX 3090 24GB、双 RTX 5080(Q6_K,172K 上下文约 100 tps)、RTX 4080 16GB(Ollama 占用 12.6GB VRAM)。共有 319 个量化变体可选。
问:Qwen3.8-27B 支持工具调用和结构化输出吗?
答:支持。Qwen3.8-27B 支持工具调用、JSON 输出和 OpenAI 兼容的 Chat Completions API,已在 Kilo Code、Zed、pi 和 Hermes Agent 等生产应用中通过 OpenRouter 使用。
问:Qwen3.8-27B 是开源的吗?
答:Qwen3.8-27B 采用 Apache 2.0 许可证——完全开源权重,允许商业使用。可在 Hugging Face(Qwen/Qwen3.8-27B)和 ModelScope 获取。
问:Qwen3.8-27B 何时发布?
答:Qwen3.8-27B 于 2026 年 8 月 14 日发布(权重同步上线 Hugging Face 和 ModelScope,OpenRouter 当日可用),紧随 Qwen 官宣 Qwen3.8-Max 之后。
问:Qwen3.8-27B 与 Qwen3.6-27B 相比如何?
答:Qwen3.8-27B 在 DeepSWE 上提升约 3 倍(13.3 → 42.2),Terminal Bench 提升约 10 分(63.4 → 73.0),SWE-bench Pro 提升 8.2 分,OSWorld 提升 20 分(63.9 → 84.3)——整整一代的进步。
总结与推荐行动
Qwen3.8-27B 是本地 AI 社区一直在等的模型:接近前沿的 Agent 性能——DeepSWE 42.2、SWE-bench Pro 61.7、OSWorld 84.3、LiveCodeBench v6 90.3——打包在 27B 稠密形态中,可运行于单张 24GB GPU,在多项基准测试上超越 Opus 4.6 Max,在 OpenRouter 上价格为 $0.45/$3.20 每百万 token。支持视觉(图片+视频)、灵活的思维控制、262K 原生上下文和 Apache 2.0 许可。
注意事项:基准测试数据在独立验证前均为 Qwen 官方数据,OpenRouter 上单一 AkashML 提供商可用性为 79.65%,结构化输出可靠性(17.52% 错误率)需持续关注。但正如一位评论者所言:"照这个速度,明年可能就不需要 AI 即服务公司了。"
尝试 API——在 OpenRouter 上用 Qwen3.8-27B 测试一个 Agent 编程任务,与你当前使用的模型对比。
下载 GGUF——从 unsloth 下载 Qwen3.8-27B 的 Q4/Q6_K 量化版本,今天就在本地 GPU 上试试。
关注 Qwen Cloud——内置 1M 上下文和工具的托管版 Qwen3.8-27B 即将上线,关注 Hugging Face 获取更新。
来源:Hugging Face 上的 Qwen3.8-27B · r/LocalLLaMA 发布帖 · OpenRouter 上的 Qwen3.8-27B · Qwen3.8-Max 博客 · r/ollama 基准测试 · Medium:2026 年最重要的本地 AI 发布