阿里开源Qwen3.8,24万亿参数模型,承诺在个人电脑上达到Opus 4.6级别性能,主打本地和Agent应用场景。
很高兴你来到这里。你可以期待所有优质的 TNS 内容将在周一至周五送达,让你紧跟新闻动态、保持领先位置。
请查收收件箱中的确认邮件,你可以调整偏好设置,甚至加入其他社群组。
在你喜欢的社交媒体平台上关注 TNS。
在 LinkedIn 上成为 TNS 关注者。
在等待第一封 TNS Newsletter 时,看看最新的精选和热门文章。
阿里巴巴近日开源了其 2.4 万亿参数 Qwen3.8 模型的权重。这是一个规模庞大的模型,其基准测试成绩让它直接对标美国实验室的闭源前沿模型。但或许更值得关注的是,阿里巴巴在上周五还以 Apache 2.0 许可证发布了 Qwen 3.8 的 270 亿参数稠密版本。
例如,这款模型你可以在配置较高的 MacBook Pro 或 Mac Studio 上本地运行——而且可能值得这样做,因为根据阿里巴巴的基准测试,该模型的性能与 Anthropic 的 Opus 4.6 在 Max 模式下运行处于同一水平。
在相当多的基准测试中,它甚至超越了 Anthropic 的前旗舰模型——该模型在 2 月发布时是六个月前的最先进的水平,尤其在某些计算机使用、编程和知识工作测试中表现更佳。
再加上该模型还具备视觉能力——包括视频——这使其成为本地使用的诱人选择(假设你有支持它的硬件)。
一如既往,需要注意的是,基准测试并不总是能衡量模型在现实世界中的表现,对于 Agent 用途来说,运行的工具链可能和模型本身一样重要。例如,早期报告表明该模型倾向于过度思考。
同时,看起来阿里巴巴的基准测试描述的是原始检查点,而非大多数本地用户会运行的量化版本。量化虽然可以让模型在消费级硬件上变得实用,但总是存在质量权衡。
不过总的来说,对于一款可以本地运行的模型来说,这些结果令人印象深刻。

阿里巴巴指出,该模型在编程和知识工作任务上显著超越上一代 Qwen 3.7-Plus,一些性能提升相当惊人,包括在 DeepSWE Agent 编程基准上从 14.2 分跃升至 42.2 分。

阿里巴巴还将该模型与 Meta 的 Muse Glimmer-30B 进行了比较,后者是近期发布的同量级本地模型。Qwen3.8-27B 在阿里巴巴同时报告成绩的每一项测试中都领先。
看起来,Glimmer 这个名字取得很贴切。
当然,速度是另一个问题。截至目前,阿里巴巴尚未发布更小的 Qwen3.8 27B 混合专家版本兄弟模型。这类模型可以为每个 token 激活更少的参数,运行速度比 27B 稠密版本更快。例如,阿里巴巴此前为 Qwen 3.6-35B 模型做过这样的优化。
未量化的 Qwen3.8-27B 仓库大小为 55.6GB,这还不包括推理运行时和上下文缓存。大多数人不会运行这个版本。
对 Mac 用户来说的好消息是,社区已经为 Apple Silicon 创建了 MLX 转换版本。4-bit 版本约为 16.1GB,而 8-bit 版本为 29.5GB。这使得配备 32GB 统一内存的 Mac 成为以适度上下文长度运行 4-bit 版本的一个合理平台。如果你有 48GB 或 64GB 内存,显然可以为更高精度或更长提示提供更多空间。
该模型默认支持 262,000 个 token 的上下文,通过使用 YaRN 方法可以扩展到 100 万 token(阿里巴巴将为其托管的生产版本这样做)。但这并不意味着你可以在桌面上使用完整的上下文窗口(随着提示增长,键值缓存会消耗更多内存)。