Qwen3.8 Max在涵盖推理、编码、工具调用和任务执行的智能体综合评测中超过多款闭源模型。该结果为开发者评估开放权重模型提供了新依据,但仍需结合实际业务验证。
AI 排行榜刚刚经历了一场巨震。阿里巴巴最新的开放权重模型 Qwen3.8 Max,在 Artificial Analysis Agentic Index 中被评为综合表现最佳的模型——击败了 OpenAI 的 GPT-5.6 Sol、Anthropic 的 Claude Opus 4.5,以及 Google 的 Gemini Ultra 2。
这不只是在 benchmark 上胜出。这是开放源码模型首次登顶一项综合性的 Agent 智能指数。该指数衡量的是真实世界中的任务表现,而不仅仅是测试分数。
Artificial Analysis Agentic Index 是一项独立 benchmark,用于评估 AI 模型完成 Agent 任务的能力,包括多步推理、工具使用、代码生成和解决现实问题。传统 benchmark(如 MMLU、HumanEval)测试的是静态知识,而 Agentic Index 衡量的是模型能否真正把事情做成。
该指数从多个维度评估模型:
智能指数(Intelligence Index):综合衡量推理、编程、数学和指令遵循能力
速度(Speed):生产负载下每秒输出的 token 数量
成本(Cost):每项智能任务的加权平均成本
端点准确性(Endpoint Accuracy):服务提供商的 endpoint 是否能达到参考模型的质量
Qwen3.8 Max 是阿里巴巴迄今能力最强的模型:
参数量:240B(MoE 架构,推理时约激活 35B 参数)
上下文:原生支持 256K token,可扩展至 1M
训练数据:数据截止时间为 2025 年 11 月
许可:开放权重,可用于研究和商业用途(受限制司法管辖区内的用户需遵守相关限制)
Qwen3.8 Max 值得关注的不只是原始智能水平,还在于它同时具备出色的性能、有竞争力的价格和速度。该模型的智能得分接近榜首,同时每项任务的成本远低于高端替代模型。
过去两年里,开放源码模型(Llama、Qwen、Mistral)与闭源前沿模型(GPT、Claude、Gemini)之间的差距一直在缓慢缩小。Qwen3.8 Max 现在彻底弥合了这一差距,甚至可以说实现了反超。如果你正在开发 AI 应用,就不必再默认“前沿模型”等同于“闭源模型”。
Agentic Index 的单任务成本指标显示,Qwen3.8 Max 能以 GPT-5.6 或 Claude Opus 4.5 一小部分的成本,提供顶级智能水平。对于运行生产级 AI 工作负载的开发者,这可能意味着:
Agent 任务成本降低 3~5 倍
开放权重版本具备自行托管的可行性——前提是你拥有相应的 GPU 基础设施
降低供应商锁定风险——不必依赖单一 API 提供商
该指数表明,针对聊天场景优化的模型(例如默认模式下的 GPT-5.6),在 Agent 任务上的表现未必最好。出色的 Agent 表现需要:
多步规划:将复杂任务拆解为多个子任务
工具选择:为每个子任务选择合适的工具
错误恢复:发现失败并作出调整
上下文管理:在漫长的任务链中持续追踪状态
Qwen3.8 Max 专门针对 Agent 工作负载进行了训练,实际表现也证明了这一点。
如果你正在构建 AI Agent 或 Agent 应用:
重新评估你的模型选择。如果你正在使用 GPT-5.6 或 Claude 处理 Agent 任务,请用 Qwen3.8 Max 做一次对比测试。由此节省的成本可能相当可观。
重新评估你的模型选择。如果你正在使用 GPT-5.6 或 Claude 处理 Agent 任务,请用 Qwen3.8 Max 做一次对比测试。由此节省的成本可能相当可观。
考虑开放权重版本。如果你拥有 GPU 基础设施,或者使用 Together AI、Fireworks AI、vLLM 等服务或工具,就可以运行 Qwen3.8 Max,并完全掌控自己的数据。
考虑开放权重版本。如果你拥有 GPU 基础设施,或者使用 Together AI、Fireworks AI、vLLM 等服务或工具,就可以运行 Qwen3.8 Max,并完全掌控自己的数据。
关注 endpoint 准确性差距。该指数指出,并非所有服务提供商交付的模型质量都相同。如果你使用第三方 API,请确认其 endpoint 准确性与参考 benchmark 一致。
关注 endpoint 准确性差距。该指数指出,并非所有服务提供商交付的模型质量都相同。如果你使用第三方 API,请确认其 endpoint 准确性与参考 benchmark 一致。
不要丢弃备用模型。该指数会频繁更新,今天登顶排行榜的模型,下周就可能被取代。你的系统架构应当保持模型无关性。
不要丢弃备用模型。该指数会频繁更新,今天登顶排行榜的模型,下周就可能被取代。你的系统架构应当保持模型无关性。
Qwen3.8 Max 登顶 Agentic Index,标志着 AI 格局正在发生根本性转变。前沿水平不再由谁拥有最多算力来定义,而是取决于谁能最有效地针对 Agent 和真实世界表现进行训练。
对开放源码社区来说,这是一次有力的证明。“开放源码永远会落后六个月”的说法,或许已经不再成立。对开发者而言,这意味着更多选择、更低成本,以及更少地依赖任何一家供应商。
接下来的几个月将告诉我们,Qwen3.8 Max 能否守住王座,还是 OpenAI、Anthropic 或 Google 的下一款模型会重新夺回榜首。但有一点可以确定:Agent 能力的霸主之争,如今已经全面开放。
Artificial Analysis Agentic Index 会定期更新。最新排名可前往 artificialanalysis.ai 查看。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。