Qwen3.8 Max在Artificial Analysis智能指数中获得56分,比上一代提高10分,已追近Claude Opus 4.8。Kimi K3得分仍更高,价格则低25%,为模型选型提供了性能与成本对照。
Alibaba 的 Qwen3.8 Max 在 Artificial Analysis Intelligence Index 中获得 56 分,比 Qwen3.7 Max(46 分)高出 10 分。根据 Artificial Analysis 的数据,这一成绩与 Claude Opus 4.8 持平,领先于 GLM-5.2(51 分),但仍落后于 Kimi K3(57 分);而 Kimi K3 的运行成本还低了 25%。
在面向工作相关任务的基准测试 GDPval-AA 中,Qwen 的成绩跃升 468 个 Elo 分,达到 1,739 分,超过 Kimi K3(1,685 分)。只有 Claude Opus 5(1,852 分)的成绩更高。但问题在于它是如何取得这一成绩的。Qwen3.8 Max 完成每项任务需要 64 个步骤,而之前只需 14 个步骤;输入 token 数量也增长至原来的 15 倍,因为测试会在每一步都将完整的对话历史重新发送给模型。

该模型处理任务更加深入,但运行速度更慢,成本也更高。尽管 token 单价有所下降——每百万输入 token 的价格从 2.50 美元降至 2.00 美元,输出 token 从 7.50 美元降至 6.00 美元,缓存命中的价格从 0.50 美元降至 0.25 美元——Alibaba 的性价比依然受到影响。现在,Intelligence Index 中单项任务的成本为 1.14 美元,是 Qwen3.7 Max(0.53 美元)的两倍多。Kimi K3 的得分高出 1 分,但每项任务仅需 0.86 美元;GLM-5.2 则只需 0.57 美元。
与上一版本相比,它还出现了一些性能退步。AA-LCR 下降了 2 分,这项测试用于检验模型能否从超长文本中正确整合信息。AA-Omniscience 下降了 10 分,该测试衡量模型能否正确回答知识类问题,或者在不知道答案时如实承认。准确率仍维持在 31% 左右,但幻觉率从 23% 跃升至 40%。Qwen3.8 Max 更倾向于猜测,而不是坦承自己不知道。
订阅 THE DECODER,即可享受无广告阅读、每周 AI 新闻简报、每年六期独家前沿报告「AI Radar」、完整历史内容访问权限,以及评论区访问权限。