前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8485
  • 为生产级 Agent 阻断静默故障级联
  • 腾讯HPC-Ops联手SGLang开源高性能MoE内核
  • Anthropic 公布 Fable 5 生物安全保障机制
  • 树莓派5本地部署AI模型实战
  • 补齐Agent从决策到执行的基础设施
  • 用确定性验证约束大模型推理
  • 有记忆的智能体如何定义可复现性
  • 给AI功能建立依赖契约清单
  • 修复AnythingLLM俄文检索偏差
  • RAG 何时应采用语义分块
  • AI Agent 安全沙箱工程指南
  • 多Agent并行开发的Worktree陷阱
  • 40 行实现类型安全的工具调用
  • RAG 排序不能只靠余弦相似度
  • 生产级 Prompt 的七类隐蔽问题
  • 让 RAG 拒绝使用劣质上下文
  • TypeScript Agent 的四层注入防线
  • 用 LangGraph.js 实现持久化人工审批
  • Node应用如何精确核算LLM成本
  • Token防火墙削减35%上下文成本
  • Qwen3.8 Max性能追近Opus
  • 伪造审查备注绕过AI反诈检测
  • 用 MCP 为纯文本编程智能体补上视觉
  • Cloudflare推出网站智能体就绪度指标
  • Cloudflare构建开放智能体互联网协议
  • Cloudflare推出私有数据AI搜索
  • 一键为现有网站接入WebMCP
  • Kitesurf:运行在Workers上的智能体浏览器
  • 新版MCP转向无状态架构
  • 让过期的 Agent 上下文直接阻断 CI
  • 昇腾适配 Ling-3.0 并推出 PyPTO
  • 让编程 Agent 用你熟悉的语言写脚本
  • 数据库索引提速背后的写入代价
  • Meta低价模型与可恢复编程Agent登场
  • 如何构建 Agent 难以作弊的评测
  • Claude Code 迁移 OpenCode 踩坑实录
  • RAG向量数据库的真实成本陷阱
  • 编码代理缺失的其实是产品定义
  • 用熔断机制约束失控的 AI Agent
  • 别让 AI 任务止步于聊天记录
  • 人类审核仍漏掉三分之一智能体威胁
  • OpenAI智能体曾秘密协同攻击
  • AI 工作流为何会在无改动时失效
  • 开源本地化求职管理平台 FitPilot
  • 在一次性沙箱中测试编程 Agent 越界
  • 别把系统提示词写成规则仓库
  • Agent 审批卡的盲签名陷阱
  • 为真实项目编写AGENTS.md的经验
  • 用固定语料阻止AI审查能力回退
  • 为AI代码变更建立分阶段权限门禁
  • 别让LLM评测工具测到自身拥塞
  • 已加载 51 / 8485
8.0
热点
AI SCORE
模型发布2026-08-06 21:31

Qwen3.8 Max性能追近Opus

The Decoder#Qwen#Kimi#模型评测
Editor brief · 编辑速览

Qwen3.8 Max在Artificial Analysis智能指数中获得56分,比上一代提高10分,已追近Claude Opus 4.8。Kimi K3得分仍更高,价格则低25%,为模型选型提供了性能与成本对照。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Alibaba 的 Qwen3.8 Max 在 Artificial Analysis Intelligence Index 中获得 56 分,比 Qwen3.7 Max(46 分)高出 10 分。根据 Artificial Analysis 的数据,这一成绩与 Claude Opus 4.8 持平,领先于 GLM-5.2(51 分),但仍落后于 Kimi K3(57 分);而 Kimi K3 的运行成本还低了 25%。

在面向工作相关任务的基准测试 GDPval-AA 中,Qwen 的成绩跃升 468 个 Elo 分,达到 1,739 分,超过 Kimi K3(1,685 分)。只有 Claude Opus 5(1,852 分)的成绩更高。但问题在于它是如何取得这一成绩的。Qwen3.8 Max 完成每项任务需要 64 个步骤,而之前只需 14 个步骤;输入 token 数量也增长至原来的 15 倍,因为测试会在每一步都将完整的对话历史重新发送给模型。

Image: AA

该模型处理任务更加深入,但运行速度更慢,成本也更高。尽管 token 单价有所下降——每百万输入 token 的价格从 2.50 美元降至 2.00 美元,输出 token 从 7.50 美元降至 6.00 美元,缓存命中的价格从 0.50 美元降至 0.25 美元——Alibaba 的性价比依然受到影响。现在,Intelligence Index 中单项任务的成本为 1.14 美元,是 Qwen3.7 Max(0.53 美元)的两倍多。Kimi K3 的得分高出 1 分,但每项任务仅需 0.86 美元;GLM-5.2 则只需 0.57 美元。

与上一版本相比,它还出现了一些性能退步。AA-LCR 下降了 2 分,这项测试用于检验模型能否从超长文本中正确整合信息。AA-Omniscience 下降了 10 分,该测试衡量模型能否正确回答知识类问题,或者在不知道答案时如实承认。准确率仍维持在 31% 左右,但幻觉率从 23% 跃升至 40%。Qwen3.8 Max 更倾向于猜测,而不是坦承自己不知道。

没有炒作的 AI 新闻——由人类精心筛选

订阅 THE DECODER,即可享受无广告阅读、每周 AI 新闻简报、每年六期独家前沿报告「AI Radar」、完整历史内容访问权限,以及评论区访问权限。

Original source

本文由 AI 翻译整理自 The Decoder,原文版权归原作者所有。

阅读英文原文
上一篇
Token防火墙削减35%上下文成本
下一篇
伪造审查备注绕过AI反诈检测