阿里发布 Qwen 3.8 系列模型,在编程能力和推理性能上实现升级,特别面向 AI 编程工具和代码辅助场景优化。
阿里巴巴正式发布新一代基座大模型 Qwen3.8,整体性能处于全球大模型第一梯队。Qwen3.8-Max 预计下周开源,同时还将开源 Qwen3.8-27B。
8 月 3 日,阿里巴巴正式发布新一代基座大模型 Qwen3.8,总参数量达 2.4 万亿,在编程(Coding)和专业办公(Cowork)方面的能力大幅提升。在今日公布的权威第三方榜单 Arena 中,阿里 Qwen 模型仅次于 Anthropic 的 Claude 系列,整体性能处于全球大模型第一梯队。目前,Qwen3.8 的 API 已上线千问 AI 平台,并接入阿里今日同步推出的 Agent 产品“千问办公”。Qwen3.8-Max 预计下周开源,同时还将开源 Qwen3.8-27B。
今日起,全球开发者均可通过千问 AI 平台获得 Qwen3.8 的 API 服务。国内价格为每百万 Tokens 输入 12 元、输出 36 元,隐式缓存命中仅需 1.5 元;输入与输出的国际价格则分别仅为 Opus 5 的 40% 和 24%,以更高性价比实现相近的智能水平。
图说:权威第三方榜单 Arena 全球排行榜更新
此次发布的是千问大模型系列中尺寸最大、性能最强的旗舰模型 Qwen3.8-Max。它支持视觉理解,上下文长度达到 1M Tokens。在模型架构方面,Qwen3.8 通过稀疏 MoE 架构与混合注意力机制的联合优化,首次将千问大模型的总参数量扩展至 2.4T,激活参数量为 95B,从而获得更高的推理效率和更快的推理速度,整体性能也迎来新的突破:在科研复现评测 PaperBench 等编程智能体评测中,Qwen3.8-Max 较上一代模型大幅提升 28.2 分,以 93.0 分创下评测新高;在 WideSearch、Agent’s Last Exam 等通用智能体评测中,新模型分别取得 81.9 分和 52.4 分,位居前沿。同时,Qwen3.8 在指令遵循 IF Bench 评测中取得 82.8 分,在科学推理 GPQA Diamond 中取得 92.6 分,多项通用能力均位居前列;在视觉推理 BabyVision 评测中,Qwen3.8-Max 在不使用工具的条件下取得 82.0 分,接近部分主流模型得分的两倍;在评估智能体电脑操作能力的 OSWorld-Verified 评测中,Qwen3.8-Max 以 86.1 分位居主流模型首位。
编程能力(Coding)是前沿大模型的核心能力之一,Qwen3.8 在自主编程方面实现了新的突破。在权威 CodeArena 榜单中,Qwen3.8 位居全球第四。两年前的前沿模型能够写好函数、补全代码,成为程序员的得力助手;如今,Qwen3.8 可以从一个空文件夹出发,自主完成一个需要十余天的真实项目交付,全程无须人工干预。只需一句“创建一个自进化的智能体 Harness”,Qwen3.8 就能像资深工程师一样,从零开始自主搭建循环工程(Loop Engineering)框架,编排智能体自动领取并执行任务,人类工程师还可以通过钉钉向 Qwen3.8 提出新的要求。Qwen3.8 独立编程运行约 16 天后,打造出了一个达到 Hermes Agent 水平、真实可用的自进化智能体框架“oh-my-cli”。目前,该项目已经完全开源,完整过程公开保存在 GitHub 仓库中,可供所有人查看。
Qwen3.8 可以胜任广泛而真实的专业工作任务(Cowork)。面对截然不同的专业任务、评判标准和计算需求,Qwen3.8 通过真实环境与算力联合强化学习(RL)扩展,提升了其在数百种高价值、高频专业任务中的实际表现,并能在主流智能体框架中稳定、可靠地交付生产级成果:一支法务助理团队在数百份法律文档中标注一千多个相关条款,通常需要一周时间,Qwen3.8 在一小时内就能完成;一个篮球数据分析团队需要逐帧标注 160 多个小时的比赛录像,Qwen3.8 仅用数十分钟便可精准拆解其中 8400 多个攻防回合,并一次性输出球员战术画像和教练报告;一个金融研究团队需要依靠多年积累的专业知识,全面、实时地搜集资本市场变化,才能依次完成量化策略研究,而 Qwen3.8 可以自主调动多个并行智能体,连续工作数小时后交付完整的 ETF 轮动策略,并持续进行分析回测、动态修正,最终实现规模化盈利。
在长周期任务中,Qwen3.8 涌现出了系统级自主规划与全栈闭环自适应学习能力。无论面对高精密、强物理约束的数字芯片设计,还是高度动态、博弈激烈的商业模拟运营,Qwen3.8 都能通过“执行—反馈—迭代”的自适应闭环,在数千轮超长程交互中实现算法与策略的深度重构。
除了强大的文本和推理能力,Qwen3.8 还进一步提高了 AI 视觉理解能力的上限。在权威 Vision Arena 榜单中,Qwen3.8-Max 位列全球第二。Qwen3.8 不仅能读懂 200 页的财报 PDF、理解超过 100 小时的长视频,还能将“看到”的知识与信息反馈至完整工作流程,帮助模型进行更周全的思考。在千问团队构建的“应用复刻”基准 RecreationBench 长程任务中,模型既没有源代码,也无法联网,仅通过交互和反馈理解应用,却能够从零复刻出整个应用。这表明,Qwen3.8 已展现出前沿水平的混合多模态智能体能力,通过“迭代编程—交互反馈”的反复循环,将视觉编程(Visual Coding)推向新的高度。
据了解,阿里真武 M890 超节点也已成功适配 Qwen3.8。通过芯片、云平台与千问大模型的全链路优化,其推理效率得到显著提升,推理成本进一步降低,在 Agentic 推理场景中最多可实现 1.5 倍的性能提升。
本文由阿里巴巴提供,量子位获授权转载,观点归原作者所有。
阿里“千问办公”开启公测 2026-08-03
学习强国做了个 AI 社区,两周铺进 68 座城市 2026-07-31
中科院院士对话北电数智 AI 专家:以 AI 与数学“乘法效应”开辟产业落地新路径 2026-07-29
OceanBase 回应融资报道:全力投入 AI 数据创新,与资本市场保持开放沟通 2026-07-29
量子位 QbitAI 版权所有 © 北京极客伙伴科技有限公司 京 ICP 备 17005886 号-1