前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
返回 AI 情报前线
All News · 全部资讯4856
  • 推理模型延迟预算分析
  • 推理 Effort 档位实际控制什么
  • 推理模型性价比曲线:如何算清每分正确率成本
  • 为什么推理能力在数学好过代码好过文本
  • 通过所有测试的代码仍可能让AI代理崩溃
  • Cursor 修 IDOR 易漏同文件其他路由
  • 可信数据是AI Agent规模化的关键瓶颈
  • Anthropic为Agent引入梦境推理能力引热议
  • Python 中缓存 LLM 响应:细节决定成败
  • Harness Engineering:打造 AI 编程助手的工作环境
  • 加向量数据库前,先用 NumPy 搞定 Embedding
  • 自实现令牌桶限流:比等 429 更优
  • 长时 AI 任务用后台任务队列:状态机比框架重要
  • asyncio 并发调用 40 个 LLM:代码少但坑多
  • AI 项目中 API 密钥的泄密风险与防护层级
  • 电话Agent工程实践:SIP/WebRTC音频路径全解析
  • pgvector索引调优:HNSW与IVFFlat成本精确分析
  • 多租户应用按客户计费:成本与可计费用量必须分开
  • PDF 解析难点深度剖析:字符间距阈值是万恶之源
  • Hugging Face开源OlmoEarth文本嵌入
  • 阿里开源 Qwen3.8:2.4T MoE、激活 95B、256K 上下文
  • MiniMax H3:单个 Transformer 替代视频生成完整流水线
  • DeepSeek V4 Pro 正式版发布:多项测试接近 Fable 5 水平
  • Microsoft 发布 MindTopo:VLMs 空间推理能力新基准
  • Grok 4.6 发布:剑指 GPT-5.6 Sol,主打长时间 Agent 任务
  • Grok 4.6 中文详解:训练数据、Agent 能力边界与定价
  • 市场份额报告:Google Gemini 份额从 12% 跌至 1.9%
  • 用Embeddings+Reranking+LLM构建可靠的内容分类流水线
  • 推理冷启动从10分钟降至秒级:容器镜像瘦身实战
  • Anthropic研究揭示:Claude Code旧版权限提示97%被机械通过
  • DeepSeek-V4-Pro-0813 悄然上线,支持思考与非思考模式
  • AI 生图 Prompt 审核实战:Node.js 调用 Chat JSON Schema 方案
  • 企业AI分析的隐藏陷阱:语义漂移问题深度剖析
  • AI 正在消除软件工程中层:代码看不懂、没人负责的团队困境
  • Qwen3.8-2.4T-A95B 模型发布
  • TraceMotive:本地优先的AI代理执行追踪调试工具
  • AI编程工具正在离开IDE:终端原生Agent工作流崛起
  • 个人开发者用AI编程的项目架构经验
  • FastAPI五个安全漏洞发现与修复全过程
  • 长文档AI审核的审计设计:Map-Reduce优于检索增强
  • AI Agent辅助发现SharePoint RCE漏洞链(CVSS 9.1)
  • 我用Claude Code将API的P99延迟降低一半
  • AI Agent读了你的secrets并删了生产数据库——PocketOS事故详解
  • 用聊天模型做金融内容审核:结构化输出设计实践
  • Prompt注入攻击原理与防御实践指南
  • 大规模漏洞扫描活动泛滥,攻击者冒充ClaudeBot等AI爬虫
  • 谷歌DeepMind发布手语转文本模型SL2T
  • LFM2.5-VL-3B:边缘设备高性能视觉语言模型发布
  • 通义千问3.8-27B发布,刷新开源大模型参数效率
  • 多Agent协作陷阱:个体测试全过,团队输出仍错误
  • Agent Plugins:Vercel/OpenAI/Microsoft 等联合推出 Agent 技能打包新标准
  • 已加载 51 / 4856
9.0
重磅
AI SCORE
模型发布2026-08-13 00:10

阿里开源 Qwen3.8:2.4T MoE、激活 95B、256K 上下文

IT之家#阿里#大模型#MoE
Editor brief · 编辑速览

阿里开源 Qwen3.8-2.4T-A95B,2.4T 总参、激活 95B 的 MoE 大模型,原生 256K 上下文并可扩展至 1M,编程与 Agent 能力大幅提升,定价极具竞争力。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

8 月 13 日消息,阿里云“魔搭 ModelScope 社区”公众号昨天(12 日)深夜宣布,阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重。

此次是 Qwen-Max 级别的模型首次开源权重:模型总参数为 2.4T,每个 Token 激活 95B 参数,原生支持 262,144 Token 上下文,并可扩展至 1,010,000 Token。

Qwen3.8 延续 Qwen3.5 的混合架构,重点提升编程、办公、科研和长周期 Agent 任务的端到端完成能力。官方云端版 Qwen3.8-Max 基于该开放权重模型,并加入更多生产环境能力。

官方公布的评测覆盖编程 Agent、通用 Agent、专业工作和长上下文等方向;与 Opus 4.8、Fable 5、GPT 5.6 Sol 等模型相比,各项结果互有高低,并在 PaperBench、IFBench 等 Benchmark 中取得所列模型中的较高成绩。

文章配图

模型:https://modelscope.cn/models/Qwen/Qwen3.8-2.4T-A95B

blog:https://qwen.ai/blog?id=qwen3.8

Qwen Studio:https://chat.qwen.ai

Qwen3.8-2.4T-A95B 是一个因果语言模型,总参数为 2.4T,每个 Token 激活 95B。模型每个 MoE 层包含 512 个专家,每个 Token 选择 10 个路由专家,并同时激活 1 个共享专家。

模型还进行了多步 MTP(Multi-Token Prediction)训练,为支持相应机制的推理引擎提供预测多个后续 Token 的能力。

根据介绍,Qwen3.8-Max 的办公与 Agent 后训练概括为三个环节:

环节一:持续扩展真实环境,并在这些独立维度上解耦合

  • 任务(Task):单任务 → 多任务 → 跨天任务
  • 工作空间(Workspace):多文件 → 层级目录 → 复杂异构目录
  • Harness:不同的类别、版本、技能

这使得环境数能够以组合方式自然增长,而非依赖逐一定制化集成。

环节二:构建一个统一的奖励系统

将真实任务中异构的验证方式内化其中。该系统涵盖:

  • 基于执行的校验
  • 对文本及渲染后的视觉输出的 rubric 评估
  • agentic 检查

将多种形式与模态统一在一个奖励系统内,为所有环境提供了一致而可靠的奖励信号,消除维护任务专用的 verifier 所固有的不一致性。

环节三:构建一个在线数据均衡器

对每个 batch 进行重构,使其在任务、难度、工作区与 harness 上的分布高度均衡,降低 batch 间梯度方差,从而支撑强化学习的训练算力稳定、持续地扩展。

广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家包含外链的文章均包含本声明。

软媒旗下网站:IT之家 最会买 - 返利返现优惠券 iPhone之家 Win7之家 Win10之家 Win11之家

软媒旗下软件:软媒手机APP应用 魔方 最会买 要知

Original source

本文由 AI 翻译整理自 IT之家,原文版权归原作者所有。

阅读英文原文
上一篇
Hugging Face开源OlmoEarth文本嵌入
下一篇
MiniMax H3:单个 Transformer 替代视频生成完整流水线