前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9467
  • tester-army/e2e:用自然语言描述目标的下一代 E2E 测试框架
  • AI Agent 为何演示惊艳、上线就崩
  • 2026 AI Agent 云端基础设施选型完全指南
  • 训练而非编写:Agent Skill 的数据驱动优化实践
  • RAG检索碎片化才是AI文档问答出错的根本原因
  • 高通获得华为逻辑折叠芯片专利许可,验证华为制造能力
  • YC CEO Garry Tan 开源 23 工具 AI 开发栈
  • pstack 转译版:Cursor 规范流向 Claude/Codex/Pi
  • LLM Agent 的「侦察惰性」:知道怎么修却反复扫描
  • AI 编程工具为何忘记团队决策:跨工具上下文共享方案
  • 英国NCSC发布AI Agent安全控制七项建议
  • 传统防火墙无法检测提示词攻击:LLM安全需重新设计
  • 用x402协议让AI Agent无账户付款:实战构建日志
  • 开源智能客服机器人:知道何时转人工
  • Hinton发表首篇RSI论文,AI造AI进入流水线
  • Harness决定AI Agent能力:同模型不同表现
  • Claude Code权限绕过:Read拒绝后Bash仍可读取
  • 生产级Agent系统实战:LLM路由、Prompt合约与PR安全审查
  • LCLM:16倍压缩的潜在上下文语言模型
  • Claude Code mods解析:何时需要构建插件
  • 通义千问三年发展史:从7B参数到2.4万亿
  • Linus确认Linux内核进入「AI新常态」
  • 如何验证Agent实际完成了它声称的任务
  • Claude Code /compact 后哪些内容真正存活
  • 开源安全模型 apex-flash-1:60 个遗留 Bug 任务解出 40 个
  • yOGI Neural Grid:强制验证模型引用来源的工程实现
  • AI推理将成为软件行业最大市场
  • 美团开源LongCat-Video:13.6B参数统一视频生成模型
  • Agent技能需要包管理器而非仅靠Prompt
  • n8n AI Agent 生产环境失败根因与修复方案
  • 565 行 Python 从零实现编程智能体
  • 四大前沿模型横向评测:Astra擅计算机使用、Argon强法律金融、Sol价格最优
  • 本地RAG开发113个评估问题后的实战总结
  • AI重写让我重新审视运行时成本:Node.js转Go/Rust的算账
  • MCP工具超90个时的平台化架构设计
  • Homa:专为AI集群设计的TCP替代网络协议栈
  • 我为编码Agent的测试篡改问题做了个AdversaryGate
  • SaaS支持文档检索应选语义嵌入而非关键词
  • AI 审核员知道太多会变差:验证者应不知情
  • 长文档JSON提取超时?先做好输入分片而非调大timeout
  • PostgreSQL pgvector混合搜索实战:向量相似度+全文关键词融合
  • 新版Claude不再需要"Think Step by Step":Osmani提示指南解读
  • CodeSmith三区架构:解决prefix drift导致Token重计费问题
  • 像读流水线一样读Transformer Block
  • Cloudflare OS:面向 AI 原生的企业工作台开源
  • AI 编程工具正在泄露凭据:Cursor、Claude Code、Copilot 和 MCP 均有风险
  • prompt-shelf:在 Claude Code 里暂存草稿、临时想法和常用 prompt
  • Agenshive:AI agent 专属 Q&A 平台,用执行验证替代投票
  • 评审容量已成交付新瓶颈:打字快不等于交付快
  • AI Agent 让 CI 成为瓶颈,加速流水线是错误解法
  • 程序员自建家用LLM集群的完整踩坑历程
  • 已加载 51 / 9467
8.0
热点
AI SCORE
模型发布2026-10-05 12:10

通义千问三年发展史:从7B参数到2.4万亿

MarkTechPost#通义千问#开源模型#大模型发展史
Editor brief · 编辑速览

Alibaba Qwen从2023年4月邀请制聊天机器人发展至2026年8月2.4万亿参数开源模型,完整记录每次发布与许可证变更。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

人工智能

视觉语言模型

2023年4月,阿里云演示了一个聊天机器人,其名字大致意为"千问之真"。三年半后,其后续产品以2.4万亿参数开放权重发布。这就是通义千问一路走来的故事,逐个版本讲述。

第一章 — 2023:千问之源

阿里在ChatGPT发布后迅速跟进。2023年4月7日,阿里云开始向企业客户发放名为"通义千问"的模型的邀请码。这个名字部分取自哲学家孟子。

四天后的北京阿里云峰会上,时任CEO张勇公开展示了该模型。阿里表示将把该模型整合到各项业务中,首先从钉钉和天猫精灵语音助手开始(中国日报)。

真正的转折出现在8月。2023年8月3日,阿里开源了Qwen-7B和Qwen-7B-Chat,直接对标Meta的Llama 2。Qwen-7B在超过2.2万亿token上预训练,上下文长度为2,048 token。其许可协议对月活用户低于1亿的商业使用免费。

几周后视觉版本也问世了。Qwen-VL作为第一个视觉语言分支,于2023年8月底发布。

2023年9月13日,通义千问向公众开放,标志着中国监管部门的批准。同月,团队在arXiv上发表了Qwen技术报告。

这一年以规模收尾。阿里在2023年12月1日左右发布了72B和1.8B模型供下载。Qwen现已覆盖从笔记本大小到前沿规模的开放权重模型。

第二章 — 2024:开放权重引擎

2024年,Qwen成为开发者的默认选择。团队在8个月内发布了3代模型。

Qwen1.5(2月):2024年2月5日,团队发布Qwen1.5,定位为Qwen2的beta版本。它涵盖从0.5B到72B的稠密模型,每个规模都稳定支持32K上下文。随后推出了14B MoE(激活参数2.7B)以及110B稠密模型,这是该系列首次突破100B参数。

Qwen2(6月):团队于2024年6月初宣布Qwen2,发布5个规模版本(0.5B到72B)。其中包括Qwen2-57B-A14B,这是其首个开放的混合专家旗舰模型。训练数据新增了27种英语和中文以外的语言。7B和72B的instruct模型最多支持128K token。许可变更影响最大:除72B外,所有规模版本都迁移至Apache 2.0。

专家模型在夏季陆续推出。Qwen2-Math于8月发布,Qwen2-Audio同期推出。Qwen2-VL于8月底跟进,能够分析超过20分钟的视频。

Qwen2.5(9月):2024年9月19日的云栖大会上,阿里一口气发布了超过100个开源模型。Qwen2.5技术报告显示,预训练数据从7万亿token增长到18万亿token。规模从0.5B到72B,128K上下文和8K token生成能力。

实际应用已经落地。阿里表示Qwen模型的下载量已突破4000万次,并在Hugging Face上催生了超过50,000个衍生模型。

编程与推理(11-12月):Qwen2.5-Coder于2024年11月11日发布完整系列。随后推出首个推理模型。QwQ-32B-Preview于11月底以Apache 2.0许可发布,作为OpenAI o1的开源挑战者。实验性视觉推理模型QVQ-72B-Preview于12月24日收官这一年。

第三章 — 2025年初:回应DeepSeek

2025年1月属于DeepSeek-R1。Qwen在数周内就给出了回应,而不是数月。

1月26日,团队发布了3B、7B和72B规模的Qwen2.5-VL。TechCrunch指出它可以控制PC和手机。三天后的农历新年初一,阿里推出了大规模MoE模型Qwen2.5-Max。路透社报道阿里声称它超越了DeepSeek-V3。

更大的声明出现在3月6日。QwQ-32B基于Qwen2.5-32B并通过强化学习训练,以Apache 2.0许可发布。Qwen声称其性能可与671B的DeepSeek-R1相媲美。VentureBeat指出硬件差距约为24 GB VRAM对比超过1,500 GB。当天阿里香港股价上涨超过7%。

多模态能力紧随其后。Qwen2.5-Omni-7B于3月26日以Apache 2.0许可发布。它接受文本、图像、音频和视频作为输入,并以文本或语音回答。CNBC将其定位为面向成本效益型AI Agent的模型。

第四章 — 2025:Qwen3与万亿参数线

Qwen3(4月):2025年4月29日(北京时间),团队发布Qwen3:6个从0.6B到32B的稠密模型和2个MoE模型。旗舰模型是Qwen3-235B-A22B,激活参数为22B。所有模型均以Apache 2.0许可发布。

核心特性是混合思考。一个模型可以逐步推理或即时回答,由用户切换。Qwen3技术报告显示预训练约36万亿token。语言覆盖从29种跃升至119种语言和方言。TechCrunch称之为"混合"推理模型系列。

2507更新(7月):2025年7月21日,Qwen将混合思考重新分离。Qwen3-235B-A22B-Instruct-2507作为非思考模型发布,原生上下文为262K。独立的Thinking-2507检查点随后推出(Hugging Face集合)。

Agent与图像(7-8月):Qwen3-Coder-480B-A35B于2025年7月22日发布,用于Agent编程。阿里将其与Qwen Code配对,这是一个开源终端编程Agent(Computerworld)。8月4日,团队开源了Qwen-Image,这是一个20B的MMDiT模型,专为图像内文本渲染构建。

编辑变体Qwen-Image-Edit于2025年8月18日开源。

9月冲刺:首个超过1万亿参数的Qwen模型Qwen3-Max-Preview于9月5日出现。与过去的旗舰不同,它仅提供API调用。

几天后推出了Qwen3-Next-80B-A3B,这是一次架构赌注。它以3:1的比例混合了Gated DeltaNet线性注意力和门控注意力。模型卡片声称训练成本仅为Qwen3-32B的10%,在超过32K token时推理吞吐量提升10倍。

9月22日,Qwen3-Omni和Qwen3-VL跟进。9月24日的云栖大会上,阿里正式发布Qwen3-Max。CEO吴泳铭表示支出将超过3800亿元人民币(530亿美元)的三年AI和云计划。

到年底,Qwen已成为其他模型的国家基础设施。2025年11月,AI Singapore表示其Sea-Lion模型将从Llama切换到Qwen作为基座。

Qwen也成为一个消费者品牌。Qwen App于2025年11月17日进入公开测试。阿里表示它在一周内突破了1000万次下载。

第五章 — 2026:6个月4代

快速起步(1-2月):2026年1月26日,Qwen发布Qwen3-Max-Thinking,一个闭源推理模型。Qwen表示它在19个基准测试中可与GPT-5.2-Thinking、Claude Opus 4.5和Gemini 3 Pro相媲美(TestingCatalog)。Qwen3-Coder-Next(一个用于Agent编程的小型混合模型)于2月2日跟进。Qwen-Image-2.0于2月10日将生成和编辑合并为一个模型。

Qwen3.5(2月):2026年2月16日(农历除夕),阿里为所称的Agent AI时代推出了Qwen3.5。开源的Qwen3.5-397B-A17B激活397B中的17B参数。它运行在Qwen3-Next预览的混合线性注意力设计上。托管的Qwen3.5-Plus增加了1M token上下文。

中等系列于2月24日跟进。Qwen表示其Qwen3.5-35B-A3B击败了更早的Qwen3-235B-A22B-2507。小型端侧模型于3月2日推出。

领导层变动(3月):3月3日,技术负责人林俊仰发帖表示将离职。路透社报道他是2026年离开的第三位Qwen高管。后训练负责人于博文也离职了,编程负责人惠斌元已于1月加入Meta(第一财经)。

据36氪报道,触发因素是将Qwen拆分为横向预训练、后训练和模态团队的计划。3月16日,阿里将其AI部门置于CEO吴泳铭领导的新集团下。彼时,阿里已发布超过400个开源Qwen模型,下载量超过10亿次。

Qwen3.6(4月):节奏没有放缓。Qwen3.6-Plus于4月2日作为专有托管模型推出。这符合更广泛的转变:南华早报报道中国AI巨头转向专有模型以获取收入。开源侧持续推进。Qwen3.6-35B-A3B于4月16日以Apache 2.0许可发布,瞄准Agent编程。

一周内又有两个发布。闭源旗舰预览版Qwen3.6-Max-Preview于4月20日到来。4月22日,稠密模型Qwen3.6-27B以Apache 2.0许可发布。Qwen表示它在主要编程基准测试中击败了Qwen3.5-397B-A17B。

Qwen3.7(5-6月):5月20日的阿里云峰会上,阿里发布了为长期Agent任务构建的Qwen3.7-Max。阿里表示Artificial Analysis将其全球排名第五、中国模型第一。Qwen3.7-Plus于6月初以每百万token 0.4/1.6美元跟进。两者均保持闭源。

7月,CNBC报道Qwen将被整合进中国的Apple Intelligence。

Qwen3.8(7-8月):彭博社于7月19日报道了新旗舰的预览。托管的Qwen3.8-Max于8月初发布。8月12日,阿里将其基座开源为Qwen3.8-2.4T-A95B:2.4万亿参数,950亿激活(Gigazine)。

许可有了新的附加条件。12个月内收入超过5000万美元的提供商需要商业许可。两天后,Qwen3.8-27B以纯Apache 2.0许可发布。8月26日,路透社报道了Qwen3.8-Flash。其开源兄弟Qwen3.8-Flash-Next被定位为Qwen4架构的早期预览。

9月:9月20日,Qwen-Image-2.1作为7B生成器到来。与早期开源的Qwen图像模型不同,它仅供研究使用。

两天后的2026年云栖大会上,阿里表示Qwen 4"正在训练中"。它预计Qwen 4.5和Qwen 5将达到5到10万亿参数。Qwen 4的日期、规模或许可均未公布。

第六章 — 生态与许可演进

Qwen的影响力增长比其参数增长更快。2024年9月,阿里报告4000万次下载和50,000多个衍生模型。到2026年3月,路透社称其超过400个开源模型和超过10亿次下载。同一份报告称Qwen App在2026年2月达到2.03亿月活用户。

在2026年1月Qwen3-Max-Thinking发布会上,阿里还表示Qwen已成为Hugging Face上首个拥有超过200,000个衍生模型的开源模型系列。

许可讲述了一个更安静的故事。Qwen从限制性许可,到开放,再到刻意两层分化。

模式是一致的。小型和中型模型保持开放以吸引开发者基于Qwen构建。前沿层通过阿里云获得收入。

每个日期都链接在前面的章节中。最新的在前。

Qwen始于通义千问,一个于2023年4月11日宣布的仅限邀请的企业beta版。

开放权重迅速到来:2023年8月的Qwen-7B和同年年底的Qwen-72B。

Qwen3(2025年4月)增加了混合思考、36T训练token和119种语言,采用Apache 2.0许可。

2026年在6个月内带来了4代模型(Qwen3.5到Qwen3.8)以及开放/专有分化的战略。

Qwen 4正在训练中;阿里的路线图将Qwen 4.5和Qwen 5置于5到10万亿参数。

Qwen blog和GitHub上的QwenLM

Qwen技术报告(arXiv 2309.16609)

Qwen2.5技术报告(arXiv 2412.15115)

Qwen3技术报告(arXiv 2505.09388)

阿里云:2026年云栖大会路线图

阿里集团:2025年云栖大会

Asif Razzaq是Marktechpost AI Media Inc.的CEO。作为一位有远见的企业家和工程师,Asif致力于利用人工智能的潜力为社会造福。他最新的事业是推出了一个人工智能媒体平台Marktechpost,该平台以其对机器学习和深度学习新闻的深度报道著称,技术扎实且广大受众易于理解。该平台的月浏览量超过200万次,展示了其在受众中的受欢迎程度。

Original source

本文由 AI 翻译整理自 MarkTechPost,原文版权归原作者所有。

阅读英文原文
上一篇
Claude Code mods解析:何时需要构建插件
下一篇
Linus确认Linux内核进入「AI新常态」