Alibaba Qwen从2023年4月邀请制聊天机器人发展至2026年8月2.4万亿参数开源模型,完整记录每次发布与许可证变更。
人工智能
视觉语言模型
2023年4月,阿里云演示了一个聊天机器人,其名字大致意为"千问之真"。三年半后,其后续产品以2.4万亿参数开放权重发布。这就是通义千问一路走来的故事,逐个版本讲述。
阿里在ChatGPT发布后迅速跟进。2023年4月7日,阿里云开始向企业客户发放名为"通义千问"的模型的邀请码。这个名字部分取自哲学家孟子。
四天后的北京阿里云峰会上,时任CEO张勇公开展示了该模型。阿里表示将把该模型整合到各项业务中,首先从钉钉和天猫精灵语音助手开始(中国日报)。
真正的转折出现在8月。2023年8月3日,阿里开源了Qwen-7B和Qwen-7B-Chat,直接对标Meta的Llama 2。Qwen-7B在超过2.2万亿token上预训练,上下文长度为2,048 token。其许可协议对月活用户低于1亿的商业使用免费。
几周后视觉版本也问世了。Qwen-VL作为第一个视觉语言分支,于2023年8月底发布。
2023年9月13日,通义千问向公众开放,标志着中国监管部门的批准。同月,团队在arXiv上发表了Qwen技术报告。
这一年以规模收尾。阿里在2023年12月1日左右发布了72B和1.8B模型供下载。Qwen现已覆盖从笔记本大小到前沿规模的开放权重模型。
2024年,Qwen成为开发者的默认选择。团队在8个月内发布了3代模型。
Qwen1.5(2月):2024年2月5日,团队发布Qwen1.5,定位为Qwen2的beta版本。它涵盖从0.5B到72B的稠密模型,每个规模都稳定支持32K上下文。随后推出了14B MoE(激活参数2.7B)以及110B稠密模型,这是该系列首次突破100B参数。
Qwen2(6月):团队于2024年6月初宣布Qwen2,发布5个规模版本(0.5B到72B)。其中包括Qwen2-57B-A14B,这是其首个开放的混合专家旗舰模型。训练数据新增了27种英语和中文以外的语言。7B和72B的instruct模型最多支持128K token。许可变更影响最大:除72B外,所有规模版本都迁移至Apache 2.0。
专家模型在夏季陆续推出。Qwen2-Math于8月发布,Qwen2-Audio同期推出。Qwen2-VL于8月底跟进,能够分析超过20分钟的视频。
Qwen2.5(9月):2024年9月19日的云栖大会上,阿里一口气发布了超过100个开源模型。Qwen2.5技术报告显示,预训练数据从7万亿token增长到18万亿token。规模从0.5B到72B,128K上下文和8K token生成能力。
实际应用已经落地。阿里表示Qwen模型的下载量已突破4000万次,并在Hugging Face上催生了超过50,000个衍生模型。
编程与推理(11-12月):Qwen2.5-Coder于2024年11月11日发布完整系列。随后推出首个推理模型。QwQ-32B-Preview于11月底以Apache 2.0许可发布,作为OpenAI o1的开源挑战者。实验性视觉推理模型QVQ-72B-Preview于12月24日收官这一年。
2025年1月属于DeepSeek-R1。Qwen在数周内就给出了回应,而不是数月。
1月26日,团队发布了3B、7B和72B规模的Qwen2.5-VL。TechCrunch指出它可以控制PC和手机。三天后的农历新年初一,阿里推出了大规模MoE模型Qwen2.5-Max。路透社报道阿里声称它超越了DeepSeek-V3。
更大的声明出现在3月6日。QwQ-32B基于Qwen2.5-32B并通过强化学习训练,以Apache 2.0许可发布。Qwen声称其性能可与671B的DeepSeek-R1相媲美。VentureBeat指出硬件差距约为24 GB VRAM对比超过1,500 GB。当天阿里香港股价上涨超过7%。
多模态能力紧随其后。Qwen2.5-Omni-7B于3月26日以Apache 2.0许可发布。它接受文本、图像、音频和视频作为输入,并以文本或语音回答。CNBC将其定位为面向成本效益型AI Agent的模型。
Qwen3(4月):2025年4月29日(北京时间),团队发布Qwen3:6个从0.6B到32B的稠密模型和2个MoE模型。旗舰模型是Qwen3-235B-A22B,激活参数为22B。所有模型均以Apache 2.0许可发布。
核心特性是混合思考。一个模型可以逐步推理或即时回答,由用户切换。Qwen3技术报告显示预训练约36万亿token。语言覆盖从29种跃升至119种语言和方言。TechCrunch称之为"混合"推理模型系列。
2507更新(7月):2025年7月21日,Qwen将混合思考重新分离。Qwen3-235B-A22B-Instruct-2507作为非思考模型发布,原生上下文为262K。独立的Thinking-2507检查点随后推出(Hugging Face集合)。
Agent与图像(7-8月):Qwen3-Coder-480B-A35B于2025年7月22日发布,用于Agent编程。阿里将其与Qwen Code配对,这是一个开源终端编程Agent(Computerworld)。8月4日,团队开源了Qwen-Image,这是一个20B的MMDiT模型,专为图像内文本渲染构建。
编辑变体Qwen-Image-Edit于2025年8月18日开源。
9月冲刺:首个超过1万亿参数的Qwen模型Qwen3-Max-Preview于9月5日出现。与过去的旗舰不同,它仅提供API调用。
几天后推出了Qwen3-Next-80B-A3B,这是一次架构赌注。它以3:1的比例混合了Gated DeltaNet线性注意力和门控注意力。模型卡片声称训练成本仅为Qwen3-32B的10%,在超过32K token时推理吞吐量提升10倍。
9月22日,Qwen3-Omni和Qwen3-VL跟进。9月24日的云栖大会上,阿里正式发布Qwen3-Max。CEO吴泳铭表示支出将超过3800亿元人民币(530亿美元)的三年AI和云计划。
到年底,Qwen已成为其他模型的国家基础设施。2025年11月,AI Singapore表示其Sea-Lion模型将从Llama切换到Qwen作为基座。
Qwen也成为一个消费者品牌。Qwen App于2025年11月17日进入公开测试。阿里表示它在一周内突破了1000万次下载。
快速起步(1-2月):2026年1月26日,Qwen发布Qwen3-Max-Thinking,一个闭源推理模型。Qwen表示它在19个基准测试中可与GPT-5.2-Thinking、Claude Opus 4.5和Gemini 3 Pro相媲美(TestingCatalog)。Qwen3-Coder-Next(一个用于Agent编程的小型混合模型)于2月2日跟进。Qwen-Image-2.0于2月10日将生成和编辑合并为一个模型。
Qwen3.5(2月):2026年2月16日(农历除夕),阿里为所称的Agent AI时代推出了Qwen3.5。开源的Qwen3.5-397B-A17B激活397B中的17B参数。它运行在Qwen3-Next预览的混合线性注意力设计上。托管的Qwen3.5-Plus增加了1M token上下文。
中等系列于2月24日跟进。Qwen表示其Qwen3.5-35B-A3B击败了更早的Qwen3-235B-A22B-2507。小型端侧模型于3月2日推出。
领导层变动(3月):3月3日,技术负责人林俊仰发帖表示将离职。路透社报道他是2026年离开的第三位Qwen高管。后训练负责人于博文也离职了,编程负责人惠斌元已于1月加入Meta(第一财经)。
据36氪报道,触发因素是将Qwen拆分为横向预训练、后训练和模态团队的计划。3月16日,阿里将其AI部门置于CEO吴泳铭领导的新集团下。彼时,阿里已发布超过400个开源Qwen模型,下载量超过10亿次。
Qwen3.6(4月):节奏没有放缓。Qwen3.6-Plus于4月2日作为专有托管模型推出。这符合更广泛的转变:南华早报报道中国AI巨头转向专有模型以获取收入。开源侧持续推进。Qwen3.6-35B-A3B于4月16日以Apache 2.0许可发布,瞄准Agent编程。
一周内又有两个发布。闭源旗舰预览版Qwen3.6-Max-Preview于4月20日到来。4月22日,稠密模型Qwen3.6-27B以Apache 2.0许可发布。Qwen表示它在主要编程基准测试中击败了Qwen3.5-397B-A17B。
Qwen3.7(5-6月):5月20日的阿里云峰会上,阿里发布了为长期Agent任务构建的Qwen3.7-Max。阿里表示Artificial Analysis将其全球排名第五、中国模型第一。Qwen3.7-Plus于6月初以每百万token 0.4/1.6美元跟进。两者均保持闭源。
7月,CNBC报道Qwen将被整合进中国的Apple Intelligence。
Qwen3.8(7-8月):彭博社于7月19日报道了新旗舰的预览。托管的Qwen3.8-Max于8月初发布。8月12日,阿里将其基座开源为Qwen3.8-2.4T-A95B:2.4万亿参数,950亿激活(Gigazine)。
许可有了新的附加条件。12个月内收入超过5000万美元的提供商需要商业许可。两天后,Qwen3.8-27B以纯Apache 2.0许可发布。8月26日,路透社报道了Qwen3.8-Flash。其开源兄弟Qwen3.8-Flash-Next被定位为Qwen4架构的早期预览。
9月:9月20日,Qwen-Image-2.1作为7B生成器到来。与早期开源的Qwen图像模型不同,它仅供研究使用。
两天后的2026年云栖大会上,阿里表示Qwen 4"正在训练中"。它预计Qwen 4.5和Qwen 5将达到5到10万亿参数。Qwen 4的日期、规模或许可均未公布。
Qwen的影响力增长比其参数增长更快。2024年9月,阿里报告4000万次下载和50,000多个衍生模型。到2026年3月,路透社称其超过400个开源模型和超过10亿次下载。同一份报告称Qwen App在2026年2月达到2.03亿月活用户。
在2026年1月Qwen3-Max-Thinking发布会上,阿里还表示Qwen已成为Hugging Face上首个拥有超过200,000个衍生模型的开源模型系列。
许可讲述了一个更安静的故事。Qwen从限制性许可,到开放,再到刻意两层分化。
模式是一致的。小型和中型模型保持开放以吸引开发者基于Qwen构建。前沿层通过阿里云获得收入。
每个日期都链接在前面的章节中。最新的在前。
Qwen始于通义千问,一个于2023年4月11日宣布的仅限邀请的企业beta版。
开放权重迅速到来:2023年8月的Qwen-7B和同年年底的Qwen-72B。
Qwen3(2025年4月)增加了混合思考、36T训练token和119种语言,采用Apache 2.0许可。
2026年在6个月内带来了4代模型(Qwen3.5到Qwen3.8)以及开放/专有分化的战略。
Qwen 4正在训练中;阿里的路线图将Qwen 4.5和Qwen 5置于5到10万亿参数。
Qwen blog和GitHub上的QwenLM
Qwen技术报告(arXiv 2309.16609)
Qwen2.5技术报告(arXiv 2412.15115)
Qwen3技术报告(arXiv 2505.09388)
阿里云:2026年云栖大会路线图
阿里集团:2025年云栖大会
Asif Razzaq是Marktechpost AI Media Inc.的CEO。作为一位有远见的企业家和工程师,Asif致力于利用人工智能的潜力为社会造福。他最新的事业是推出了一个人工智能媒体平台Marktechpost,该平台以其对机器学习和深度学习新闻的深度报道著称,技术扎实且广大受众易于理解。该平台的月浏览量超过200万次,展示了其在受众中的受欢迎程度。