智谱GLM-5.3、阿里Qwen3.8、DeepSeek V4 Pro相继发布,GLM-5.3登Hacker News榜首,Qwen3.8为首个可从Hugging Face下载的Max级模型。
一年前的保罗·格雷厄姆(Paul Graham)宣称,调优开源权重模型是"浪费时间"。当时的主流共识是:闭源实验室会轻松超越开源社区能构建的任何东西,使得微调变得徒劳无功。这个共识在本周崩塌了。8月12日至14日期间,三家中国实验室——智谱(Z.ai)、阿里巴巴(Qwen)和 DeepSeek——各自发布了前沿级别的模型,权重已开放或即将开放。GLM-5.3 以 924 分登顶 Hacker News 热榜。Qwen3.8 成为首个可从 Hugging Face 下载的 Max 级模型。DeepSeek V4 Pro 与 MIT 许可的 agent 工具链同步正式发布。这不是三次偶然的发布。这是协调一致的工业级反击——反击"闭源护城河"论——而且产品已经交付了。
贯穿全文的主线比任何单一模型都更重要。开源权重不再是一种哲学立场或研究便利。它们正在成为市场策略,由国家背景的资金支持,由在基准测试上已将差距缩小到个位数百分比的实验室执行,且以闭源替代方案成本的一小部分交付。
智谱于8月14日发布的 GLM-5.3 是当之无愧的头条。它基于与 GLM-5.2 完全相同的基座模型构建,所有改进均来自扩展后的后训练。没有新的预训练运行,没有架构变更。只是将强化学习和训练环境设计推到了团队预期之外。
结果令人瞩目。在编程基准测试上,GLM-5.3 在 Terminal-Bench 3.0 上达到 28.3(GLM-5.2 为 4.6),在 DeepSWE v1.1 上达到 66.9(GLM-5.2 为 46.2)。在 Agents' Last Exam 上达到 28.5,较 23.8 有所提升。在 Z.ai 内部基准测试的最大思考强度下,它使用约 75,000 个输出 tokens 达到了 34.5%。
但真正的故事是网络安全。GLM-5.3 在 CyberGym 上得分 84.5%——排名第一,领先于 Anthropic 的 Mythos 5(83.8%)和 OpenAI 的 GPT-5.6 Sol(83.6%)。在 ExploitBench 上达到 54.4%,是 GLM-5.2 的 24.4% 的两倍多。该模型发展出了 Z.ai 所称的"涌现性网络能力"——多步骤漏洞利用链推理,公司表示这是他们没有计划、也没有明确训练的。
漏洞发现台账说明了规模。Z.ai 报告在 269 个开源项目中发现了 2,436 个漏洞,包括可追溯至 45 年前的缺陷。按严重程度分类:107 个严重(Critical)、990 个高危(High)、1,286 个中危(Medium)、53 个低危(Low)。其中 53 个 CVE 已公开分配;另有 2,383 个在 cvd.z.ai 处于协调 embargo 下。已披露的 bug 包括 Linux kernel 6lowpan 的 use-after-free(CVE-2026-64452)、WebKit/Safari 的内存处理缺陷(CVE-2026-43663)和 FreeBSD ptrace 验证 bug(CVE-2026-45253)。
一位 HN 评论者捕捉到了从业者的反应:他们购买了 18 美元的 GLM 订阅,用 Claude Code 工具链配置好进行安全研究,然后"几乎立刻升级到了 80 美元的套餐"。该模型同意执行 proper red-team 分析,并毫不犹豫地执行了。
Jeremy Howard,fast.ai 的联合创始人,对 GLM 系列一直直言不讳,他评价 GLM-5.2"至少与 Opus 4.8 和 GPT 5.5 一样好",而且"超级快、便宜、不太啰嗦"。GLM-5.3 在此基础上更上一层楼,后训练带来的提升是一年前开源权重领域无人能及的。
当 GLM-5.3 在 HN 上占据主导地位时,阿里巴巴悄然放出了对开源权重生态可能更具意义的东西。8月12日,Qwen 发布了 Qwen3.8-2.4T-A95B 的权重——这是首个作为 Hugging Face 可下载产物的 Max 级模型。
参数如下:总计 2.4 万亿参数,约 950 亿活跃参数,每层 512 个专家(10 个路由 + 1 个共享),92 层,每层隐藏维度 8192。原生长上下文窗口 262,144 tokens,可扩展至超过 100 万。这不是一个能在笔记本上运行的小模型。这是一个拥有 GPU 集群的组织现在可以自托管的完整前沿级 MoE 模型。
基准测试表现证实了野心。GPQA Diamond:92.6。SWE-bench Pro:67.7。PaperBench:93.0。Terminal-Bench 2.1:86.6。这些数字在与关键开发者相关任务上最好的闭源产品直接竞争。
Clement Delangue,Hugging Face 的 CEO,用一个词的背书放大了这次发布。这份热情是合理的。迄今为止,Max 级 Qwen 模型仅提供 API 调用。将权重开放下载改变了任何关注数据主权、微调控制或不想被单一提供商定价捆绑的团队的局面。
该模型需要thinking mode才能交互,且仅支持文本——本次发布没有多模态能力。但对于编程、研究和 agent 驱动的工作负载,这是目前你能下载的最强大的开源权重模型。
DeepSeek 对本周开源权重攻势的贡献出现在8月13日,发布了 DeepSeek V4 Pro 0813 正式版,并同步推出了 DeepSeek Harness v0.1。
模型改进是实质性的。从4月的预览版到正式版,DeepSWE 从 12.8 跃升至 62.7(+49.9 分),CyberGym 从 52.7 升至 83.3(+30.6),NL2Repo 从 38.5 升至 61.5,Terminal-Bench 2.1 从 72.1 升至 87.9。权重在 Hugging Face 上采用 MIT 许可——约 893GB,分布在 67 个 safetensors 文件中,基于 1.6T 总参数 / 49B 活跃参数架构,配备了新的 DSpark 投机解码模块。
正如一位 HN 评论者所指出的:"与 Opus 4.8 竞争,但弱于 Sol 或 Fable。大约便宜 20 倍。"这个价格性能比是开源权重价值主张的一句话概括。
但真正的差异化因素是 DeepSeek Harness。它在 MIT 许可下发布,是一个建立在激进模块化原则上的 provider-agnostic agent 框架:一切皆是插件。推理、工具、会话状态、agent 循环本身——全部可替换。它支持原生 OpenAI Responses API 格式,与 Codex 集成,并提供三种思考 effort 级别。
这很重要,因为它直接解决了工具链问题。竞争优势正在从模型转移到围绕它的脚手架上。DeepSeek 发布的不仅是权重——而是一个完整的开发环境。
Polymarket 预测市场提供了有用的现实检验,看看投注公众如何消化本周的发布。
"8月底第二名 AI 实验室"的赔率显示阿里巴巴占 55%,Google 占 37%。这是一个显著的转变——Qwen 的制造商阿里巴巴现在是市场上#2位置的热门,落后于 Anthropic。"8月底第三名中国 AI 公司"的赔率显示 Z.ai(智谱,GLM 的制造商)占 52%,领先于百度的 28% 和月之暗面的 11%。
这些不是情绪调查。这是交易者用真金白银下的注,他们有经济动机去押对。它们告诉我们,市场认为开源权重中国实验室是挑战闭源西方提供商的主要力量。
更广泛的背景强化了这一信号。在同一周,Meta 发布了 Muse Glimmer——一个采用 Apache 2.0 许可的 300 亿参数开源权重 agent 模型,Alexandr Wang 称其为"每个人都能拥有的个人超级智能"。开源权重浪潮并不局限于中国实验室。这是一个跨大陆的共识:权重应该可以下载、分叉和自托管。
其中任何一个发布都值得注意。三者同时出现在同一周才是真正的信号。
看看结构图。智谱证明了仅靠后训练就能将现有基座模型在专门领域(网络安全)推过闭源前沿基准测试。阿里巴巴证明了 Max 级模型权重可以开放下载——打破了 API 独占壁垒,这个壁垒将最强大的模型锁在提供商控制之下。DeepSeek 展示了价值链延伸到工具层面,其 MIT 许可的工具链让任何团队都能构建 agent 系统而无需 vendor lock-in。
三者共同构成了一个连贯的论旨:闭源模型的护城河在基准测试上正在缩小,在价格上正在崩塌,现在又在工具链上被侧翼包抄。
在宣布开源权重胜利之前,注意三个令人不安的事实。首先,GLM-5.3 的权重尚未发布——Z.ai 正在为"安全评估和加固"保留它,这与模型的网络能力相关。当一家实验室出于安全考虑延迟自己的开源权重发布时,"开源"标签只是营销,直到 bits 实际发出去。其次,这些模型在通用编程基准测试上仍然落后于 Sol 和 Fable 5——CyberGym 是一个狭窄的表面,ExploitBench 结果是自报告的。第三,Polymarket 仍然将 Anthropic 定价为整体#1实验室。反击是真实的,但战争尚未胜利。
如果你正在构建 agent 编程系统、评估模型提供商或做出基础设施押注,这里是具体的要点:
可行的模型名单刚刚翻了三倍。本周之前,前沿级编程需要 Claude、GPT-5.6 或 Gemini。现在,GLM-5.3(每月 18 美元)、可自托管部署的 Qwen3.8 以及价格约为 Opus 4.8 的 1/20 的 DeepSeek V4 Pro,都是生产工作负载的可靠选项。
用你自己的任务做基准测试。综合基准测试掩盖了特定工作负载的性能。GLM-5.3 在网络安全上领先,但在通用编程上落后。Qwen3.8 在研究和规划上表现出色。DeepSeek V4 Pro 在纯每 token 价值上最强。知道哪个模型适合你的管道的唯一方法是用它测试。
评估 DeepSeek Harness。如果你目前被锁定在单一提供商的 agent 框架中,MIT 许可的 Harness 值得花一个周末来实验。它的插件架构意味着你可以不重写 agent 逻辑就能切换模型——这是对提供商锁定的真正对冲。
关注权重发布。GLM-5.3 的开源权重预计在两周内发布。当它发货时,任何有 GPU 容量的团队都能访问一个在网络安全基准测试上击败 Mythos 5 的模型。其安全含义——防御和进攻两面——值得每位 CISO 和安全团队认真关注。
ℹ️ 总结:保罗·格雷厄姆一年前错了,这周对了。开源权重调优回来了——不是因为社区以草根方式赶上了,而是因为三家资金充足的实验室将其作为工业战略。反击已经交付。问题不再是有没有开源权重能与闭源前沿模型竞争。而是当差距如此之小时,闭源提供商能否证明其价格溢价是合理的。
最初发表于 ComputeLeap