Z.ai发布GLM-5.3,开发者社区对其是工业级模型蒸馏还是针对性刷榜展开讨论,评价分化明显。
中国前沿模型公司 Z.ai 于上周五发布了 GLM-5.3,该模型基于与前代 GLM-5.2 相同的代码库构建,所有提升均来自后训练阶段的工程优化据悉。最新版本在复杂编程和长周期任务上的表现有了显著提升。
后训练模型优化流程很少被视为遵循单一固定脚本的标准化过程(在乐谱意义上,而非代码脚本意义上),但在这一代模型中尤为重要,通常会包含推理对齐、监督微调以及基于人类反馈的强化学习(RLHF)。
Z.ai 在一篇匿名撰写的博客中表示:"过去一个月里,我们持续在这一代 GLM-5.2 技术栈上进行扩展:更多环境、更多样化的任务、以及更多用于训练的算力投入。"
一个基于更广泛生产工作流训练的模型
该公司进一步说明,扩展后更加复杂的模型训练环境现已覆盖"更广泛的生产工作流范围",并围绕工程和研发工作在实践中的实际运作方式设计了"多样化的任务类别"。部分任务的设计量相当于一位资深工程师数天的实际工作量。
Z.ai 在博客中举例:"例如,在一项 ML 基础设施任务中,模型会获得与工程师相同的工作环境,可访问计算集群、存储系统、内部文档、代码库和实验结果。模型需要诊断训练栈中的瓶颈、实施优化、运行实验,并在保持正确性的前提下实现可衡量的端到端提速。"
如果内部基准有任何参考价值的话,该组织新推出的 Z.ai Code Bench 将 GLM-5.3 的编程能力评估为比 GLM-5.2 提升了 50%。该公司承诺会保持严谨自律,认为这一私有基准"降低了公共测试集污染的风险",能够更真实地反映实际用户体验。
该公司同时也公开展示了其他公开基准测试的排名,包括 TerminalBench 3.0、DeepSWE、Agents' Last Exam、AutomationBench、HLE w/ Tools: Humanity's Last Exam(HLE,一项独立学术基准),以及 OpenAI 的 GDPVal-AA v2。
AI 开发者对此怎么看?
除了这些衡量标准和基准测试之外,真实世界的开发者从业者对开源权重模型领域正在发生的事情有何看法?
长周期自主软件工程公司 NonBioS.ai 的联合创始人 Nishant Soni 告诉 The New Stack,在他看来,Z.ai 在扩展以应对真实世界长周期任务方面所做的工作,"基于他自己的实际经验,需要持保留态度"。
Soni 表示:"据我所知,目前没有任何基准测试能客观证明 GLM-5.3 在真实世界任务中声称的卓越长周期能力。Z.ai 所描述的具体编排方式,似乎不太可能提供前沿模型所需的那种差异化和综合性的数据集来真正培养这种能力。"
他补充道:"我怀疑这在很大程度上是一种转移注意力的努力——试图掩盖模型前沿能力的真正来源——其模式与工业规模的 Anthropic 模型蒸馏高度一致。"
在 NonBioS 的内部测试中,Soni 解释说,他的团队看到了 Kimi/GLM 输出与 Claude 输出之间"惊人的相似性"。相比之下,其他前沿模型——尤其是 Gemini 和 Grok——与 Claude 输出的差异则更为明显。
"我怀疑这在很大程度上是一种转移注意力的努力——试图掩盖模型前沿能力的真正来源——其模式与工业规模的 Anthropic 模型蒸馏高度一致。"他补充道。
在中间地带与模型共同达成真实结果
AI 基准测试专业公司 Megaton 创始人 Sherif Higazy 告诉 The New Stack,他能够理解任何前沿模型公司(或用户、团队)建立内部评估系统的做法——即衡量token消耗和支出与任务完成(网络安全或其他)之间的关系。
Higazy 表示:"当一个模型是为基准测试而训练,而非兑现承诺的能力时,这通常是一件好事。但归根结底,要从 AI Agent 中持续获得有效的工作成果,需要在中间地带与模型达成共识——即团队调整自身工作环境以适应 Agent 的运作方式(例如,强制重复测试运行,或使输入输出具备机器可读性和可验证性)——以此获得最佳结果。"
"从 Agent 中持续获得有效的工作成果,需要在中间地带与模型达成共识——即团队调整自身工作环境以适应 Agent 的运作方式(例如,强制重复测试运行,或使输入输出具备机器可读性和可验证性)——以此获得最佳结果。"
他补充道:"Z.ai 声称开发者可以将这一负担上游转移到模型训练环节,从而获得更好的任务表现。如果你能训练 Agent 在更多样化和真实的环境中工作,它就能在更长更复杂的任务上表现更好,而无需过多监督。也许并不是所有人都完全认同这种方法,但值得将其纳入考量。"
AI 工具数据准确性执行公司 Sphinx 联合创始人兼 CEO Rohan Kodialam 告诉 The New Stack,模型的进步速度正是他不会围绕某款当下领先的模型来构建企业基础设施的原因。
"OpenAI、Anthropic、Google 以及越来越多的中国开源权重模型正在不断相互超越。"Kodialam 表示。"我们认为业务上下文应该独立于底层模型存在,这样公司就能在不同模型之间切换,而无需重新教新系统了解他们组织的运作方式。模型无关性正在从一种技术偏好转变为一种对冲策略——在这样一个 AI 市场中,没有人知道六个月后谁将拥有最好的模型。"
他提醒我们,一旦多款模型达到大致相当的能力水平,在它们之间做出选择就更多地取决于工作负载而非排行榜了。成本、延迟、隐私、部署模式、工具使用以及在特定任务上的表现,可能比基准测试上的几分之差更为重要。
"企业应该避免让自己的模型选择变得不可逆,并围绕可移植性进行构建——随着能力、经济性和基础设施的演变而调整。"
"但在全球范围内也在发生一场超越任何单一企业的模型选择:算力的可获得性决定了哪些模型能够真正以大规模运行,而今天 far more infrastructure is dedicated to providers like OpenAI and Anthropic than newer alternatives like Z.ai's GLM"(今天,far more infrastructure is dedicated to providers like OpenAI and Anthropic than newer alternatives like Z.ai's GLM)。Kodialam 补充道。
即使每家公司都想在明天就完成切换,整个市场也不一定能随之移动——这就是为什么 Kodialam 说开发者团队应该避免让自己的模型选择变得不可逆,并围绕可移植性进行构建——随着能力、经济性和基础设施的演变而调整。
"简而言之——中国实验室利用了美国实验室在发布前测试阶段所花的所有时间,持续在基准测试上进行爬山优化。"
Z.ai 是否在"基准刷榜"?
在 Hacker News 上关于 GLM 5.3 的相对有限的讨论帖子中,ML 研究员 Nathan Lambert 或许是最具洞察力的一位。他交叉引用了自己 Interconnects 网站上的一篇文章,质疑中国实验室究竟是如何跟上硅谷前沿圈子的步伐的。
Lambert 首先质疑远东前沿玩家是否在"基准刷榜"(benchmaxxing)——即用模型对准测试集以获得良好的基准分数,但无法在真实世界部署场景中复现(尽管 Z.ai 告诉我们最新版模型是基于复杂的真实世界开发者工作流构建的)——他同时认为,即使存在这种情况,程度也相当轻微。
"Very, very likely that OpenAI and Anthropic have far better internal models than Z.ai and Moonshot AI. Still, these American companies tend to take months to release their models to the public, which massively flatters the Chinese labs in adoption decisions at the frontier. To put it simply – the Chinese labs use all the time that American labs do pre-release testing to keep hillclimbing on benchmarks."("Very, very likely that OpenAI and Anthropic have far better internal models than Z.ai and Moonshot AI. Still, these American companies tend to take months to release their models to the public, which massively flatters the Chinese labs in adoption decisions at the frontier. To put it simply – the Chinese labs use all the time that American labs do pre-release testing to keep hillclimbing on benchmarks.")Lambert 写道。
自回归工程化的空白填充
这个谦逊命名的 GLM 其名称源自当前模型所基于的 General Language Model 训练算法。它依赖于自回归空白填充技术——一种模型训练技术,通过使用完形填空测试删除或遮挡模型数据的某些部分,来提升模型的词汇量、理解和推理能力。
Z.ai 确认将完全开源,并将在发布后约两周(大约 2026 年 8 月末)待安全评估和加固完成后,发布 GLM-5.2 的模型权重。