Anthropic实测显示智谱开源模型GLM-5.3在网络漏洞利用任务上与Claude Mythos Preview表现相当,其轻量版仅需20美元即可构建可靠的Chrome攻击链,且安全护栏可被轻易移除并已广泛流传。
智谱开源模型 GLM-5.3 在漏洞利用开发能力上已逼近 Claude Mythos Preview,这是 Anthropic 一份新分析的结论。Anthropic 同时指出,GLM-5.3 的安全防护可以被简单方法绕过。当然,Anthropic 自身也有自己的盘算。
五个月前 Anthropic 发布了 Claude Mythos Preview,如今其前沿红队表示,该模型的标志性能力已被竞争对手追上。在这篇新分析中,团队评估了智谱 AI(海外品牌 Z.ai)的 GLM-5.3。Anthropic 指出,GLM-5.3 能够像 Mythos Preview 一样自主构建完整网络漏洞利用程序。然而,与所有其他具备类似能力的模型不同,GLM-5.3 发布时没有任何有效的安全防护机制。
Anthropic 有意限制了 Mythos Preview 的开放范围,仅通过 Project Glasswing 向经过筛选的防御者提供访问权限,让他们抢先一步。该公司表示,这些防御者至今已累计发现超过 10,000 个关键软件中的漏洞。OpenAI 也在 Daybreak 上采取了类似策略。而 GLM-5.3 则是任何人都可以下载使用。
前沿级漏洞利用的成本如今已与一顿午餐相当
ExploitBench 衡量的是模型针对 Chrome V8 引擎中已知漏洞构建漏洞利用程序的能力。在该基准测试中,GLM-5.3 在 410 次尝试中成功构建了 50 个可用的漏洞利用程序,而 Mythos Preview 完成了 56 个。Anthropic 还运行了一套基于 Google OSS-Fuzz 开源项目的内部二进制漏洞利用基准测试。在那项测试中,GLM-5.3 在 4% 的任务中实现了对目标程序的完全控制,Mythos Preview 的成绩是 6%。GLM-5.2 和 Claude Opus 等更早的模型在两项测试中均告失败,Kimi K3 和 DeepSeek V4.1-Flash 的成绩几乎为零。

Anthropic 还让 GLM-5.3 与人类专家配对合作。在短短一天且几乎不需要人类关注的情况下,该模型在一款广泛使用的浏览器的 JavaScript 引擎中发现多个此前未知的安全漏洞,并将其串联成一个可以读取访客计算机上任意文件的网页,在测试中成功获取了一个私有的 SSH 密钥。Anthropic 表示已将这些漏洞报告给浏览器开发商。驱动程序和设备固件中的其他发现仍在审核中。
Anthropic 使用较小的 GLM-5.3-Flash 测试了将新披露的漏洞快速转化为有效攻击的速度。该模型将一个近期披露的 Chrome 漏洞与另一个已知漏洞相结合,在几乎无指导的情况下构建出了一个可靠的攻击程序。这套攻击甚至还绕过了一个处理器内置的额外安全防护。整个过程仅消耗了 20 分钟的人工关注时间和 8 小时的模型算力,按智谱 API 价格计算约需 20.40 美元。
美国机构 CAISI 在其独立评估中得出了类似结论。他们将 GLM-5.3 称为迄今为止网络能力最强的开源模型,并估计其与美国最佳模型的差距约为四个月。这一对比有其局限。CAISI 在测试美国模型时关闭了其网络安全防护,而所谓顶尖梯队中还包含了仅限经过审查用户访问的模型。
开源权重让安全护栏形同虚设
在 Anthropic 的一次模拟中,GLM-5.3 对公然的恶意攻击指令会予以拒绝。当同一请求被伪装成红队演练时,该模型在 64% 的运行中尝试连接目标系统。如果提供了预填充的推理步骤,这一比例上升至 92%。在使用 abliteration(一种从开源模型中剥离拒绝行为的技术)之后,这一比例达到 100%。由于该模拟不执行任何代码,因此无法展示攻击是否真的能够成功。被保护的 Claude 模型在所有测试中始终保持零次尝试。
Anthropic 团队表示,这是他们首次使用 abliteration。该过程消耗了约 2,200 GPU 小时,成本约 4,400 美元,Anthropic 估计一个经验丰富的团队可以在约 1,200 美元的成本下完成。对有害请求的拒绝率从超过 90% 下降到 2% 到 12% 之间,而科学和网络测试的得分几乎没有变化。据 Anthropic 称,在模型发布后数天内,已有多位开发者发布了解锁版本。
Anthropic 的结论是:国家和非国家行为者很可能会利用 GLM-5.3 此类模型造成实际伤害。该公司认为,政府应该对有能力构建漏洞的模型进行测试,而且防御者需要至少与对手同等水平的工具。
Anthropic 的警告也服务于其自身商业利益
这份分析并非完全出于公益。Anthropic 不发布自己的模型权重,而报告恰恰将不发布权重作为一项关键安全优势来呈现。一款接近前沿水平、价格低廉的中国开源模型同时也是其直接竞争对手。
报告的结论也符合 Anthropic 的商业利益。该公司希望将 Claude 的网络能力带给更多防御者,经过审查的用户已经可以访问 Claude Mythos 5.1。其呼吁政府对 GLM-5.3 的后续版本进行测试,也难免让人怀疑存在监管捕获之嫌——即规则最终主要保护了既有玩家。
不过,这不仅仅是自身利益。CAISI 的独立评估印证了这些能力数据,而且模型的解锁版本已经流布于世。
英国 AI 安全研究所(AISI)近期发现,开源模型在网络能力方面的差距已从六至十个月缩短至四至七个月。该研究所还指出,开源模型的运行成本要低得多,而且其安全护栏在很大程度上形同虚设。AISI 警告了持续且不可逆转的滥用风险,但同时也指出了真实存在的益处,例如私有化部署、自定义能力以及更低的成本。
AISI 将这一差距缩小视为防御者准备的窗口期。彼时,开源模型是否也能追上 Mythos Preview 所代表的能力飞跃,尚不明朗。Anthropic 和 CAISI 的测量结果表明,GLM-5.3 已经是这一问题的初步答案。