Anthropic 启动 Project Glasswing,专注于保护开源关键基础设施在 AI 时代的安全,涉及供应链安全、自动化漏洞检测等新议题,获得业界高度关注。
我们创立 Project Glasswing 是因为我们在由 Anthropic 训练的新一代前沿模型中观察到的能力,我们相信这可能会重塑网络安全。Claude Mythos2 Preview 是一个通用的、未发布的前沿模型,它揭示了一个令人瞩目的事实:AI 模型已经达到了编码能力的水平,可以超越除了最有技能的人类之外的所有人,在寻找和利用软件漏洞方面。
Mythos Preview 已经发现了数千个高严重性漏洞,包括每个主要操作系统和网络浏览器中的漏洞。鉴于 AI 进展的速度,这样的能力很快就会扩散,可能超出致力于安全部署这些能力的行动者的范围。后果——对经济、公共安全和国家安全——可能会很严重。Project Glasswing 是一项紧迫的努力,旨在将这些能力用于防御目的。
作为 Project Glasswing 的一部分,上述启动合作伙伴将使用 Mythos Preview 作为其防御性安全工作的一部分;Anthropic 将分享我们学到的东西,使整个行业都能受益。我们还为超过 40 个构建或维护关键软件基础设施的额外组织扩展了访问权限,以便他们可以使用该模型扫描和保护第一方和开源系统。Anthropic 承诺在这些工作中为 Mythos Preview 提供最多 1 亿美元的使用额度,以及向开源安全组织捐赠 400 万美元。
Project Glasswing 只是一个起点。没有任何一个组织能够单独解决这些网络安全问题:前沿 AI 开发人员、其他软件公司、安全研究人员、开源维护者和世界各地的政府都有着至关重要的作用。保卫世界网络基础设施的工作可能需要数年;前沿 AI 能力在仅仅接下来的几个月内可能会显著进步。为了让网络防御者占上风,我们需要立即采取行动。
我们每天都依赖的软件——负责运行银行系统、存储医疗记录、连接物流网络、保持电网运行等——一直包含 bug。许多是微小的,但有些是严重的安全缺陷,如果被发现,可能会让网络攻击者劫持系统、中断运营或盗取数据。
我们已经看到了网络攻击对重要企业网络、医疗系统、能源基础设施、运输枢纽和世界各地政府机构信息安全造成的严重后果。在全球舞台上,来自中国、伊朗、朝鲜和俄罗斯等国家支持的攻击威胁到了支撑平民生活和军事准备的基础设施。即使是较小规模的攻击,比如针对单个医院或学校的攻击,仍然可能造成实质性的经济损失、暴露敏感数据,甚至危及生命。全球网络犯罪的当前财务成本很难估计,但可能每年在 5000 亿美元左右。
软件中的许多缺陷多年来未被发现,因为寻找和利用它们需要只有少数技术娴熟的安全专家才拥有的专业知识。随着最新的前沿 AI 模型的出现,寻找和利用软件漏洞所需的成本、工作量和专业知识水平都急剧下降。在过去的一年中,AI 模型在阅读和推理代码方面变得越来越有效——特别是,它们展示了发现漏洞和制定利用方式的惊人能力。Claude Mythos Preview 展示了这些网络技能的跃进——它发现的漏洞在某些情况下已经在数十年的人工审查和数百万次自动化安全测试中幸存下来,它开发的利用方式越来越复杂。
在第一次 DARPA 网络大挑战赛十年后,前沿 AI 模型现在正在成为与最优秀的人类在寻找和利用漏洞方面具竞争力的模型。没有必要的保护措施,这些强大的网络能力可能被用来利用世界上最重要软件中存在的许多缺陷。这可能会使各种类型的网络攻击频率更高、破坏力更大,并赋予美国及其盟国的对手权力。因此,解决这些问题是民主国家的一项重要安全优先事项。
虽然来自 AI 增强网络攻击的风险很严重,但有理由保持乐观:使 AI 模型在坏人手中危险的相同能力,使其对于在重要软件中寻找和修复缺陷,以及生产具有更少安全 bug 的新软件来说是无价的。Project Glasswing 是朝着在即将到来的 AI 驱动网络安全时代给予防御者持久优势迈出的重要一步。
在过去的几周里,我们使用 Claude Mythos Preview 识别了数千个零日漏洞(即软件开发者以前不知道的缺陷),其中许多是严重的,涵盖每个主要操作系统和每个主要网络浏览器,以及一系列其他重要软件。
在我们的前沿红队博客上,我们为已经被补丁的这些漏洞的一个子集提供了技术细节,在某些情况下,还包括 Mythos Preview 找到的利用它们的方式。它能够识别几乎所有这些漏洞,并完全自主地开发许多相关的利用,没有任何人类的指导。以下是三个例子:
Mythos Preview 在 OpenBSD 中发现了一个 27 年前的漏洞——OpenBSD 享有作为世界上最安全加固的操作系统之一的声誉,被用于运行防火墙和其他关键基础设施。该漏洞允许攻击者仅通过连接到其中就可以远程崩溃任何运行该操作系统的机器;
它还发现了 FFmpeg 中的一个 16 年前的漏洞——FFmpeg 被无数软件用来编码和解码视频——在一行代码中,自动化测试工具已经运行了 500 万次而从未捕获该问题;
该模型自主地在 Linux 内核中找到并链接了多个漏洞——Linux 内核运行世界上大多数服务器的软件——以允许攻击者从普通用户访问权限升级到对机器的完全控制。
我们已经向相关软件的维护者报告了上述漏洞,他们现在都已经被补丁了。对于许多其他漏洞,我们今天提供细节的密码学哈希(见红队博客),我们将在修复到位后披露具体信息。
评估基准,如 CyberGym,强化了 Mythos Preview 和我们下一个最好的模型 Claude Opus 4.6 之间的实质性差异:
Cybersecurity Vulnerability Reproduction
除了我们自己的工作,许多合作伙伴已经在使用 Claude Mythos Preview 几周了。这是他们的发现:
"AI 能力已经跨越了一个门槛,从根本上改变了保护关键基础设施免受网络威胁所需的紧迫性,而且没有回头路。我们与这些模型的基础性工作表明,我们可以识别和修复硬件和软件中的安全漏洞,速度和规模之前是不可能的。这是一个深刻的转变,也是一个明确的信号,表明过去的系统加固方式已经不再足够。技术提供商必须立即积极采取新方法,客户需要做好部署的准备。这就是 Cisco 加入 Project Glasswing 的原因——这项工作太重要、太紧迫,不能单独完成。"
Cisco 高级副总裁兼首席安全与信任官
"在 AWS,我们在威胁出现之前从我们的定制硅到整个技术堆栈构建防御。安全对我们来说不是一个阶段;它是持续的,嵌入在我们所做的一切中。我们的团队每天分析超过 400 万亿个网络流以寻找威胁,AI 是我们大规模防御的能力的中心。我们一直在我们自己的安全操作中测试 Claude Mythos Preview,将其应用于关键代码库,它已经在帮助我们加强我们的代码。我们将深厚的安全专业知识带到与 Anthropic 的合作伙伴关系中,并帮助加固 Claude Mythos Preview,以便更多组织可以用设置标准的安全推进他们最雄心勃勃的工作。"
Amazon Web Services 副总裁兼首席信息安全官
"当我们进入网络安全不再受纯粹人类能力约束的阶段时,以负责任的方式使用 AI 来改善安全并大规模降低风险的机会是前所未有的。加入 Project Glasswing,获得 Claude Mythos Preview 的访问权限,使我们能够早期识别和缓解风险,并增强我们的安全和开发解决方案,以便我们可以更好地保护客户和 Microsoft。当针对 CTI-REALM(我们的开源安全基准)进行测试时,Claude Mythos Preview 相比以前的模型表现出了实质性的改进。我们期待与 Anthropic 和整个行业合作,改善所有人的安全成果。"
Microsoft 网络安全和 Microsoft 研究执行副总裁
"漏洞被发现和被攻击者利用之间的窗口已经关闭——曾经需要几个月的时间现在随着 AI 在几分钟内发生。Claude Mythos Preview 展示了防御者现在大规模可能做到的事情,对手将不可避免地寻求利用相同的能力。这不是减速的理由;这是更快地一起行动的理由。如果你想部署 AI,你需要安全。这就是为什么 CrowdStrike 从第一天起就是这项工作的一部分。"
CrowdStrike 首席技术官
"过去,安全专业知识是拥有大型安全团队的组织才能获得的奢侈品。开源维护者——其软件支撑着世界关键基础设施的大部分——历来被遗留下来自己解决安全问题。开源软件构成了现代系统中代码的绝大多数,包括 AI agent 用来编写新软件的系统本身。通过让这些关键开源代码库的维护者访问可以主动识别和大规模修复漏洞的新一代 AI 模型,Project Glasswing 提供了一条改变这种局面的可信路径。这是 AI 增强安全如何可以成为每个维护者(不仅仅是那些能够负担昂贵安全团队的维护者)的可信伙伴的方式。"
Linux Foundation 首席执行官
"促进金融系统的网络安全和弹性是 JPMorganChase 使命的核心,我们相信当领先机构在共同挑战上合作时行业最强大。Project Glasswing 提供了一个独特的、早期阶段的机会来评估下一代 AI 工具在我们自己的条件下以及与受尊敬的技术领导者一起在关键基础设施上的防御网络安全。我们将采取严格的、独立的方法来确定如何进行以及我们可以在哪里提供帮助。Anthropic 的倡议反映了这一时刻所要求的那种前瞻性、协作的方法。"
JPMorganChase 首席信息安全官
"Google 很高兴看到这个跨行业的网络安全倡议成形,并通过 Vertex AI 向参与者提供 Mythos Preview。行业在新兴安全问题上合作一直是至关重要的,无论是后量子密码、负责任的零日披露、安全的开源软件还是针对基于 AI 的攻击的防御。我们一直相信 AI 在网络防御中带来新的挑战和开放新的机遇,这就是为什么我们构建了 AI 驱动的工具——如 Big Sleep 和 CodeMender——来寻找和修复关键软件缺陷。我们将继续投资于我们领先的网络安全平台和一个专注于保护用户、客户、生态系统和国家安全的文化。"
Google 安全工程副总裁
"在过去的几周里,我们已经可以访问 Claude Mythos Preview 模型,用它来识别以前几代模型完全遗漏的复杂漏洞。这不仅是寻找以前隐藏的漏洞的游戏改变者,而且还预示着一个危险的转变,攻击者很快就能找到更多零日漏洞并比以往更快地开发利用。很明显,这些模型需要掌握在开源所有者和世界各地的防御者手中,以在攻击者获得访问权限之前寻找和修复这些漏洞。也许更重要的是:每个人都需要为 AI 辅助的攻击者做好准备。会有更多的攻击、更快的攻击和更复杂的攻击。现在是时候现代化各地网络安全堆栈了。我们赞扬 Anthropic 与行业合作,确保这些强大的能力优先考虑防御。"
Palo Alto Networks 首席产品与技术官
Claude Mythos Preview 强大的网络能力是其强大的代理编码和推理技能的结果。例如,如下评估结果所示,该模型在各种软件编码任务上获得了任何迄今为止开发的模型中的最高分。
SWE-bench Multimodal (internal implementation)
SWE-bench Multilingual
• SWE-bench Verified、Pro 和 Multilingual:我们的记忆化屏幕标记了这些 SWE-bench 评估中的问题子集。排除任何显示记忆化迹象的问题,Mythos Preview 相比 Opus 4.6 的改进幅度保持不变。 • SWE-bench Multimodal:我们为 Mythos Preview 和 Opus 4.6 都使用了内部实现。分数不能直接与公共排行榜分数进行比较。 • Terminal-Bench 2.0:我们在自适应思考处于最大努力的情况下使用了 Terminus-2 工具,每个任务的总任务预算为 100 万个 token。所有实验在每个任务五次尝试中使用 1× 保证/3× 上限资源分配。当我们将超时限制增加到四小时并使用 Terminal-Bench 2.1 更新时,Mythos Preview 的得分为 92.1%。
Humanity's Last Exam:我们发现 Mythos 在低努力下仍然在 HLE 上表现良好,这可能表明某种程度的记忆化。
BrowseComp:Claude Mythos Preview 的分数高于 Opus 4.6,同时使用的 token 减少了 4.9 倍。
有关模型的能力、其安全属性和其一般特征的更多信息可以在 Claude Mythos Preview 系统卡中找到。
我们不计划让 Claude Mythos Preview 普遍可用,但我们的最终目标是使我们的用户能够大规模安全地部署 Mythos 类模型——用于网络安全目的,但也用于此类高度能力的模型将带来的无数其他好处。为了做到这一点,我们需要在开发网络安全(和其他)保护措施方面取得进展,这些措施可以检测和阻止模型最危险的输出。我们计划在即将推出的 Claude Opus 模型中推出新的保护措施,使我们能够用一个不会造成与 Mythos Preview 相同级别风险的模型来改进和完善它们。
今天的公告是一项更长期工作的开始。要想成功,将需要来自整个技术行业及其他方面的广泛参与。
Project Glasswing 合作伙伴将获得访问 Claude Mythos Preview 的权限,以在其基础系统中寻找和修复漏洞或弱点——这些系统代表了世界共享网络攻击面的很大一部分。我们预计这项工作将专注于本地漏洞检测、二进制黑盒测试、端点安全和系统渗透测试等任务。
Anthropic 对 Project Glasswing 和其他参与者的 1 亿美元模型使用额度承诺将覆盖此研究预览期间的大量使用。之后,Claude Mythos Preview 将以 $25/$125 每百万输入/输出 token 的价格提供给参与者(参与者可以通过 Claude API、Amazon Bedrock、Google Cloud 的 Vertex AI 和 Microsoft Foundry 访问模型)。
除了我们对模型使用额度的承诺外,我们已向 Linux Foundation 下的 Alpha-Omega 和 OpenSSF 捐赠了 250 万美元,并向 Apache Software Foundation 捐赠了 150 万美元,以使开源软件的维护者能够应对这一变化的局面(对访问权限感兴趣的维护者可以通过 Claude for Open Source 计划申请)。
我们打算让这项工作的范围扩大并持续许多个月,并且我们将分享尽可能多的信息,以便其他组织可以将经验教训应用于自己的安全。合作伙伴将在他们能够的范围内相互分享信息和最佳实践;在 90 天内,Anthropic 将公开报告我们学到的东西,以及可以披露的已修复的漏洞和改进。我们还将与领先的安全组织合作,为网络安全实践应如何在 AI 时代演进制定一套实用建议。这可能包括:
漏洞披露流程;
软件更新流程;
开源和供应链安全;
软件开发生命周期和安全设计实践;
受监管行业的标准;
分流伸缩和自动化;以及
Anthropic 还与美国政府官员进行了关于 Claude Mythos Preview 及其网络攻击和防御能力的持续讨论。如我们上面所指出的,保护关键基础设施是民主国家的首要国家安全优先事项——这些网络能力的出现是美国及其盟国必须在 AI 技术中保持决定性领导地位的另一个原因。政府在帮助保持这一领导地位以及评估和缓解与 AI 模型相关的国家安全风险方面具有至关重要的作用。我们准备与地方、州和联邦代表合作以协助完成这些任务。
我们希望 Project Glasswing 可以在行业和公共部门开展更大规模的工作,各方都可以帮助解决关于强大模型对安全的影响的最大问题。我们邀请其他 AI 行业成员加入我们,帮助为行业制定标准。从中期来看,一个独立的、第三方机构——能够汇聚私营和公共部门组织的机构——可能是继续从事这些大规模网络安全项目工作的理想场所。
该项目以玻璃翼蝴蝶 Greta oto 的名字命名。这个比喻可以用两种方式应用:蝴蝶的透明翅膀让它能够隐身在众目睽睽之下,就像本帖讨论的漏洞一样;它们也使其能够躲避伤害——就像我们在我们方法中所倡导的透明度一样。
来自古希腊语"话语"或"叙事":文明用来理解世界的故事体系。
其合法工作受到这些保护措施影响的安全专业人员将能够申请即将推出的网络验证计划。