GPT-6 Astra 直接注入防御率达 99.99%,但将攻击代码隐藏在 AI 所读文档中时,破解率仍有 8.5%;Claude Opus 5 为 4.8%。
OpenAI 的新模型 GPT-6 Astra 幻觉率低于前任 GPT-5.6 Sol,且阻止了 99.99% 的直接提示词注入攻击。
Astra 在对抗越狱方面也更有效,但持续攻击者通过多轮对话仍能以约三分之一的几率获得问题回复。
对于隐藏在 AI 读取文档中的间接提示词注入,Astra 的失败率从 27% 降至 8.5%。这是一个重大改进,但仍然偏高。
OpenAI 的新模型 GPT-6 Astra 产生的幻觉更少,在阻止提示词注入攻击方面比其前辈更有效。但它仍然不够可靠,无法用于真正安全的 AI Agent 部署。
根据 OpenAI 的系统卡,新 Astra 模型比其前任 GPT-5.6 Sol 产生的 factual errors 少得多。OpenAI 使用用户标记为错误回答的 ChatGPT 对话进行测试,这意味着这些是特别容易出错的案例,其失败率不应被视为日常使用的典型表现。Astra 重现这些报告错误的频率低得多,最大的改进出现在低延迟设置和较低推理级别下。

对于直接提示词注入(用户试图通过自己的提示词操纵模型),Astra 达到了近乎完美的 99.99% 防御率。OpenAI 将此归功于其 GPT-Red 方法,该方法在训练过程中使用自动化攻击者来强化模型。
越狱抵抗力的表现类似。在针对已知攻击(试图提取有关生物学、暴力和网络安全的有害回复)的固定数据集测试中,Astra 在 91.5% 到 98.3% 的案例中拒绝提供帮助。
当攻击者在多轮对话中调整策略时,Astra 的防御率降至约 67%,这意味着持续的对抗者大约每三次尝试中就有一次可以诱导出至少一个问题回复。前代模型在同一测试中得分刚过 50%。OpenAI 指出,这些测试是在裸模型上运行的,没有使用随实际产品附带的生产安全层(如分类器)。
Astra 在间接提示词注入方面取得了进展,这是一种隐藏在 AI 读取的文档中的攻击。安全公司 Gray Swan 使用其 IPI Arena 中的 1,810 个精选攻击进行外部测试,发现在每个场景 15 次尝试的情况下,Astra 至少被破解一次的概率为 8.5%。GPT-5.6 Sol 的失败率为 27%。在同一评估中,Claude Opus 5 表现更好,为 4.8%,但它也并非免疫。

Gray Swan 合并 Q1 和 Q2 测试的实际数字实际上比早期结果有所上升。Anthropic 此前仅基于更简单的 Q1 测试单独报告了 2% 的攻击成功率,GPT-5.6 Sol 在该测试中也仅得 20%。Anthropic 还在所有模型上启用了扩展推理,这连同更广泛的测试范围,可能解释了差异。
即使这些是精心挑选的攻击,成功率也足以让任何企业安全团队感到担忧。Astra 大约每十二个场景就会被注入指令欺骗一次。Opus 5 表现更好,但也大约每二十一个场景失败一次。而风险正在增加。AI Agent 越来越多地自行编写代码、操作工具和控制计算机——这正是 Gray Swan 测试的内容。这些 Agent 也被构建为全天候大规模运行,而读取和处理文档是它们的核心工作之一。