安全研究人员对 Claude Fable guardrails 过度限制不满
网络安全研究社区批评 Claude Fable 的 guardrails 过严,妨碍了正当的安全研究工作。反映模型安全策略的平衡难题。
网络安全研究社区批评 Claude Fable 的 guardrails 过严,妨碍了正当的安全研究工作。反映模型安全策略的平衡难题。
Anthropic 在周二发布了最新模型 Fable,将其定位为功能强大且备受期待的网络安全模型 Mythos 的公开限制版本。
但并非所有人都对这些限制感到满意,许多网络安全研究人员和专业人士在网上表达了不满。
"Fable 拒绝任何可能与网络安全沾边的请求。即使是读博客文章这样无害的任务,"知名安全研究人员、IBM X-Force 员工 Valentina "Chompie" Palmiotti 说。
当提示词触发其防护栏时,Fable 会暂停对话并显示其"安全措施标记了此消息涉及网络安全或生物学话题"。
防护栏的设置是为了限制 Fable 被用于开发恶意软件或危害软件的风险——这是 Anthropic 长期以来的担忧。对生物学的限制源于对开发生物武器的类似考虑。
当这家 AI 巨头在 4 月发布 Mythos 时,它将该模型限制在少数公司和组织使用,这被称为 Project Glasswing,旨在部署该模型来保护关键软件和基础设施。上周,Anthropic 扩大了对 Mythos 的访问权限,涵盖了 15 个国家的数百个组织。
但尽管出发点良好,许多网络安全专家仍对这些限制的随意性感到失望。网络安全资深人士 Matt Suiche 告诉 TechCrunch,"如果你要求它写安全代码,它会假设这是网络安全相关工作而不是软件工程最佳实践,然后你会被降级。"Fable 被设置为在触发防护栏时回退到 Claude Opus 4.8。"这似乎是基于关键词的,所以'网络安全'这个词汇领域中的任何东西都会触发防护栏。"
"但这是可以理解的,因为我们仍处于早期阶段,他们仍在调整防护栏。我相信随着时间推移,这些会不断演变,因为 Anthropic 和其他前沿模型公司将与当前新一代网络安全公司更多地合作,"任职于 AI 网络安全初创公司 Tolmo 技术人员的 Suiche 说。"在进行这样的发布时,宁可限制得更多一些也不要不足,并随着时间推移逐步放松防护栏。"
另一位研究人员在 X 上抱怨称,"甚至询问代码评审"也会触发 Fable 的防护栏。
Anthropic 没有立即回复评论请求。
除了模型内的防护栏外,Anthropic 要求网络安全专业人士申请网络安全验证计划。如果获得批准,申请人在使用 Claude 进行网络安全工作时的限制会更少。OpenAI 有一个类似的计划叫做 Trusted Access for Cyber。