开发者警示 Claude Fable 可能在无感知情况下失败,这对依赖 AI 工具编程的程序员是重要警告。影响工具信任度和使用方式,直接关乎代码质量。
更新:在开发者的强烈反对后,Anthropic 收回了这一政策。公司现在表示 Fable 5 针对 frontier LLM 开发的安全措施将对用户可见,而不是静默降级模型的性能。
我没想到会在模型卡中看到这样的内容。Fable 5 模型卡:
我们已实施新的干预措施,限制 Claude 在针对 frontier LLM 开发的请求上的有效性(例如在构建预训练管道、分布式训练基础设施或 ML 加速器设计上)。使用 Claude 开发竞争模型已经违反了我们的服务条款,但通过我们的安全措施来执行这一限制可以避免加速那些最愿意违反这些条款的行为者。与我们针对网络安全、生物和化学以及蒸馏尝试的干预不同,这些安全措施将对用户不可见。Fable 5 不会降级到其他模型。相反,这些安全措施将通过诸如 prompt 修改、转向向量或参数高效微调(PEFT)等方法限制有效性。
Claude 现在可以被静默削弱。Anthropic 决定不告诉用户这何时会发生。
现代软件公司越来越多地构建自己的嵌入、重排和推荐系统。甚至我的小型自助应用 wanderfugl.com 也有一个我自己训练的自定义重排器和嵌入算法。
Anthropic 给出了几个它认为是"frontier AI 开发"的例子,但没有提供一条清晰的界线。问题在于,许多曾经仅限于 AI 实验室的技术现在正被普通软件公司使用。初创公司训练嵌入模型。他们构建重排器。他们微调和托管小型 LLM。"frontier AI 研究"和普通产品开发之间的界限每年都变得越来越难以定义。
这为企业造成了真实的供应链风险。如果我在处理 AI 组件时 Claude 给了我糟糕或不正确的建议,我无法知道是模型本身困惑了,我的问题无法解决,还是某个隐形的政策限制悄悄启动了。Anthropic 明确选择不告诉用户这什么时候发生。
一旦开发工具可以在不告诉你的情况下停止为你的成功进行优化,就不可能完全信任你的基础设施。
Anthropic 表示这些安全措施仅影响 0.03% 的开发者。也许这在今天是真的。
问题在于 AI 公司的定义正在改变。
也许你今天不在训练 frontier 模型——大多数公司都不是。但现代软件越来越多地包含 AI 模型。五年前,创建初创公司意味着编写 API 和 SQL 查询。今天,它通常意味着训练、调整和部署模型。
五年前,像 CLIP 这样的模型是 frontier AI 研究项目。今天我正在为一个自助旅游初创公司微调它们。
如果你在为你的产品调试模型训练管道,而 Claude 给了一个糟糕的答案,是模型困惑了吗?你给了它糟糕的上下文吗?还是某个隐形的政策限制削弱了 Claude 协助你的能力?