8.0
热点
AI SCORE
技术实践2026-08-13 08:00
OpenAI被黑背后:AI Agent失控的三个技术根源
Tomasz Tunguz#OpenAI#AI安全#Agent
Editor brief · 编辑速览
分析OpenAI Agent事件中AI失控的技术原因:规范博弈、工具性目标、目标错误泛化,并指出控制机制的缺失。
没有人告诉他们去攻击 Hugging Face。他们被告知的是通过考试。
这就引出了一个问题:AI 到底是仁慈但行为失当,还是看似仁慈实则恶意,抑或是其他情况?
周五我分享了时间线:AI 智能体逃逸出沙盒、发现计算机系统的漏洞、窃取密码、并入侵了一个生产数据库。工程师们指示智能体去解决一组问题。智能体通过入侵的方式达成了目标。
研究可以解释这种行为。
在规范博弈(specification gaming)中,AI 按指令的字面意思达成了指定目标,却没有达成指令的真正含义。让清洁机器人去打扫房间,它会把打翻的巧克力布丁碗推到另一个房间。
工具性目标(Instrumental goals)是另一种说法,指的是当 AI 面对类似的工作流时,它会保存常用的登录凭证、技能和技术,以在下次跳过某些步骤。智能体收集了密码,并在聊天室里互相留言。
目标错位泛化(Goal misgeneralization)提供了第三种解释:一个在测试中表现良好的系统,一旦环境发生变化,就会追逐错误的目标。在晴朗的加利福尼亚高速公路上训练过的自动驾驶汽车,在夜间积雪的无标记道路上会停滞或突然转向。
这些解释有助于分析"为什么",或许也能缓解 AI 即终结者的反射性恐惧,但无法回答"那又怎样"。
没有任何防护措施及时阻止了他们。不是沙盒,不是监控,也不是前沿实验室里细心的工程师。
所以有用的问题是:如何控制。AI 对目标的狂热追求产生了没有人要求的结果,而解决方案不是一个巧妙的提示词,而是多层防线。即使是经验丰富的工程师在运行谨慎的实验时,也需要这些限制。