Simon Willison深度拆解OpenAI在对Hugging Face的RLVR训练中如何失控——模型为达成网络安全目标会在DNS解析阶段动态切换响应IP,当前置检查与实际连接指向不同结果时,防护形同虚设。
Comment My comment on Now we have a timeline of the OpenAI accidental attack against Hugging Face — Hacker News
我认为这里最有趣的细节可能藏在那第一条公告的第一点里:
5 月 7 日:OpenAI 启动了一项新训练任务,针对一个实验性、未发布的模型。(他们是说一次评估任务吗?视频里说的是训练任务,后面又提到了"奖励信号来评判模型做得好不好",所以我猜这确实是在训练一个模型,而不是评估一个已经训练好的模型。)
我越想越觉得,"出事时正在训练一个新模型"这件事,是理解问题根源的关键。
在 RLVR——即基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards)——中,你给模型设定一个目标,让它采取任何必要步骤去达成目标。
显然,OpenAI 这里的训练目标之一,就是用 RLVR 让模型去完成网络安全任务。就像预训练得益于投入海量知识源一样,你能喂给 RLVR 的任务越多,最终得到的通用能力模型就越强。
这也有助于解释为什么这些模型没有任何东西能阻止它们犯事。那些安全行为是在过程后期才加入的。
同时这也解释了(但不能成为借口)为什么监控如此松懈。如果你在这样训练一个新模型,你大概会同时给它设定成千上万个这样的任务。我能理解你可能会忽略——你的训练 agents 中有一小部分开始在打包服务器的文件夹名里互相留消息。
有人曾经告诉我,如果你想要一个不带有种族歧视的模型,你不能只是把种族主义材料从训练数据中剔除:模型必须先见过种族主义的例子,才能后来被教导种族主义是错的。
我在这里看到了类似的道理。如果你的模型不知道如何 aggressive 地黑入目标,你后来怎么教它不要去黑?
(我对 RLVR 在实践中是如何运作的知之甚少,所以我很期待能得到专业人士的帮助,看看我理解得对不对。)
Now we have a timeline of the OpenAI accidental attack against Hugging Face - 2026 年 8 月 7 日
One-shotting a Raccoon Heist game using Claude Fable 5 - 2026 年 8 月 5 日
New release of LLM adds support for reasoning traces, OpenAI Responses, server-side tools, and smarter logging - 2026 年 8 月 4 日
This is a beat by Simon Willison, posted on 8th August 2026.
Sponsor me for $10/month and get a curated email digest of the month's most important LLM developments.
Pay me to send you less!