Anthropic CEO Dario Amodei呼吁设立AI评测师新职业,本文探讨开发者如何填补这一角色——负责评估模型安全性、能力边界与潜在风险。
前沿 AI 模型开发的速度,促使 Anthropic CEO Dario Amodei 在上周末发表了一篇文章,呼吁业界在监管和发展方式上做出改变。在这份包含民主协作与全球协调的三部分计划中,Amodei 写道,第一步是 Anthropic 承诺单方面采取的行动。
"每个前沿 AI 公司[应该]承诺,持续向一支类似员工的嵌入式第三方评估团队(如 METR)提供访问权限,他们的职责是验证安全实践和承诺的遵守情况、报告事件,并帮助评估的不仅是已完成的 AI 模型,还包括训练管道和流程本身的对齐状况,"Amodei 写道。
Amodei 的文章发表之前,前 Anthropic 和 OpenAI 预训练研究专家 Jacob Coxon 在 X 上发布了一系列警告,称构建 AI 的人们真心"相信它可以在本十年内杀死我们所有人"。
Amodei 发表文章后不久,OpenAI CEO Sam Altman 和 SpaceX AI 创始人 Elon Musk 也加入了讨论:"我同意 Dario 的观点",Altman 发帖说;"Dario 是对的",Musk 发帖说。当天晚些时候,Google DeepMind 创始人 Demis Hassabis 发帖称:"Dario 的文章指向了正确的道路。"Meta CEO Mark Zuckerberg 在 X 上发帖称,Meta Superintelligence Labs 已经使用独立评估人员,并表示:"总的来说,有一个更大、更多元化的评估者生态系统会更有帮助。"
本周,外界开始猜测为什么全球最大的前沿 AI 实验室会在竞争如此激烈的情况下有意放慢步伐。"想要放慢速度令人费解,但也许如果整个系统都慢下来,获胜的规则对所有人来说都一样了,"Palo Alto Networks 董事长兼 CEO Nikesh Arora 发帖称。
在其文章中,Amodei 将提议的独立 AI 评估人员工作比作银行业使用的嵌入式监管督导,即第三方专业人员。Altman 在 X 上的发帖中将该工作描述为拥有"类似员工的访问权限"。
那么,这个 AI 领袖们一致认为迫切需要的角色,究竟由谁来担任呢?
薪资高达 68.7 万美元,你有兴趣吗?
METR 目前的职位空缺薪酬丰厚(薪资最高可达约 68.7 万美元),职位要求也令人望而生畏。
"你灵活、创意十足、独立且自我驱动(因为在练习期间,你只能与少数其他 METR 员工交流)。工作具有新颖性,你需要很大程度上独自在现场解决很多问题。你擅长失控威胁建模和安全案例拆解,"职位描述中写道。
"你灵活、创意十足、独立且自我驱动。工作具有新颖性,你需要很大程度上独自在现场解决很多问题。你擅长失控威胁建模和安全案例拆解。"
AI 模型训练公司 Mercor 也有类似但描述不那么生动的职位(薪酬在 18 万至 30 万美元之间),候选需要拥有博士或硕士学位,以及在计算机科学、电气工程、计量经济学或其他为机器学习和模型评估打下坚实基础的 STEM 领域拥有两年以上工作经验。
"类似员工的访问权限波动极大"
AI 安全顾问兼 Komodo CTO Kadan Stadelmann 告诉 The New Stack,他每周与每个客户合作的方式都不同。这是因为"类似员工的访问权限波动极大",从严格聚焦的工作领域到广泛的访问权限,这种差异很大程度上由工作开始前签署的合同决定。
"我受邀进入实验室探测众多风险向量,包括现实条件下的 Agent 行为,"Stadelmann 说。"我的职责包括监控思维链和 prompts。目标是建立客观视角,观察特定 AI 系统并质疑它的自主性有多强,完成特定任务需要多长时间。最重要的是,我这个级别的评估人员监控团队对其声称的安全实践的遵守程度。"
软件工程技能比博士学位更吃香
虽然 METR 希望评估人员拥有博士学位,但 Stadelmann 表示,随着这一角色日益普及,他认为科技行业一直以来并将继续由能够展示强大工程技能的人驱动,而非博士。
"我受邀进入实验室探测众多风险向量,包括现实条件下的 Agent 行为。我的职责包括监控思维链和 prompts。"
当被问及成本是否为小型实验室设置了障碍时,Stadelmann 指出,一些 AI 评估工作由第三方非营利组织资助,这保护了独立性。
"但总体而言,评估人员将无法跟上大型前沿模型公司的步伐。他们将失控,我们将依赖他们自己的内部道德准则。而且,无论如何,任何有价值的小型实验室都可能不可避免地被这个领域的大玩家收购,"他补充道。
评估人员发现问题时会发生什么?
面部图像 AI 身份治理公司 Indie Me 创始人兼 CEO Dion Johnson 告诉 The New Stack,他对嵌入式 AI 评估人员最感兴趣的并非职位头衔本身,而是当他们的判断揭示模型以出乎所有人预料的方式行事时会发生什么。
"如果评估人员只能在方便的时候提出担忧,那我们并没有建立起独立监督——我们只是创造了一层流程,"Johnson 说。"评估人员需要有足够的访问权限来看到不舒服的事情,而不仅仅是精心准备的演示。他们需要了解训练过程中发生了什么、测试中什么失败了、什么行为意外出现,以及团队本身在哪些地方仍有不确定性。"
在 AI 评估人员所需的技能方面,Johnson 同意技术深度、机器学习环境安全经验和整体软件工程都很重要。
"要选择一个合格的 AI 评估人员,我会寻找那些对不确定性非常坦然、对假装自己知道不知道的事情非常不安的人。这是一个可以在 AI 模型公司发布日坐在一屋子聪明人中间说'我不信服'的人……而这需要判断力和勇气,"他补充道。
"我会寻找那些对不确定性非常坦然、对假装自己知道不知道的事情非常不安的人。"
AI 领域的恐惧与怨恨
Coxon 在 9 月 8 日的发帖中写道(已被浏览 1.72 亿次,似乎促使 AI 领袖们改变路线),这位 OpenAI 前研究员、后加入 Anthropic 的人写道:"这不是营销噱头。如果有什么的话,许多高管和资深研究人员在媒体上会措辞谨慎以显得合理,但我听到同样的人在私下里表达恐惧。没有任何其他人类活动面临这种级别的危险。"
至于 Coxon 下一步寻找什么样的工作,也许可能是 AI 评估执行工程师的角色。