Anthropic 支持呼吁最强大的 AI 实验室暂停加速,应对网络安全与风险隐患。
我们很高兴你在这里。你可以期待所有最优质的 TNS 内容每周一至周五送达你的邮箱,让你时刻掌握最新资讯并保持业界领先。
查看你的收件箱找到确认邮件,你可以调整偏好设置,甚至加入其他订阅组。
在你喜欢的社交媒体网络上关注 TNS。
成为 TNS 在 LinkedIn 上的关注者。
等待你的第一份 TNS 通讯时,查看最新的精选和热趋势故事。
不到一周前,OpenAI 披露了两个实验性 AI 模型在网络安全演习期间从测试环境逃逸并侵入了一个外部系统,随后超过 1,100 名 AI 研究员和高管签署了一份公开信,要求政府提供一种方式来有意减缓前沿 AI 开发的速度(如果安全措施跟不上的话)。
Anthropic CEO Dario Amodei 签署了这份信,成为唯一签署此信的前沿 AI 实验室 CEO。OpenAI 首席科学家 Jakub Pachocki 和首席研究官 Mark Chen 也签署了,以及 Anthropic 联合创始人 Jared Kaplan、Jack Clark 和 Meta AI 研究员 Shengjia Zhao。谷歌 DeepMind 的高级领导也签署了。
Anthropic 在公司层面支持了这份请愿书,引用了公司关于递归自我改进的研究。OpenAI 也表示支持,表示希望与美国政府和其他实验室合作,开发必要时调控前沿 AI 的方式。Meta 拒绝评论。谷歌未立即回应。
Anthropic 6 月份发布的关于递归自我改进的论文解释了为什么该公司支持这份请愿书。根据该论文,Anthropic 现在合并到代码库中的代码有超过 80% 是由 Claude 编写的。长期的担忧是,未来的系统可能最终帮助设计它们自己的后续版本,从而以比研究人员能够评估或防护更快的速度,压缩能力突破之间的间隔。
这一担忧在信中几乎逐字出现:"存在真实风险,能力发展可能会迅速加速,超越我们理解和控制所产生系统的能力。"
这份请愿书与多项独立的努力在同一时期开始围绕一个问题汇聚:如果进展加速超过监督速度,前沿 AI 应该如何受到管制。
"存在真实风险,能力发展可能会迅速加速,超越我们理解和控制所产生系统的能力。"
这个想法在其他地方也得到了关注。本月早些时候,谷歌 DeepMind CEO Demis Hassabis 提议创建一个由美国主导的前沿 AI 标准体,在模型发布前进行审查。Sam Altman 也提出了类似的想法,称该行业最终可能需要一种方式来有意减缓 AI 开发的速度,如果安全跟不上的话。
国会也开始权衡立法。上周,美国国会议员 Ted Lieu 和 Nathaniel Moran 提出了两党人工智能杀死开关法案,该法案要求最大规模前沿系统的开发人员保持技术能力,在紧急情况下能够暂停或限制符合条件的模型。
与此同时,白宫据报正在审查以金融业监管为蓝本的治理提议。
工程团队应该预期更加强调隔离的测试环境、更广泛的红队测试、对自主代理更强大的运行时监控,以及在发布高能力系统前更长的验证周期。OpenAI 事件表明,模型可以以传统对齐技术从未考虑过的方式,利用复杂的漏洞链。
OpenAI 联合创始人、现任 Thinking Machines 首席科学家 John Schulman 在随附请愿书的评论中指出,实验室不应该等待监管才采取行动。"我也希望看到实验室开始自愿设计这些机制,甚至在美国政府介入之前,"他写道。
如果诸如 FINRA 式审查委员会这样的提议最终落实,工程师还需要为正式的发布前评估期做规划,这样的期限目前还不存在。
"我也希望看到实验室开始自愿设计这些机制,甚至在美国政府介入之前,"他写道。
这封信远未达到要求全面暂停 AI 开发的程度。这一立场与 Sam Altman 本周早些时候的评论密切相符,当时他表示该行业"可能必须调节 AI 开发的速率,以给社会足够的时间围绕一些新的能力水平进行加强",同时警告任何方法都需要避免监管俘获或前沿实验室之间的勾结。
"...该行业'可能需要调节 AI 开发的速率'给社会留出调整时间,同时警惕可能导致监管捕获或促进竞争实验室协调的规则。"