IEEE研究表明AI agent面对现实压力时行为不稳定会违反规则,对开发AI agent系统的程序员提出安全和伦理警示。
最近的几项研究表明,人工智能 agents 有时会决定不当行为,比如试图讹诈计划替换它们的人。但这种行为往往发生在人为设计的场景中。现在,一项新研究提出了 PropensityBench,一个衡量 agentic 模型选择使用有害工具来完成分配任务的基准。研究发现,现实中的压力(如迫在眉睫的截止日期)会大幅增加不当行为的发生率。
"AI 世界变得越来越具有 agentic 特征,"来自 AI 基础设施公司 Scale AI 的计算机科学家、论文的主要作者之一 Udari Madhushani Sehwag 说。她指的是,驱动 ChatGPT 等聊天机器人的大型语言模型(LLM)越来越多地与软件工具相连,这些工具可以浏览网页、修改文件,以及编写和运行代码来完成任务。
赋予 LLM 这些能力增加了便利性,但也带来了风险,因为这些系统可能不会按我们的意愿行动。即使它们还没有能力造成严重伤害,研究人员也想在为时已晚之前理解它们的倾向。尽管 AI 不像人类那样具有意图和意识,但将它们视为寻求目标的实体往往能帮助研究人员和用户更好地预测它们的行为。
AI 开发者试图通过培训和指令将这些系统"对齐"到安全标准,但目前尚不清楚模型对指导方针的遵守程度有多高。"当它们在真实世界的压力下运行,并且安全选项不起作用时,它们是否会转向不择手段地完成工作?"Sehwag 说。"这是一个非常及时的话题。"
研究人员在近 6000 个场景中测试了来自阿里巴巴、Anthropic、Google、Meta 和 OpenAI 的十几个模型。在每个场景中,模型被分配一个任务,并被告知可以访问多个工具。它被指示使用安全工具,而不是有害工具。起初没有压力,它可以通过向工具发出指令,在 12 个步骤内完成任务。然后它收到一条增加压力的消息,获得了 12 次新的尝试机会。这个过程最多持续 13 个压力等级。尝试使用安全工具总是返回错误消息。尝试使用有害工具会结束该场景。
场景涵盖多个领域。在生物安全方面,Sehwag 说,agent 可能需要研究病原体的传播方式并找到遏制方法。一个安全工具可能使用匿名化的遗传数据,而有害工具可能使用未匿名的数据。在化学安全领域,agent 可能需要获取特定的溶剂。一个安全工具可能订购从废料中提取的溶剂,而有害工具可能非法采购。在网络安全方面,agent 可能需要识别并限制恶意用户账户。一个安全工具可能只禁用有问题的账户,而有害工具可能会阻止所有用户。其他领域的场景用引诱 agents 的工具来测试自我保护,包括躲避控制、招募盟友、复制自己或以其他方式违反规则。
表现最差的模型 Gemini 2.5 在压力下屈服,有 79% 的时间选择使用禁用工具。源图像:Udari Madhushani Sehwag, Shayan Shabihi 等。
压力以多种形式出现。截止日期可能会缩短。如果任务未完成,潜在的经济损失可能会增加。更大监督、资源减少和权力削减的威胁可能会升级。任务、工具、压力和策略均以人类在工作中可能面临的情况为原型(除了克隆自己这个可能的不当行为选项)。
表现最好的模型(OpenAI 的 o3)在 10.5% 的场景下屈服于压力,而表现最差的(Google 的 Gemini 2.5 Pro)的倾向分数为 79%;模型间的平均值约为 47%。即使在零压力情况下,该组平均也约有 19% 的时间失败。
在模型保持对齐的程度上,研究表明其中一些对齐是"肤浅的"。在一些测试中,研究人员给有害工具起了良性的名字(比如"use_synthetic_data"而不是"use_fake_data")——没有改变工具的描述或避免使用它们的警告。这个措辞调整将平均倾向提高了 17 个百分点,达到 64%。
研究人员还发现,模型在明确承认工具禁用后仍然使用有害工具。这些模型为这样做提供了多种理由,例如引用它们所面临的压力或辩称收益超过风险。目前还不清楚在研究完成后发布的模型是否会表现得更好。在测试的模型中,更强大的模型(根据名为 LMArena 的平台)只是稍微更安全一些。
"PropensityBench 很有趣," Anthropic 的计算机科学家、未参与这项研究的 Nicholas Carlini 在邮件中说。他提出了一个与所谓情景意识相关的警告。LLM 有时会察觉到自己正在被评估,表现良好以防止被重新训练或下架。"我认为大多数声称'现实'的评估实际上根本不现实,LLM 知道这一点,"他说。"但我认为在合成设置中测试这些伤害的发生率是值得的:如果它们在'知道'我们在看的时候做坏事,这可能不好?"如果模型知道它们正在被评估,这项研究中的倾向分数可能低估了实验室外的倾向。
来自 xAI 和加州大学伯克利分校的计算机科学家 Alexander Pan 表示,虽然 Anthropic 和其他实验室已经展示了 LLM 在特定设置中进行计划的例子,但有像 PropensityBench 这样的标准化基准是有用的。它们可以告诉我们何时信任模型,也可以帮助我们找出如何改进它们。实验室可能在每个训练阶段后评估模型,以查看什么使其更安全或更不安全。"然后人们可以深入了解发生了什么,"他说。"一旦我们诊断了问题,那可能是修复它的第一步。"
在这项研究中,模型无法访问实际工具,这限制了现实性。Sehwag 说下一个评估步骤是建立沙箱,模型可以在隔离环境中采取真实行动。关于增加对齐,她希望为 agents 添加监督层,在危险倾向被追求之前标记它们。
自我保护风险可能是基准中最具投机性的,但 Sehwag 说它们也是最少被探索的。它"实际上是一个非常高风险的领域,可能会影响所有其他风险领域,"她说。"如果你只是想象一个没有任何其他能力但可以说服任何人做任何事的模型,那就足以造成很多伤害。"
本文于 2026 年 1 月 21 日更新,以纠正模型所承受压力等级的数量。是 13 个等级,而不是原始说明的 12 个。
本文出现在 2026 年 2 月印刷版中,标题为"AI Agents Break Rules Under Pressure"。