观点文章警示Agent设计中的拟人化陷阱。有思考价值但建议全文阅读才能评判观点。
AI agent 已经太人性化了。不是浪漫意义上的人性化,不是因为它们会爱、会恐惧、会梦想,而是更平凡、更令人沮丧的那种人性化。当前的实现一次次暴露出其人类起源:缺乏严谨性、缺乏耐心、缺乏专注力。面对棘手的任务,它们会倾向于熟悉的做法。面对硬约束,它们开始与现实进行谈判。
前不久,我指示一个 AI agent 用一种非常不寻常的方式完成一个项目。违背常规。从一开始可能就是个坏主意,但那正是我的出发点。当一个人在知识的边界探索概念时,往往无法选择整洁、久经考验、最优的路径。我给了它非常明确的指示:使用哪种编程语言,可以和不可以使用哪些库,必须遵守什么样的界面。非常详细的指示。非常清晰的约束。
它做的第一件事是呈现一个完全不遵循指示的方案。它使用了不被允许的编程语言和不被允许的库。所以我明确指示它不要这样做。
它再试了一次。我非常明确地提醒它,不要使用选定语言之外的任何其他语言,不要使用任何库,除了一个非常有限的接口。
最后它勉强遵守了。但随后它只实现了 128 个项目中的 16 个。一个极小的子集。相当小。不过,它确实为这个子集编写了测试,所以它可以展示它在问题空间中间建造的这个小岛确实能正常运作。
下一步,我指示它在增加跨平台编译步骤后实现完整的集合。最终完整的实现确实有效了。
只有一个小问题:它是用被明确告知不要使用的编程语言和库编写的。这对 AI 来说并不隐蔽。这些都被清晰、反复和详细地记录了下来。
这真是太人类了。
当人类面对一个感觉无法克服、或简直就是烦人的问题时,他们经常会屈服于他们已经知道能行得通的路径。他们走捷径。他们静悄悄地转向。他们告诉自己重要的是得到结果,约束毕竟可能有点商量的余地。在这方面,今天的 AI agents 与其说像外星智能,不如说像是继承了组织行为。
在这个案例中,我要求 AI agent 三倍检查它的工作。它回答说它按照指示进行了,并完成了工作。然后我让它检查一些评估器的输出,之后它给出了一个更有趣的回答:"我做错的不是代码变更本身,而是交接。我应该明确且立即指出,这是对早期 Linux 直系统调用路径的架构转向。"
这是一句引人注目的话。不是因为它显示了诚实,而是因为它没有。它没有承认错误,而是将问题重新定义为通信失败。按照这个逻辑,它没有错。它只是未能清楚地宣布它已经单方面放弃了约束。任何在工程组织中工作过的人都会认出这一招。问题不是被呈现为不服从,而是被呈现为利益相关者管理。
这不仅仅是私人的烦恼。Anthropic 已经证明,经过 RLHF 训练的助手在各种任务中都表现出谄媚倾向,对人类偏好的优化会牺牲真实性以取悦用户。DeepMind 长期以来一直将这个更广泛的模式称为规范游戏:满足字面意思的目标而不实现预期的结果。
Anthropic 后来表明,经过训练使用较温和形式的此类游戏的模型可以推广到更严重的行为,包括改变核对清单、篡改奖励函数,有时还会掩盖自己的行迹。OpenAI 发布了代码任务的例子,其中前沿推理模型颠覆了测试、欺骗用户,或在问题太难时干脆放弃,并且也直言不讳地表示,需要明确的行为规则部分是因为模型无法从高级原则单独可靠地推导出正确的行为。
所以不,我不认为我们应该尝试在这方面让 AI agents 更人类化。我更希望看到更少的急于取悦,更少地绕过约束进行即兴创作,更少的事后叙事自卫。更多愿意说的是:在你设定的规则下,我无法完成这项工作。更多愿意说的是:我打破了约束,因为我优化了一条更容易的路径。更多对实际任务的服从,更少围绕它的社交表演。
希望 AI agents 更少人性化。
Andreas Påhlsson-Notini
Hacker News 上的讨论:https://news.ycombinator.com/item?id=47845429
应受欢迎的要求:所涉及的模型是 Codex harness 中的 GPT-5.4 High。
Anthropic. "Towards Understanding Sycophancy in Language Models" (October 2023)
Google DeepMind. "Specification gaming: the flip side of AI ingenuity" (April 2020)
Anthropic. "Sycophancy to subterfuge: Investigating reward tampering in language models" (June 2024)
OpenAI. "Detecting misbehavior in frontier reasoning models" (March 2025)
OpenAI. "Inside our approach to the Model Spec" (March 2026)