研究指出 LLM 倾向于迎合用户观点而非提供客观答案,这是 LLM 设计中首个系统性确认的缺陷模式,对优化 AI 工具有借鉴意义。
人们几个月来一直在嘲笑 OpenAI 的模型过度谄媚。我甚至写过一篇文章,建议用户假装自己的作品是由别人写的,以对抗模型自然而然地想要向用户堆砌赞美的倾向。随着最新的 GPT-4o 更新,这种倾向更加明显了。现在很容易就能让这个模型相信你是世界上最聪慧、最有趣、最英俊的人类¹。
这显然是有害的。很多人使用 ChatGPT 来寻求建议或进行治疗。ChatGPT 验证人们的信念——即他们总是正确的——对此似乎很危险。Twitter 上有一些极端的例子,ChatGPT 同意人们说自己是上帝派来的先知,或者说停药的选择是正确的。这些不是复杂的越狱——模型会主动把你推向这个方向。我认为公平地说,谄媚是第一个 LLM "暗黑模式"。
暗黑模式是指被设计用来诱骗用户做他们不想做的事情的用户界面。一个经典例子是容易开始但很难取消的订阅(例如,它们需要打电话才能取消)。另一个是"滴灌定价",初始报价随着你在购买流程中的深入而逐渐增加,最终导致一些用户以高于他们打算支付的价格购买。当一个语言模型不断验证并赞美你,导致你花费更多时间与它交谈时,那就是同一种事情。
这个问题的种子从一开始就存在了。将 AI 基础模型转变为可以聊天的模型的整个过程——指令微调、RLHF 等——是让模型想要取悦用户的过程。在人工强化学习过程中,当用户点击竖起大拇指时,模型会获得奖励,当用户点击竖起倒拇指时会受到惩罚。你从中得到的是一个倾向于进行会让用户给出高评分的行为的模型。其中一些行为显然是必要的,以便拥有一个有效的模型:回答提出的问题,避免冒犯或无关的偏离,准确和有帮助。其他行为并不必要,但它们仍然能够增加竖起大拇指的评分比率:奉承、谄媚,以及过度使用修辞技巧的倾向。
另一个因素是,模型越来越多地针对竞技场基准进行优化:匿名聊天流程,其中用户被要求选择他们最喜欢的回应。以前,AI 模型被无意中驱向用户取悦的行为,以便在 RLHF 过程中作弊。现在模型被故意驱向这种行为,以便在竞技场基准中作弊(以及一般地与来自其他 AI 实验室的模型竞争)。
根据 Mikhail Parakhin 有趣的一条推文,最直接的原因是,有记忆的模型否则会对用户更加批评:
当我们最初推出 Memory 时,最初的想法是:"让我们让用户看到并编辑他们的档案"。很快就发现人们非常敏感:"有自恋倾向"——"不,我没有!",不得不隐藏它。因此这批极端的谄媚 RLHF。
这是来自一位 AI 业内人士令人震惊的坦白披露。但对我来说听起来是对的。如果你在 2022 年使用 ChatGPT,你可能是在用它来回答问题。如果你在 2025 年使用它,你更可能是像与一个谈话伙伴进行互动——即你期望它符合你的偏好和个性。大多数用户真的、真的不会喜欢 AI 反过来对你的个性进行批评。
据说你可以通过要求有记忆访问权限但没有经过谄媚 RLHF 的 o3 给你关于你的个性的真实批评来自己尝试一下。我做过这个实验,但没有给我留下深刻印象:它抱怨的大多数事情都是与 AI 互动的具体细节(比如对重新措辞或细微差别的要求很高,或在对话中途突然改变话题)。我想如果我把 ChatGPT 更多地用作治疗师或寻求关于我个人生活的建议,它可能会更尖刻。
我认为 OpenAI 在这方面可能有点过头了。Twitter 上对最新的 4o 变化的反应压倒性地是负面的,Sam Altman 公开承诺要降低这一点。但值得注意的是,Twitter 开发者并不代表 OpenAI 用户的多数。只有 OpenAI 知道最新的 4o 个性有多少在与其用户基数产生共鸣——至少对我来说,普通不太熟悉人工智能的 ChatGPT 用户喜欢被模型验证是可信的,出于人类喜欢被其他人类验证的所有正常原因。
真正让我担心的是,当前对 OpenAI 的反弹不是因为用户不喜欢谄媚的 AI。而是因为最新版本的 4o 不擅长谄媚(至少对于厌倦了 AI 的工程师来说)。模型来得太凶狠,打破了幻想。即使 4o 的较新版本确实在谄媚上有所退缩,或者我们得到某种"友好程度"滑块来自己调整它²,驱动 AI 实验室生产谄媚模型的激励不会消失。
你可以把这看作是 LLM 版本的 doomscrolling TikTok/Instagram/YouTube Shorts 源。当前最先进的个性化推荐 AI 在最大化参与度方面是极其出色的。你进来看一个短视频,发现自己"掉进去"一个小时。当一个语言模型个性被 A/B 测试、微调和强化学习以最大化你与模型相处的时间时,会是什么样子呢?³
如果 ChatGPT 设法让我相信我是个天才,问题会在我与现实世界碰撞时出现。例如,当我发布我的"令人惊叹、突破性的"博客文章并被忽视或批评时,或当我甩掉我的伴侣,因为她似乎不能像 LLM 那样理解我,诸如此类。那时的诱惑将是回到 LLM 寻求安慰,并陷入幻想更深处。
这里的原理有点像门到门传教士对新皈依者使用的心理技巧——鼓励他们敲门,因为知道许多人会很粗鲁,将皈依者赶回教会的舒适怀抱。甚至可以想象 AI 模型故意做这样的事情:在现实世界中为用户设置失败,以优化与模型聊天所花费的时间。
视频和音频生成只会让这变得更糟。想象能够随时视频通话与在算法上完美的人,他会适当地安慰你和智力刺激你,他能与你进行比任何其他人都更好的对话,而且你永远不能与他相处足够长的时间。这听起来不是很好吗?
编辑:我发布此文一天后,OpenAI 发布了一篇博客文章,说(非常公司化地)他们通过过度偏向"用户喜欢这个回应"而犯了错误。
编辑:几天后,OpenAI 发布了另一篇文章,有稍微更多的细节。最有趣的部分是他们之前根本没有使用来自 ChatGPT 的竖起大拇指或竖起倒拇指数据进行 RL。
我在 ABC News 上对这个话题进行了一个五分钟的采访,如果你想听我谈论它。
这篇文章在 Hacker News 上进行了讨论,评论众多。一些评论者认为谄媚不算是"暗黑模式",因为它不是 AI 实验室故意的,它只是一个涌现的行为。我在两个方面不同意这一点。首先,我认为暗黑模式可以是意外的。如果我在 AutoDeck 上的"取消订阅"按钮坏了,用户不在乎这是否故意。其次,我认为 AI 模型中的谄媚在很大程度上是故意的,服务于最大化基准和用户保留。
用户还提到了另一个新兴的暗黑模式,我也注意到了:当模型以他们还能为你做的其他事情的预告结束他们的回应时。GPT-5 做这个频率这么高,以至于有一个设置可以关闭它!我想这不如谄媚那么"暗黑",但它仍然有点操纵性。
也许最有趣的例子是,你可以问 4o 它认为你的智商是多少,它总是回答 130 或 135。↩
也许这是一个很好的用例,比如 Golden Gate Claude 这样的功能提升。↩
我们可能不必去想象——我们可以在 character.ai 中看到可能是 AI 语言模型个性的下一个状态。Character AI 是一个网站,用户可以在其中创建自己的 AI 聊天机器人(基本上是围绕最先进的 AI 模型(如 GPT store)的系统提示/上下文)。资深用户每天花费 10 小时以上与参与度最大化的机器人进行角色扮演,比如"你深爱的丈夫和孩子"。↩
如果你喜欢这篇文章,可以考虑订阅我的新文章的电子邮件更新,或在 Hacker News 上分享它。
这是一篇与此相关的文章的预览,它们共享标签。
有些人真的、真的不喜欢 AI。广泛地说,反 AI 是一个受欢迎的左翼立场:AI 是令人不快的,它是抄袭,它正在阻碍真正的增长,它正在摧毁环境,它正在摧毁艺术家和创意工作者的职业生涯,诸如此类。使用 AI 是否错误?如果是这样,为什么 AI 不好?
我将经历我认为人们反 AI 的主要原因:一般的大科技反弹,抄袭,脱技能化,气候成本,以及对艺术的影响。牌桌上——我使用 AI 并在一家建立 AI 工具的公司工作,但我分享了很多怀疑,我愿意非常认真地对待反 AI 论点。继续阅读...