大模型在人类身上观察到的问题
分析LLM存在的局限和问题。讨论热度中等,标题新颖但缺乏具体信息。
分析LLM存在的局限和问题。讨论热度中等,标题新颖但缺乏具体信息。
虽然有些人仍在讨论为什么计算机永远无法通过图灵测试,我却发现自己反复面临这样一个现象:随着模型的改进和人类的停滞,这个测试的标准会不断提高,最终人类自己都无法通过这个测试。以下是一份清单,列出曾经是 LLM 失败模式的现象,但如今与人类交流时更常见到:
这在对话中一直是个问题:你提出一个看似简短的有限问题,作为回应却不得不听大约几小时的语无伦次的唠叨。尽管已经耗尽了人们对这个话题的知识储备,他们仍会继续谈论你完全不感兴趣的东西。我发现自己在寻找"停止生成"按钮,才记起我唯一能做的就是暗示,或者粗鲁地走开。
一次好的深度对话最精妙的地方在于对方真正理解了你:你解释一个你所处的复杂情况,他们的回复中能产生共鸣。至少在与最新的大型模型聊天时会如此。但当向有限的人脑施加同样的提示——一个相当长的提示——一次又一次,提示中的信息不知何故会消失,他们的注意力漂移,你必须重复关键的事实。在这种情况下,我的第一反应是看看是否有办法付费升级到更大的模型,随后才想起人脑无法升级。你最多能做的就是给他们一个好的睡眠,然后他们可能会从"快速"模式切换到"思考"模式,但这对所有人都不能保证。
我兴趣广泛,在任何给定的一天,我可能兴奋地讨论各种话题,从内核到音乐再到文化和宗教。我知道我可以针对今天的任何领先模型编写一个提示,基本上保证能得到对感兴趣话题的全新视角。但当我向人提出同样的提示,往往得到的是礼貌的点头,伴随着明显的迹象表明他们在想别的东西,或者也许只是对提示本身的总结,或关于事物应该如何的模糊笼统的陈述。实际上,找到理解我意思的人是如此罕见,以至于感觉像是一个神奇的时刻。随着真正优秀的模型——教育程度好的模型——的增加,通过 AI 找到一个具有良好共同知识基础的对话伙伴已变得微不足道。这对我对认识新人的兴趣来说不是好兆头。
参数较少或上下文窗口较小的模型似乎很难从错误中学习。这对人类来说不应该是个问题:我们拥有跨越数十年的长期记忆能力,伴随着对最关键记忆的情感强化。然而,太经常发生的是我必须在同一对话中一次又一次地指出同样的逻辑谬误!当然,我想如果我指出推理中的错误,这应该是一个重要的纠正,大脑应该立即利用?事实证明,神经连接重新连接的速度似乎存在某种基本限制。与能够立即利用额外信息的最新模型聊天,已经恶化了我对必须重复自己的耐心。
到这一点,可以解释在某个给定情况下会发生什么,并观察模型将所学教训应用到类似情况中。人类则不然。当我指出相同的原理适用于其他地方时,他们的回应会在光谱的某个位置,一端是完全困惑,另一端是自我保护的解释,即这个比较不适用"因为它是不同的"。比较的整个目的是在不同情况中应用相同的原理,那么这个借口从何而来?我已经学会了用 AI 进行这样的讨论,而不麻烦别人。
这是相反的问题:给定用一般术语陈述的原理,这个人无法在具体情况中应用它。实际上,我一生中一直在观察这个失败模式在我自己身上的表现:给定物理定律,这通常"显而易见"且容易理解,我发现计算下一次日食前需要多长时间非常困难。越来越多时候,与其自己深思这些事情,我宁愿快速发送一个提示给最新的大型模型,并在几秒内收到一个好答案。换句话说,模型的威胁不仅要让我远离其他有缺陷的人类,还要让我远离我自己的"缓慢"思维!
从医学意义上理解,幻觉指的是当某些东西看起来是真实的,即使你很清楚它不是。由于对模型"内部心理生活"没有直接的洞察,我们声称他们吐出的每一个错误事实都是一种幻觉。这个词的含义正在从医学意义转向"就是错了,而且持续地错"的方向。这已经困扰人类言论数个世纪。作为一个方便的例子,查一下科学倡导者和宗教倡导者之间的某些激烈辩论。(好像两者需要冲突似的!)当模型表现出幻觉时,通常提供更多背景和证据会消除它,但同样的技巧似乎对人类不太有效。
一个结论是 LLMs 正在破坏人们彼此之间的联系,就像十年前社交网络威胁通过用更浅薄的、模拟的版本替代它来摧毁它一样。另一种解释是愤世嫉俗地得出结论,现在是时候让人类要么被强化,要么被更强大的智能形式所替代。我认为我们还不完全到那里,但某种程度上替代已经有所进展:我再也不会要求人类编写短于大约一千行的计算机程序,因为 LLM 会做得更好。
实际上,我为什么还要写这个?我问了 GPT-5 关于额外的失败模式的问题,发现的额外例子比我从人类那里获得的要多得多:
除了已经讨论的失败模式外,人类也表现出几种较新的 LLM 病理的类似物:对话经常遭受指令漂移,其中原始目标在社交动力接管时悄悄衰减;模式崩溃,即人们回到一小套安全的陈词滥调和对话模板中;以及奖励黑客,在这种情况下优化社会认可或和谐而牺牲真实性或有用性。人类经常过度拟合提示,响应字面措辞而非潜在意图,并表现出安全过度拒绝,拒绝参与合理问题以避免社会或声誉风险。推理也以轮次间的不一致为标记,矛盾未被注意,以及温度不稳定性,其中疲劳、情绪或观众会从一个时刻到下一个时刻戏剧性地改变思维的质量和风格。