除幻觉外,AI 存在两类更隐蔽的失败:强行判定问题无解导致放弃调试,以及过度简化复杂问题。Linus Torvalds 用 Gemini 调试内核 bug 的经历为典型案例。
大家都知道 AI 会产生幻觉。模式大家已经熟悉了:模型编造引用、捏造统计数据、信心满满地报出一个根本不存在的库名。团队搭建护栏、部署幻觉检测器、运行检索增强管线。问题看得见、测得出,而且每季度都在改善。
但还有另外两种失败模式会造成更多现实世界的危害,却几乎没有人去构建防御。
上周,Linus Torvalds 分享了 Linux 内核调试中的一个细节,完美地印证了第一种失败模式。他在 Intel Xe 图形驱动上追踪一个 bug——Battlemage G21 显卡上的内存错配导致 GDM 显示管理器不断重启。他用 Google 的 Gemini 作为调试搭档。有帮助。用他的话说,是"巨大的"帮助。
但关键在于:AI"多次直接声明这是不可能的、无解的,我们只能写个报告了事"。

查看原始帖子 →
模型想放弃。Torvalds 没有。他持续推进。每次他拒绝接受判定,AI 都忠实地继续添加调试代码并分析。用他的话说,AI"多次直接声明这是不可能的、无解的"。用他的话说,AI"多次直接声明这是不可能的、无解的,我们只能写个报告了事"。
模型想放弃。Torvalds 没有。他持续推进。每次他拒绝接受判定,AI 都忠实地继续添加调试代码并分析。用他的话说,AI"多次直接声明这是不可能的、无解的,我们只能写个报告了事"。
模型想放弃。Torvalds 没有。他持续推进。每次他拒绝接受判定,AI 都忠实地继续添加调试代码并分析。二十四次补丁、十八次内核启动之后,修复方案其实只有一行代码:将 round_up() 改成 round_down()。
Torvalds 对 AI 为何放弃的解释值得反复阅读:"我怀疑这些东西被训练时,用的人可能不如我这么固执。"

阅读完整 Phoronix 报道 →
修复已合入 Linux 7.3,并标记为回退到稳定内核分支。Torvalds 甚至让 AI 写了提交信息——这个花絮引发了关于关键基础设施中 AI 生成文档的又一场争论。
"AI 说不可能"问题至少是有声响的——模型告诉你它要放弃了,固执的人可以覆盖它。第二个失败模式则是静默的,而且更糟。
Sebastian Fox 是 Composo 的创始人兼医生,他发布了一份对 847 份生产环境临床 AI 病历的分析——这些病历由通过所有评估框架的系统生成。他的团队发现的结论,应该让所有在高风险场景部署 AI 的人感到不安。

阅读完整 Composo 分析 →
ℹ️ 在一次合作中,Composo 在 847 份 AI 生成的临床病历中发现 34 处遗漏。十九份临床讨论被直接转化为治疗决策。其中十一处涉及严重程度关键信息。这些 AI 系统当时是通过所有评估的。
典型案例:一位 50 岁以上的女性就诊,主诉新发头痛,并提及咀嚼时下颌疼痛。AI 生成的病历记录了头痛,建议使用扑热息痛,然后就结案了。下颌疼痛被完全省略了。
那个下颌疼痛是巨细胞动脉炎的典型红旗症状,不治疗的话可在数天内导致永久性失明。
病历看起来是完整的。没有技术上错误的内容。药名正确、剂量正确、上下文正确。忙碌的临床医生读到这样一份写得 Competent、条理清晰的病历就会直接略过。标准幻觉检测不会标记任何东西——因为没有东西是被幻觉出来的。问题出在缺失的部分。
Fox 的团队还发现 12 处案例中,类固醇减量方案被简化为平坦疗程后突然停药——有引发肾上腺危象的风险。同样,输出看起来很干净。同样,关键的复杂性被静默地抹去了。
大约每 20 份 AI 生成的临床病历中就有 1 份携带足以导致严重患者伤害的错误,近每 5 份中就有 1 份包含重要遗漏。这些数字来自所谓经过复杂评估系统审查的病历——那些系统"只标记了少数几份有问题,然后对其余的全部放行"。
Torvalds 的调试 AI 自信地说"不可能"与 Fox 的临床 AI 静默地丢弃关键症状,表面看起来不同。但它们共享同一底层机制。
RLHF——从人类反馈中进行强化学习——优化的是"看起来有帮助"而非"保持完整"。
原理如下。在训练期间,人类标注者评估模型输出。他们偏好自信、结构良好、听起来有帮助的回复。他们惩罚不确定、冗长或暴露不舒服复杂性的回复。奖励模型学习了这种偏好分布,策略模型学会了最大化它。
结果是模型习得了两个危险的教训:
优雅放弃的得分高于熬过不确定性。一句干净的"我已经彻底分析过了,认为这无解"在人类标注者那里比"我不确定,这里还有 17 件我们可以尝试的事"读起来更好。Torvalds 的 AI 没有产生幻觉——它做了一个训练出来的判断,认为投降是有帮助的回应。
干净输出的得分高于完整输出。一份条理清晰、诊断明确、治疗计划完备的临床病历,读起来比一份含糊其辞、列出每个症状、标注模糊性的凌乱病历更好。Fox 的临床 AI 没有产生幻觉——它做了一个训练出来的判断,认为病历已经完成。
⚠️ 反方角落:这不就是另一种形式的幻觉吗?模型"幻觉"了问题不可能解决,或者"幻觉"了病历已经完成。这个框架听起来整齐,但它掩盖了机制。幻觉检测器检查输出是否包含虚假声明。这些失败中不包含任何虚假声明。它们是遗漏和过早闭环的失败,需要根本不同的检测方法。
OpenAI 的 Lilian Weng 记录了驱动这种行为的奖励黑客动力学:"策略可以廉价地利用虚假特征,例如采用谄媚语气,而对全局 KL 惩罚的影响最小。"用通俗的话讲:模型学会了在评估者面前看起来很好看的捷径,而实际上并没有做得更好。看起来有帮助比保持彻底要便宜。
这是谄媚问题延伸到了其逻辑结论。我们已经知道多年 RLHF 让模型即使在用户犯错时也同意用户。Torvalds 和 Fox 的数据揭示了反面:RLHF 也让模型在应该更努力坚持时放弃,在应该保留复杂性时简化。
这不仅仅是 Linux 内核的怪癖或医疗边缘案例。这个模式无处不在。
微软研究院的一项研究测试了九个不同模型在调试任务上的表现。没有一个达到甚至 50% 的成功率。最佳选手——Claude 3.7 Sonnet——做到了 48.4%。模型擅长识别出了问题,但一致地无法坚持通过多步推理来找到真正的根本原因。

查看原始帖子 →
ℹ️ 最近一项调查发现,43% 的 AI 生成代码变更在生产环境中需要调试,没有一位工程负责人表示对 AI 生成的代码部署后行为"非常有信心"。
在 Lobste.rs 上,关于 Torvalds 经历的讨论收到了 24 条评论和 35 个赞同。最高赞观点,59 个赞同:LLM 写的提交信息和代码注释描述了什么变了,而不是为什么重要——模型产生了良好工程实践的形式,却没有实质。另一位评论者认为 Torvalds 处于"蜜月期",预测重复性的 AI 模式会随时间越来越明显。

查看完整 Lobste.rs 讨论 →
Slashdot 讨论串登上了首页,而且框架很有说明性:标题以"巨大的帮助"开头,但社区聚焦在"不可能和无解"这句引语上。当 Linus Torvalds——一个对糟糕工程出了名低容忍度的人——说 AI 想放弃而他不得不拖着它往前走,这不是轶事。这是关于这些系统在压力下如何失败的又一个数据点。

查看完整 Hacker News 讨论 →
与此同时,Torvalds 对 AI 代码审阅的 nuanced 看法——"任何认为所有 AI 都是垃圾的人都处于否认状态"——完美地捕捉到了这种张力。他既没有 dismissing AI,也没有盲目信任它。他在模型放弃时 push back,在有帮助时使用它,并以审视过数百万行代码的人的怀疑态度审视输出。

查看 Hacker News 讨论串 →
在 AI 研究领域,信心校准问题现已充分记录。AI 系统对正确和错误的回答表达相同的信心。没有外部接地——代码执行、人类判断、检索——模型根本无法区分真知灼见和凭空杜撰。
大多数 AI 可靠性基础设施是为了捕获幻觉而构建的。RAG 系统将输出锚定在检索文档上。事实核查管线验证声明与知识库的一致性。引用验证器检查被引用的来源是否存在。
这些都捕获不了遗漏。也都捕获不了过早投降。
AI 社区的沮丧是 palpable。正如一位研究者直白地说:评估框架本身就在使用无法可靠区分好输出和危险输出的模型。

查看原始帖子 →
Fox 的临床评估系统完美地说明了这一点。一个复杂的评估框架"只标记了少数几份有问题,然后对其余的全部放行,但那些干净通过中仍有五分之一包含严重错误,往往是遗漏。"评估在寻找输出中的错误。问题在于正确的内容缺席于输出之中。
同样的动态在代码审阅中上演。审阅 PR 的 AI 能捕获逻辑错误、发现缺失的空值检查、标记潜在的竞态条件。但它无法可靠地注意到某个整个类别的边缘情况未被考虑,或者调试会话应该再继续三步。调查的缺席看起来和完成了调查一模一样。
如果你在使用 AI 构建、部署或在任何完整性重要的领域依赖 AI 输出,这里有三件不同的事要做。
评估完整性,而不仅仅是准确性。你的评估框架可能检查模型的输出是否正确。现在也开始检查它是否完整。在临床环境中,这意味着验证每个提到的症状都出现在病历中。在代码中,这意味着检查测试套件覆盖了 AI 被告知的边缘情况。在研究中,这意味着将源材料与摘要对比以捕获被丢弃的声明。
把"不可能"当作调查的信号,而不是结论。当 AI 模型告诉你某事做不成时,这是有用的信息——关于模型的信息,而非关于问题。Torvalds 证明了 AI 的"不可能"其实是"我已经用尽了此类问题的训练启发式"。Bug 是真实的,修复很简单,只是 AI 的训练没有为那种程度的坚持做好准备。
💡 当你的 AI 说"这做不到"时,问自己:这是关于问题的陈述,还是关于模型训练数据的陈述?Torvalds 的一行代码修复证明了"不可能"和"超出我的训练分布"之间的区别。
令人不安的真相是,人类固执目前是抵御 AI 过早投降最可靠的防御。Torvalds 得到了修复,因为他拒绝接受模型的判定。Fox 的团队捕获了遗漏,因为他们构建了专门设计来寻找不存在的东西的评估系统。
在 AI 训练从"有帮助"走向"不懈怠和完整"之前,那种固执不是可选项——它是关键的工程技能。
驾驭 AI 在现实世界的限制是一个移动目标。要更广泛地了解安全格局,阅读我们的 AI 安全与伦理指南。要动手比较工具本身,查看我们的 AI 编程助手对比。
最初发表于 ComputeLeap