研究:接入AI后人们几乎不再说"我不知道",正确率反而下降
3000+参与者的研究表明,使用AI后人们承认"不知道"的比例从44%降至3%,但正确率仅为无AI辅助者的三分之一。
3000+参与者的研究表明,使用AI后人们承认"不知道"的比例从44%降至3%,但正确率仅为无AI辅助者的三分之一。
研究人员开展了五项实验,共有 3132 名参与者,测试使用语言模型是否会改变人们处理不确定性的方式。只要 AI 建议触手可及,人们说"我不知道"的意愿几乎就被完全抹去了。
研究人员精心挑选了问题,使所使用的大模型 Step 3.5 Flash 几乎总是答错。这些问题涉及电影中的细微视觉细节,例如《弯曲吧!像贝克汉姆一样》(Bend It Like Beckham)中某支球队队服的颜色。作者表示,这类细节很少出现在网络文本中,因此成为大模型产生幻觉(hallucination)的重灾区。GPT-5.5、Claude 4.6 Sonnet 和 Gemini 3.5 Flash 在其他大多数问题上表现尚可,但在较难的问题上偶尔也会出错。
由于 AI 建议大多是错误的,这个效应不能被解释为将任务合理地委托给一个可靠工具。研究人员仍然观察到人们倾向于服从 AI 给出的答案,但这种倾向在电影 trivia 之外的场景是否同样强烈,这仍是一个悬而未决的问题。
在前两项研究(1a 和 1b)中,参与者可以选择是否向 AI 寻求建议。在没有 AI 访问权限的对照组中,他们在 36% 和 44% 的问题上选择不发表判断。有了 AI 访问权限后,这两个数字分别降至 6% 和 3%。
在第二项研究中,研究人员还测量了参与者的自信程度。在没有经济激励的情况下,使用 AI 时的自信度达到 100 分制的 75.9 分,而不使用 AI 时仅为 29.6 分——大约提高了 2.5 倍。与此同时,正确率从 27.6% 下降到 10.0%。参与者明显自信了很多,但错误也频繁得多。
在所有研究中,没有激励且有 AI 访问权限的参与者答对了 9.2% 的问题,而没有 AI 的是 27.5%。有了 AI 后他们回答了更多问题,但正确率仅为对照组的约三分之一。

第二到第四项研究增加了经济激励。答对每题可获得 10 美分,答错扣 10 美分,选择"我不知道"则不得分。研究人员预先注册了假设:激励会增加人们放弃回答的意愿,但 AI 的可及性会削弱这一效应。然而三项研究均未显示出统计上显著的交互作用。
研究表明,AI 访问权限和经济激励在很大程度上各自独立发挥作用。激励使得参与者减少向 AI 寻求建议,在第三项研究中,AI 请求次数从满 6 次中的 5.27 次降至 4.53 次;在有 AI 的情况下,激励也提高了正确率。激励使判断搁置率略有上升,但仍远低于无 AI 对照组。
正如研究人员所承认的,激励确实有效,但效果有限。更大规模或基于声誉的激励是否能进一步缩小差距,目前尚不清楚。
在第四项研究中,AI 答案会自动展示给参与者,而无需他们主动询问。研究人员表示,这反映了日益增长的实际场景:搜索引擎展示 AI 生成的摘要,写作助手主动提出建议。这种设置下的效果几乎没有变化。在没有激励的情况下,判断搁置率从无 AI 的 35% 骤降至自动展示 AI 答案时的 1%;有激励的情况下,则从约 39% 降至 7%。
研究人员将结果置于"认识论"(Epistemics)框架下讨论——即人们因为 AI 回答听起来令人信服就接受它,而不是真正去核实。语言模型总是必须给出一个答案,即使不知道某事它也不会停顿。作者写道,当用户将判断权拱手让给这样的系统时,他们可能也会沾染上这种不知节制的毛病。
这一效应也与"建议利用"研究的结论背道而驰。人们通常会低估外部建议的分量,只会将自己的立场向建议者的方向调整约三分之一。而本研究的参与者则走向了反面,作者如是说。
他们甚至从数据中得出结论:AI 访问权限将一些原本正确的答案变成了错误。在无激励条件下,AI 组的回答数量多于对照组,但正确答案数反而更少。
研究团队写道,随着 AI 回答变得无处不在且越来越多地主动呈现在用户面前,"我不知道"这句话的意愿可能成为人类与 AI 交互中的首批牺牲品之一。随着 AI 系统广泛渗透,人类判断力能否维持,可能更多地取决于人们是否继续认知并尊重自身知识的边界,而不是让模型变得更准确。
越来越多的研究表明,使用 AI 会影响人类的判断力和认知技能。瑞士商学院一项有 666 名参与者参与的研究显示,AI 使用与批判性思维之间存在显著的负相关。人们越信任 AI,就越倾向于将认知任务外包,由此形成恶性循环,进一步削弱批判性思维。
实验证据表明,仅需与 AI 助手合作十到十五分钟,就能显著降低后续无 AI 辅助任务中的问题解决能力和坚持度。而那些仅将 AI 用于解释或直接忽略它的参与者则没有出现能力下降。
微软的一项研究得出了类似结论。在另一篇论文中,微软指出 AI 使用对元认知(metacognition)——即监控和引导自身思维的能力——提出了很高要求。较高的教育水平是一个保护因素。