理论研究表明即使语言模型完美运作,因节省时间反而使研究者将剩余时间投入更多新项目而非深化现有成果,三种建模情景中两种显示个体发表质量下降。
即便语言模型运行得完美无缺,它们也可能让研究变得更糟,而非更好。一项新的理论研究认为,由于 AI 节省了时间,研究人员反而会在每个项目上投入更少的精力,而非更多。
语言模型本应在科学研究的每个阶段提速,从提出假设到分析数据再到撰写论文。最直接的期望是:如果 AI 处理了繁琐的日常任务,研究人员就会有更多时间真正思考。
普林斯顿大学、华盛顿大学等机构的研究人员联合发表了一篇理论经济学论文,对上述假设提出了质疑。当 AI 承担了科学家的部分工作后,科学家的时间变得更加宝贵。每一个花在做现有项目上的小时,都意味着不能用于启动新项目。经济学家称之为"机会成本",而这篇论文的模型正是建立在这个概念之上。
为了分析,作者刻意将 LLM 理想化处理。他们将其视为一种工具,能够在不引入错误且可忽略财务成本的前提下削减时间成本——这个设定是为了将时间节省的纯粹效应与这项技术众所周知的缺陷隔离开来。
科学研究的觅食模型
研究人员基于行为生态学中的最优觅食理论构建了一个数学模型,这个框架描述了生物体如何在竞争性机会中分配精力。应用到科学研究中,该模型模拟了研究人员如何在他们项目之间分配劳动,以及当 LLM 缩短项目生命周期中的不同阶段时会发生什么。
在这个模型中,一个研究项目分为两个阶段。研究人员首先检查一个想法是否可行,然后决定放弃还是推进。推进阶段包含一个强制部分——如制作图表、格式化文本和提交——以及一个自愿部分,如运行额外实验、进行更深入的分析或润色文章。他们认为,当时间变得稀缺时,被牺牲的正是那个自愿部分。
三种情境中有两种导致研究质量下降
论文设定了三种情境,取决于 AI 应用在研究过程的哪个环节。第一种情境中,AI 帮助评估早期想法。研究人员变得更加挑剔,因为重新开始的成本降低了,所以只有最有前景的项目才会继续推进。但即便这些项目得到的处理也不够深入,因为节省下来的时间更好地用于启动新项目。作者表示,这种模式在技术领域很典型。
第二种情境中,AI 帮助出版,加速了写作、格式化和分析。由于发表论文所需的精力减少了,较弱的项目也变得值得去做。更多的论文进入流通,但每一篇都变得更加浅薄。这种模式在田野调查主导的学科中很典型。
只有在第三种情境中,AI 才真正提升了质量。在这里,它加速了自愿深入阶段的各项工作,如额外实验或更仔细的分析。因为 AI 精准针对的是研究人员一直因时间压力而偷工减料的环节,时间节省转化为了更彻底的工作。
因此,在三种情境中有两种,研究深度都会下降。当时间变得更加宝贵时,润色一篇已经可以发表的论文就不再有意义了。那时间用在下一个项目上更好。
节省时间的谬误
"作为一种劳动增强技术,LLM 增加了我们时间的机会成本,迫使我们做得更多、却更差——而非以同样的工作量、做得更好,"作者写道。节省的时间会自动流入更深入分析的想法站不住脚。
该模型在理论上描述的现象已经出现在实践中。OpenAI 的一份涵盖八个科学案例研究的现场报告发现,在重写研究软件时提速高达 60 倍,但瓶颈只是从编程转移到了验证和长期维护上。感知到的时间节省甚至不需要真实存在,就能改变行为。METR 的一项研究发现,使用 AI 工具的经验丰富的开源开发者完成任务的时间实际上延长了 19%,尽管他们感觉自己快了 24%。
这种摩擦在出版系统中也很明显。在 LLM 加速写作的领域,投稿量已经快速增长,给本已超负荷的同行评审系统造成压力。Sakana AI 的"AI Scientist-v2"让一篇完全由 AI 生成的论文通过了 ICLR 研讨会,其中充斥着引用错误。Arxiv 以更严厉的处罚作为回应,威胁对虚构来源或在文本中留下 AI 元评论的行为实施一年投稿禁令。
论文认为,制度层面的回应需要因学科而异,因为 AI 对研究的影响并非统一的加速。它取决于过程中哪个阶段被提速。最近一项关于软件开发的研究将类似的现象描述为公地悲剧——个体生产力提升是以后期审查和维护输出的人为代价的。