前 OpenAI 研究员:训练数据成为大模型下一瓶颈
前 OpenAI 研究员指出现有大模型虽在编程和数学上表现好,但在其他领域停滞甚至退步,训练数据质量正成为关键。
前 OpenAI 研究员指出现有大模型虽在编程和数学上表现好,但在其他领域停滞甚至退步,训练数据质量正成为关键。
一位 OpenAI 前员工创办了一家专门生产高质量训练数据的初创公司。其出发点是,他怀疑仅仅扩大大语言模型的规模,并不能让模型真正具备泛化能力。
这家公司正在为生物信息学和日常实验室工作构建专用数据集。他们认为,现有数据源没有覆盖 AI 系统要想可靠完成任务所需的许多具有经济价值的技能。
剑桥大学和 Google DeepMind 的研究人员也支持这一观点。他们发现,目前的 AI 系统正变得越来越专业,而不是更加全能,并且在创造性解决问题方面正触及能力上限。
Andrew Ho 在加入 OpenAI 仅八个月后便选择离职,因为他确信大语言模型的泛化能力很差。他表示,即使是在编程这种资金投入充足的领域,模型的表现也不稳定。
Ho 认为,根本原因在于训练数据不足。现有数据集中,绝大多数具有重要经济价值的技能几乎都没有得到充分体现。
“绝大多数工作都高度依赖具体情境,很难被编码进一个可以客观评分的环境。即使我们能够观察到一条由人类走出的、我们认为不错的‘黄金路径’,也很难判断其他假设性的替代路径究竟会产生好结果还是坏结果。”Ho 写道。
他认为,仅靠扩大规模无法解决这个问题,并预计未来几年,AI 实验室将不得不在针对性数据采集上投入超过 1000 亿美元。Ho 对 OpenAI、Anthropic 等前沿实验室的天价估值同样持怀疑态度。他表示,这些实验室长期无法盈利,因为仅仅为了领先于 Qwen 或 Kimi 等成本更低的竞争对手,它们就必须不断投入越来越多的资金开发新模型。
他的首批产品聚焦两个领域。其一是面向生物信息学复杂科学分析的数据集,即使 GPT-5.6 Sol 这样的当前模型,在这类任务上的成功率也只有约 30%;Ho 在 OpenAI 任职期间曾研究过这一课题。其二是面向日常实验室工作的数据集,例如研究人员向 AI 模型提交实验照片,让模型进行评估。未来,公司还计划扩展到化学、材料科学、医疗健康以及更广泛的知识工作领域。
剑桥大学研究员 Adam Hunt 与 Ho 一样对此持怀疑态度。Hunt 描述了自己对 LLM 的看法如何从乐观逐渐转向悲观。他认为,最新模型并没有变得更加全能,而是在变得更加专业。模型在编程和复杂数学方面的能力持续提升,但在语言质量和简单逻辑等领域却停滞不前,甚至有所退步。这与 Ho 对模型表现参差不齐的观察相吻合。
Hunt 表示,原因在于强化学习在代码等领域效果很好,因为这些领域既有明确的奖励信号,也有完整的训练数据。而在其他领域,这类数据根本不存在。大语言模型早期取得的进展,以及它们看似能够通过纯粹扩大规模和推理实现泛化的能力,其实只是使用广泛文本语料进行训练所产生的副作用,并不意味着模型具备真正的通用理解能力。
这场争论不断回到同一个问题:语言模型能否发展出超越复现和重新组合训练数据的能力,尤其是在结果无法自动验证的领域?科学家对此尚未形成共识。
Hunt 自己对此也只有大约 40% 的信心,并承认技术进步可能会证明他的判断是错误的。例如,如果能够把多个专用 AI 模型组合成某种类似通用智能的系统,情况或许会有所不同。
Google DeepMind 的 Tom Zahavy 最近发表了一篇题为《LLM 无法跳跃》(“LLMs can't jump”)的立场论文,从结构层面解释了为什么模型的能力表现并不均衡。语言模型擅长演绎和归纳,却不擅长创造性的溯因推理,也就是无法创造出一种此前没有任何语言先例的原因。作为一种可能的解决方案,Zahavy 提出了行动可控的世界模型,使系统能够进行反事实实验。即使 LLM 单独工作时会触及自身极限,它仍然可以在这类高级系统中发挥关键作用。
订阅 THE DECODER,即可享受无广告阅读、每周一期的 AI 新闻通讯、每年六期独家前沿报告“AI Radar”、完整档案访问权限,以及评论区访问权限。