OpenAI:现有 AI 难以解决复杂编程问题
OpenAI 研究显示 AI 模型在编程问题上的局限性,提醒开发者合理评估工具能力。
OpenAI 研究显示 AI 模型在编程问题上的局限性,提醒开发者合理评估工具能力。
OpenAI 的研究人员承认,即便是最先进的 AI 模型,依然无法与人类程序员匹敌——尽管 CEO Sam Altman 坚称,到今年年底,它们将能够超越“低水平”软件工程师。
在一篇新论文中,该公司的研究人员发现,即便是 frontier models,也就是目前最先进、不断突破能力边界的 AI 系统,“仍然无法解决大多数”编程任务。
研究人员使用了一套新开发的基准测试 SWE-Lancer。该基准基于自由职业平台 Upwork 上的 1,400 多项软件工程任务构建。OpenAI 用它测试了三个大型语言模型(LLM):自家的 o1 推理模型和旗舰模型 GPT-4o,以及 Anthropic 的 Claude 3.5 Sonnet。
具体来说,这套新基准评估了 LLM 在 Upwork 两类任务中的表现:一类是独立任务,涉及排查 bug 并实现修复;另一类是管理任务,要求模型跳出局部视角,从更高层面作出决策。(这些模型不允许访问互联网,因此无法直接照搬网上发布过的类似答案。)
这些模型挑战的任务在 Upwork 上累计价值数十万美元,但它们只能修复软件的表层问题,仍然无法真正找出大型项目中的 bug,也无法定位其根本原因。任何使用过 AI 的人,可能都对这些粗糙、半成品式的“解决方案”并不陌生——AI 很擅长生成听起来信心十足的信息,但这些内容往往经不起仔细推敲。
论文指出,尽管这三个 LLM 通常都能以“远超人类的速度”执行任务,但它们无法判断 bug 的影响范围,也不能理解其上下文,“从而给出错误或不够全面的解决方案”。
研究人员解释称,Claude 3.5 Sonnet 的表现优于与之对比的两个 OpenAI 模型,赚到的钱也比 o1 和 GPT-4o 更多。即便如此,它给出的大多数答案仍然是错误的。研究人员认为,任何模型要想在现实的编程任务中获得信任,都必须具备“更高的可靠性”。
说得更直白一些,这篇论文似乎表明:尽管这些 frontier models 工作速度很快,也能够解决范围明确的局部任务,但在处理这些任务时,其能力距离人类工程师还差得很远。
过去几年里,这些 LLM 的能力突飞猛进,而且很可能会继续进步,但它们目前在软件工程方面还不够成熟,暂时无法取代现实中的人类——不过,这并没有阻止一些 CEO 解雇人类程序员,转而采用尚不成熟的 AI 模型。
更多关于 AI 与编程的内容:Zuckerberg 宣布计划用 AI 自动化 Facebook 的编程岗位