OpenAI 推理模型幻觉问题凸显
揭示新推理模型的幻觉缺陷比预期严重,帮助开发者了解模型能力边界并调整使用策略。
揭示新推理模型的幻觉缺陷比预期严重,帮助开发者了解模型能力边界并调整使用策略。
OpenAI 最近推出的 o3 和 o4-mini AI 模型在许多方面都达到了业界最先进的水平。然而,这些新模型仍然会产生幻觉或编造事物——实际上,它们的幻觉程度比 OpenAI 几个较早的模型还要严重。
幻觉已被证明是 AI 中最大、最难解决的问题之一,甚至影响到当今性能最强的系统。从历史来看,每个新模型在幻觉方面都有小幅改进,幻觉比其前代模型更少。但对于 o3 和 o4-mini 来说似乎并非如此。
根据 OpenAI 的内部测试,所谓的推理模型 o3 和 o4-mini 的幻觉频率高于该公司之前的推理模型——o1、o1-mini 和 o3-mini,以及 OpenAI 的传统"非推理"模型,如 GPT-4o。
更令人担忧的是,ChatGPT 的开发者对为什么会发生这种情况并不真正了解。
在 o3 和 o4-mini 的技术报告中,OpenAI 写道需要"更多研究"来理解为什么在扩展推理模型时幻觉会加剧。O3 和 o4-mini 在某些领域表现更好,包括与编程和数学相关的任务。但因为它们"总体上提出更多的声称",它们经常被导致做出"更多准确的声称以及更多不准确的/幻觉声称",根据该报告。
OpenAI 发现 o3 在 PersonQA 上 33% 的问题中产生幻觉,这是该公司用来衡量模型关于人物知识准确性的内部基准。这大约是 OpenAI 之前推理模型 o1 和 o3-mini 幻觉率的两倍,分别得分为 16% 和 14.8%。O4-mini 在 PersonQA 上表现更差——幻觉率达 48%。
非营利 AI 研究机构 Transluce 的第三方测试也发现证据表明,o3 倾向于编造它在得出答案过程中采取的行动。在一个例子中,Transluce 观察到 o3 声称它在 2021 年 MacBook Pro 上"在 ChatGPT 之外"运行了代码,然后将数字复制到其答案中。虽然 o3 可以访问一些工具,但它无法做到这一点。
"我们的假设是,用于 o 系列模型的强化学习可能会放大通常由标准后训练管道缓解(但不完全消除)的问题," Transluce 研究员、前 OpenAI 员工 Neil Chowdhury 在发送给 TechCrunch 的电子邮件中说道。
Transluce 联合创始人 Sarah Schwettmann 补充说,o3 的幻觉率可能会使其不如其本来可能那样有用。
斯坦福大学兼职教授、技能提升初创公司 Workera 首席执行官 Kian Katanforoosh 告诉 TechCrunch,他的团队已经在其编码工作流程中测试 o3,并且发现它比竞争对手领先一步。然而,Katanforoosh 表示 o3 倾向于幻觉生成损坏的网站链接。该模型会提供一个链接,点击时不会工作。
幻觉可能会帮助模型产生有趣的想法并在其"思维"中具有创意,但它们也使某些模型对于准确性至关重要的市场中的业务难以销售。例如,律师事务所可能不会对一个在客户合同中插入大量事实错误的模型感到满意。
提高模型准确性的一个有前景的方法是赋予它们网络搜索能力。具有网络搜索功能的 OpenAI 的 GPT-4o 在 SimpleQA 上实现了 90% 的准确率,这是 OpenAI 的另一个准确性基准。可能地,搜索也可以改进推理模型的幻觉率——至少在用户愿意将提示暴露给第三方搜索提供商的情况下。
如果扩展推理模型确实继续恶化幻觉,这将使解决问题的搜索变得更加紧迫。
"解决我们所有模型中的幻觉是一个持续的研究领域,我们正在不断努力改进它们的准确性和可靠性," OpenAI 发言人 Niko Felix 在发送给 TechCrunch 的电子邮件中表示。
在过去的一年中,在改进传统 AI 模型的技术开始显示收益递减后,更广泛的 AI 行业已转向关注推理模型。推理在不需要大量计算和训练数据的情况下改进了模型在各种任务上的性能。然而,推理似乎也可能导致更多幻觉——提出了一个挑战。