OpenAI 称 GPT-5.6 在 ARC-AGI-3 上超越 Opus,但仅在使用特定 API 的非标准条件下成立。模型对比有价值但公正性存疑。
ARC Prize联合创始人François Chollet对OpenAI的成绩做出回应,区分了两类测试设置。他表示,"专门为解决基准或包含关于基准格式知识的"工具属于禁用范围。通用API设置"未为ARC-AGI-3开发且可供所有API用户使用"则属于允许范围。实际上,Chollet承认ARC Prize自己的GPT-5.6 Sol成绩对OpenAI造成了劣势。
他指出,ARC Prize与OpenAI进行了"大量关于如何最好地测试其模型的讨论,特别是关于压缩方面",欢迎该公司"开始找到答案"。Chollet表示,不同供应商使用不同设置确实会造成"潜在的平价问题",但只要"设置和成本被明确报告",他就认为这是可以接受的。
OpenAI表示它能够在ARC-AGI-3上保持竞争力。在Anthropic的Claude Opus 5将这项逻辑基准的记录分数提高了四倍之后,OpenAI现在展示了GPT-5.6 Sol在使用两个API设置的情况下达到38.3%,超过了Opus 5的30.2%。
不过,OpenAI并未使用官方测试环境。相反,它通过自己的Responses API运行GPT-5.6 Sol,采用"Retained Reasoning"(在步骤间保留模型的思维链)和"Compaction"(将旧上下文汇总而非截断)两项功能。在官方工具中,GPT-5.6 Sol仅获得7.8%的分数,因为模型的推理在每个操作后会被丢弃。
OpenAI主张基准测试从不仅仅衡量模型本身,还衡量其周围的技术架构。这是事实,而ARC-AGI-3的设计目的是测试纯模型性能。ARC Prize在回应OpenAI成绩时表示,官方ARC分数采用标准化方法,不使用供应商特定的设置以确保公平比较。关键问题在于ARC Prize是否使用了较旧的"OpenAI风格completions API",该API缺乏Claude API已经提供的功能,这将对OpenAI造成不公平的比较。
不带炒作的AI新闻 – 由专业编辑精选
订阅THE DECODER享受无广告阅读、每周AI资讯通讯、独家"AI Radar"前沿报告(每年六期)、完整存档访问权限及评论区权限。