GPT-5.6 Sol在视觉任务上超越OpenAI此前所有视觉模型,在多项基准测试中取得领先成绩,推理能力显著提升。
上周,OpenAI 发布了 GPT-5.6 系列,引入了 Sol、Terra 和 Luna 三款模型。在发布直播中,团队重点展示了计算机操作能力——模型能够导航并操控桌面应用程序。OpenAI 突出介绍了 UI Agent 和详细的 3D 可视化,但这两项能力都依赖更强的视觉理解能力。
为了评估它们的视觉表现,我们让这些模型在我们的即将发布的 VLM 基准测试中跑了一遍,计划在接下来几周内公开。该基准测试覆盖了常见的视觉任务,包括检测、计数、OCR 和数据提取。本文将深入剖析 GPT-5.6 在各项任务中的表现。

Sol 无疑是 OpenAI 迄今发布的最强视觉模型。这一代在目标检测和计数方面的提升尤为明显——此前 GPT-5.5 在这两项上远落后于最强的 VLM。Terra 和 Luna 不如 Sol 强大,但两者相比 GPT-5.5 都有实质性进步。
在 Roboflow Playground 中测试 Sol、Terra 和 Luna,并将它们与 Claude Fable 5、Gemini 3.5 Flash 在同一视觉任务上的表现进行对比。
检测是 GPT-5.6 进步最显著的领域。GPT-5.5 在我们的基准测试中得分为 13.8 mAP@50,而 Sol 达到了 46.2。Terra 和 Luna 紧随其后,分别为 44.7 和 43.3——目标检测从一大短板摇身变成了一项可用的能力。

文档布局检测是 GPT-5.6 最突出的强项之一。Sol 对标题、段落、表格、图片和签名的处理都表现出色。许多文档工作流的第一步,就是在 OCR 或数据提取之前先定位页面上相关的部分。

GPT-5.6 在密集场景中也有不错的表现。药片和鸡蛋的示例包含许多紧密排列的相似物体——这是 VLM 检测常见的短板。与传统检测器不同,VLM 将每个类标签和坐标集合以文本形式生成。随着物体数量增加,响应内容变长,漏检、重复或坐标错误的风险也随之上升。尽管如此,Sol 在这两个场景中仍检测出了大部分物体。

要获得最佳检测效果,建议提示 GPT-5.6 模型返回以图像像素为单位的绝对 XYXY 坐标。这与 Gemini 3.5 Flash 不同——后者在使用归一化到 0–1000 范围的 YXYX 坐标时表现最佳。使用错误的坐标格式会使 GPT-5.6 的检测性能下降约 15 个 mAP 点。
在少数案例中,GPT-5.6 Sol 返回的框出现在图像中看似随机的位置。许多框与真实标注几乎没有任何重叠。框没有匹配可见物体,反而经常形成不自然的布局,比如排成直线或均匀分布的组。


我们将这些案例反馈给了 OpenAI。他们的团队确认,Sol 在约 2000×2000 像素或更大的图像上会变得不稳定,尤其是在较低推理投入(reasoning effort)下。提高推理投入可以改善稳定性,但也会增加 token 用量、延迟和成本。在调用 OpenAI API 前对大图进行缩放或裁剪是最实用的解决方案。
整个 GPT-5.6 系列在计数方面都有提升。Sol 在我们的基准测试中得分为 73.0%,而 GPT-5.5 为 64.9%;Terra 和 Luna 分别达到了 67.6% 和 66.2%。Luna 作为该系列中最便宜的模型,仍然超越了 OpenAI 此前的水准。

作为基准测试的一部分,我们测试了一些需要超越"发现物体并返回总数"的场景。Sol 正确计数了严重重叠的金属支架——这对传统目标检测器和 VLM 都是难题。Sol 还只对所选评分区域内弹孔进行了计数,体现了它对"计数哪些物体"以及"规则适用于何处"的理解。


泡罩包装则困难得多。我们分别提问,让 Sol 计数空槽位和密封在包装内的药丸。重复的布局、反光,以及填充槽位与空槽位之间微小的视觉差异,让这两个任务都具有挑战性。


异常糖果示例暴露了另一种类型的失败。Sol 给出了错误的数量——不过目前尚不确定是模型数错了糖果,还是误解了目标类别。

OCR 表现与 GPT-5.5 接近。Sol 取得了 90.7% 的平均相似度得分,仅以 0.5 分之差落后于 GPT-5.5 的 91.2%,Terra 和 Luna 分别为 88.8% 和 88.4%。在文本提取方面差距更大:Sol 得分为 82.5%,而 GPT-5.5 为 87.6%。Luna 和 Terra 分别为 81.4% 和 79.4%。


作为基准测试的一部分,我们将全文转录与定向提取分开测试。OCR 要求模型转录所有可见文本,而文本提取则要求提取特定信息片段。Sol 在两种场景下都对手写笔记表现良好——在一个案例中输出了完整转录,在另一个案例中提取出了所需的日期。


Sol 在复杂视觉场景中嵌入的文本上表现良好。它能读取肮脏、磨损轮胎弯曲表面上印制的轮胎尺寸序列。另一个例子中,它从冰球直播中提取了实时比分,并按要求的格式返回答案——同时考验了视觉读取和指令遵循能力。


一些看起来简单的提取任务仍然会失败。Sol 无法读取泡罩包装上印刷的有效期。文字小、竖向排列、对比度低,还受到反光影响——这些可能解释了错误的原因。

视觉能力的提升伴随着整个 GPT-5.6 系列更高的 token 用量。这种差异在小规模测试中不太明显,但在规模化场景中变得至关重要——token 总量直接决定处理成本。

在我们的基准测试中,Sol 平均每张图像耗时近 10 秒。Terra 降至约 6 秒,Luna 略高于 5 秒。Luna 提供了该系列中最强的延迟-质量平衡,速度接近 Gemini 3.5 Flash,同时在检测和计数上仍超越 GPT-5.5。

在我们的基准测试中,Sol 每张图像成本约为 2.5 美分,是仅次于 Claude Fable 5 的第二贵模型。Terra 将平均成本降至约 1 美分,Luna 则低于 0.5 美分。

Gemini 3.5 Flash 每张图像仅需 0.8 美分,比 Sol 便宜很多,同时仍在我们的检测和计数基准测试中领先。对于大规模图像批处理的成本敏感型工作负载来说,这是一个极具竞争力的选择。Roboflow Playground 允许你在同一任务上测试 Sol、Terra 和 Luna,并与 Claude Fable 5、Gemini 3.5 Flash 以及其他 VLM 进行对比。
借助 GPT-5.6,OpenAI 比以往任何时候都更接近领先的 VLM 阵营。检测从短板变成了可用能力,整个模型家族的计数能力也有所提升。
短板依然明显。在我们的基准测试中,Gemini 3.5 Flash 仍然是高容量检测和计数任务的更优实用选择——尤其考虑到其价格优势。
GPT-5.6 表明 OpenAI 如今对视觉能力的重视程度已大幅提升。Sol 仍有缺陷,特别是在成本、延迟和一些不稳定的检测案例上,但进步不容忽视。对于 Agent、屏幕理解、文档工作流和视觉推理场景,这一次发布让 OpenAI成了一个远更有竞争力的选择。