OpenAI将Decision Models API开放给公众测试,并新增图像输入能力,支持基于视觉信息快速做出决策,适用于需要实时感知的AI智能体场景。
本周,OpenAI 向公众开放了 Decisions API 的 beta 测试,并新增了图像输入功能,使应用能够基于视觉内容做出快速决策。
Decisions API 最初于上周宣布,被认为是针对 TypeSafe Jev 的回应。OpenAI 目前对该决策模型的定价为每百万输入 token 0.10 美元,不收取输出 token 费用,也不收取缓存读取或写入费用。
该公共 beta 版本运行在 GPT-6 Luna 上,使所有开发者能够将文本或图像转换为三种类型的结构化输出:谓词(即某事为真的可能性)、选项(即哪个预定义选项最适合)和分数(即输入在数值范围内的位置)。
但 OpenAI 的 Decisions API 可能只是决策模型这片海洋中的一尾游鱼。Perplexity、Cloudflare 和 Amazon 也于本月推出了各自的版本,选择采用开放权重模型,开发者可以下载并在自有基础设施上运行。
在一条新视频中,OpenAI 展示了图像输入如何帮助应用基于视觉理解快速采取行动。

它举了一个电子游戏的例子:一辆汽车在车流中穿行。利用道路和障碍物的帧画面,Decisions API 可以选择汽车应该换道还是继续行驶。
OpenAI 声称,其 API 做出这些决策所需的时间仅为推理模型完成相同任务所需时间的一小部分。
从更宏观的视角看,这家 AI 公司暗示,如果开发者将该 API 与基本的计算机操作任务(如截取屏幕截图并快速选择下一步操作)结合使用,这种视觉理解能力可以带来哪些可能性。

同一条视频还展示了 OpenAI 收到了 Hugging Face 即将推出的可编程 Microduck 机器人的预览单元,这是一款开源双足开发者机器人。
OpenAI 表示,通过将机器人与 GPT-Live(OpenAI 的实时语音模型)以及 Decisions API 集成,其决策模型可以分析机器人的摄像头画面,从而快速决定它应该看向哪里。
在给定的示例中,Decisions API 响应「跟随苹果」的请求,首先识别出这个水果,然后指示机器人转向它。OpenAI 补充道,GPT-Live 与 Decisions API 的组合可以更进一步,对更模糊的指令做出响应,例如「跟随水果」。

OpenAI 还承诺,其新 API 可以为语音对话带来更多维度。
它展示了 GPT-Live 和 Decisions API 与一个动画角色的配对:前者处理语音,后者介入选择角色应该使用哪种表情。
TypeSafe 上个月发布 Jev 时引发了不少关注。但它占据聚光灯的时间似乎即将迅速终结。除了 OpenAI 进军决策模型领域外,Perplexity、Cloudflare 和 Amazon 都已登场——但他们让开发者可以下载模型权重并自行运行。
TypeSafe 上个月发布 Jev 时引发了不少关注。但它占据聚光灯的时间似乎即将迅速终结。除了 OpenAI 进军决策模型领域外,Perplexity、Cloudflare 和 Amazon 都已登场——但他们让开发者可以下载模型权重并自行运行。
本月在 Hugging Face 上发布的 Perplexity pplx-decider-v1-27b 是一款开放权重的决策模型,基于 Qwen3.8-27B 微调而来,采用 Apache 2.0 许可发布。根据其模型卡,它支持与 TypeSafe 和 OpenAI 相似的决策模式:从预定义选项中进行选择并返回是/否概率。
与 OpenAI 不同,Perplexity 展示了其基准测试结果,报告称其决策模型在 11 项基准测试中总体表现优于 Jev,得分为 85.71%,而 TypeSafe 为 84.51%。但这个总体分数来自一组参差不齐的结果;Jev 在 11 项基准测试中的 6 项中胜出,包括 WinoGrande、BBH 和 TruthfulQA 二元分类。
Amazon 应对 Jev 的本地方案 Strands Decider 2B 也是一款可下载的模型——这次基于 Qwen3.5-2B 构建。Amazon 表示,在 JevBench 公共集合中,它在约 20 亿参数的公共模型中排名第二。
与 OpenAI 和 Perplexity 的模型一样,Clef 有一个视觉编码器,可以接受图像和文本输入。Jev 和 Strands Decider 目前仅支持文本。
与此同时,Cloudflare 为开发者提供了两款决策模型:Clef 和 Clef-flash,两者都以 Apache 2.0 开放权重形式提供,也可通过其自有的托管 Workers AI 服务使用。与 OpenAI 和 Perplexity 的模型一样,Clef 有一个视觉编码器,可以接受图像和文本输入。Jev 和 Strands Decider 目前仅支持文本。
比图像或文本输入更重要的是,OpenAI 决定将模型保留在托管 API 之后,尽管许多同类产品都在开放自己的版本供开发者下载和运行。随着决策模型成为新常态,它们可以部署在何处以及如何部署,可能成为决定开发者选择哪种模型的关键因素。