OpenAI Agents API正式进入公开beta阶段,底层技术源自Codex团队多年研发,日耗曾达7千美元。开发者现可基于此构建自动化工作流和AI Agent应用。
OpenAI 周四以公开 beta 形式推出了 Agents API,将 Codex 背后的后端技术开放给希望在无人值守状态下运行 agent 数天的开发者。现在,开发者不再需要自己构建维持 agent 运转的系统,因为该 API 会追踪任务进度,并为 agent 提供执行工作的场所,即使任务远超单个 context window 的限制也不在话下。
尽管这让长时间运行的 agent 更容易尝试,但也给开发者提供了更多消耗算力的方式。值得一提的是,就在 Agents API 发布当天,OpenAI 暂停了新用户注册其每月 200 美元的 Pro 计划,原因是 GPT-6 Astra 的需求令其容量承压。Codex 工程负责人 Thibault Sottiaux 在 X 上表示,Pro 订阅"对我们系统的压力最大",并补充称 OpenAI 正在"尽快"增加容量。
Agents API 和 ChatGPT Pro 是独立的产品,因此没有理由认为一方在挤占另一方的容量。但这个时间点仍然值得关注——公司在让开发者更容易连续数小时乃至数天运行 agent 的同时,却收紧了其最高用量消费计划的访问权限,正努力增加更多容量。
随着任务变长,API 可以压缩早期的 context,使 agent 不会在达到模型的 context 限制时直接中断。它还可以在需要时才调用工具,或者将一个较大的任务分发给并行工作的 subagent。实际的工作可以在 OpenAI 的沙箱中运行,也可以在开发者控制的基础设施上运行。
随着 agent 取得进展,它们会回到模型获取下一步,一个耗时数小时的任务产生的推理量可能远远超过一次典型的 API 调用。当 agent 并行工作时,用量攀升得更快。
OpenAI 已经在自己的业务中见识过这意味着什么。在 9 月 6 日发布的一份研究报告中,OpenAI 表示,其研究组织在 8 月中旬每个工作日(按标准 8 小时等价计算)产生的 agent 工作量已达 3.1 个工作日。按 API 价格计算,用量排名前 50% 的研究员每天在推理上的花费超过 600 美元,而第 90 百分位则超过 7000 美元。
到 6 月之前,OpenAI 的研究人员仍然比他们的 agent 工作更多,但到了 8 月中旬,agent 完成的工作量已是人类的 3 倍。
可以说,OpenAI 的研究人员是一个极端案例,但这些数字展示了当 agent 使用开始规模化时会发生什么。一个人在推理量上可以突然远超其人头数所暗示的水平。
Agents API 通过将编排层从账单中剔除,降低了实验成本。开发者只需为他们 agent 实际使用的模型、工具和托管计算付费。
另一方面,这也意味着消耗更多推理变得更加容易。Context 压缩就是一个很好的例子。完整的 context window 过去会迫使开发者决定丢弃什么,或者如何总结迄今为止的工作。现在 API 自动处理这些,agent 继续运行。这对开发者很有用,但也意味着工作量不会在 context window 填满时停止。
Astra 的推出提供了一个可能的预览。OpenAI 在模型 9 月 3 日发布不到两周后就停止了接受新的 Pro 订阅者,称这些账户对其系统的压力最大。Agents API 有自己的速率限制和使用层级,所以 Pro 暂停不会直接影响使用它的开发者,但公司已经在不得不围绕其最新的模型管理容量。
开发者运行的 agent 越多、运行时间越长,用量就累积得越快。一个开发者可能同时拥有多个 agent 并行工作,每个 agent 在任务过程中多次回调模型。所以仅仅看人头数并不能说明实际消耗了多少算力。
对于长时间运行的 agent,挑战在于保持工作推进的同时不浪费 token 或丢失任务轨迹。Cloudflare 今年夏天也做了类似的押注,认为 AI 工作负载周围的基础设施最终会变得和模型本身一样重要。