OpenAI在构建语音Agent时采用模块化拆分方案,将语音模型"大脑"分离,最终单团队删除了23000行冗余代码以简化架构。
构建 AI 语音 Agent 远比表面看起来更笨重。大多数语音 Agent 实际上是多个系统组成的一条链,对话在链中来回传递。你说的话被转成文本,模型据此决定如何回应,然后答案再被转回语音;不难理解为什么这个过程很容易变得机械。现在,OpenAI 正试图压缩这个技术栈。
周三,公司在 API 中推出了 GPT-Live-1,首次将 ChatGPT 语音模式背后的原生全双工语音架构开放给外部开发者。它不想让开发者管理整条链路,而是让一个模型处理对话,更重的推理工作交给其他地方。
GPT-Live-1 作为对话前线运行。由于它原生支持全双工,它可以跟上对话的实时进度,包括在有人中途插话时,无需开发者协调多个独立系统。但语音模型不必独自完成所有工作。
当一个请求需要更多时间或更多处理时,GPT-Live-1 可以将其转交给后台的另一个模型。这可以是 GPT-6 Astra、更小的模型如 Luna,或者完全来自其他提供商。
等待更大模型响应会让语音 Agent 变得异常尴尬。问一个难题,你可能会在模型处理时陷入沉默。GPT-Live-1 可以保持对话继续——填补停顿、确认说话者——然后在后端完成后将答案融入对话。
OpenAI 表示,GPT-Live-1 在 Full Duplex Bench 上比 GPT-Realtime-2.1 高出 30 个百分点。与 GPT-6 Astra(中等推理)配合使用时,它也在 𝜏³-benchmark 上占据榜首。
GPT-Live-1 通过事件驱动接口暴露委托能力。语音会话生成一个 delegation_id,将上下文发送到处理更重工作的任何后端系统,并通过名为 session.commentary.append 的事件获取结果。语音模型将结果折叠到 ongoing 对话中,而不是大声朗读一段文本。开发者仍然可以看到模型听到和说了什么,并控制何时轮到它发言——他们只是不需要用多个独立系统来构建整个对话。OpenAI 的 API 文档完整介绍了这一模式,包括使用 Codex SDK 的工作示例。
一家早期客户在切换到 GPT-Live-1 后删除了 23,000 行代码。
EliseAI 是一家正在测试该 API 的医疗保健公司,其联合创始人兼 CTO Tony Stoyanov 表示,此次迁移使代码库缩小了 80%。他的团队可以将时间花在患者体验上——让预约和护理导航变得更加容易。
语言学习公司 Speak 在对话本身中看到了差异。在 Live Tutor Lessons 的早期测试中,GPT-Live-1 在某人只是停下来思考时打断对方的可能性降低了近 80%。对于正在学习一门新语言的人来说,这多出来的几秒钟可能是说出答案和被 AI 打断之间的关键差别。
Yelp 已在 Yelp Host 和 Hatch 中使用 GPT-Live-1。CTO Alex Levy 表示,公司看到更多呼叫被 AI 成功处理,而呼叫者在说更完整、更自然的句子——Levy 说,这表明电话另一端的体验是不同的。与公告一同发布的演示准确地展示了原因:一个餐厅预订在有背景噪音和人们互相插话的情况下仍在顺利进行。
GPT-Live-1 的定价为每分钟 0.05 美元,约合每小时 3 美元。此外还有开发者选择在其后运行的服务费用。如果 GPT-Live-1 将请求转交给 GPT-6 Astra,开发者也需要为那次调用付费。Agent 越频繁地调用推理模型,账单就攀升得越快。
OpenAI 一直在下调 API 价格,因为来自 Anthropic、Google 和中国实验室的竞争日益激烈,但前沿推理仍然不是免费的。
权衡之处在于,开发者现在可以选择性地决定在哪里花钱。简单的事情,比如预约,可以交给 Luna。更难的问题,比如真正需要多步推理或工具调用的问题,可以交给 Astra。OpenAI 已经展示了 Astra 可调节的推理设置如何让开发者每次调用时灵活调整成本,而 GPT-Live-1 为他们提供了一个将相同逻辑应用于语音的地方。
使用旧的分级方法,团队可以为语音堆栈的每个部分选择不同的提供商,并在需要时更换各个组件。GPT-Live-1 接管了更多的对话,这也意味着将更多的控制权交给了 OpenAI。
赌注是,如果语音 Agent 最终能够跟上与它们对话的人的步伐,开发者会放弃部分控制权。