GPT-6 Astra Ultrafast 在 NVIDIA Blackwell 架构上实现最高 8 倍 token 生成加速,已在 OpenAI API 和 ChatGPT Work/Codex 上线。
GPT-6 Astra Ultrafast 运行在 NVIDIA Blackwell GPU 上,现已在 OpenAI API 中可用,并向符合条件的 ChatGPT Work 和 Codex 用户开放。
通过 OpenAI 模型利用 NVIDIA Blackwell 架构能力实现的推理优化,Ultrafast 相比 Astra Standard 模式可提供高达 8 倍的 token 生成速度。对于开发者而言,更快的生成速度可以缩短编码智能体的 edit-test-debug 循环,减少在 tool call 之间生成响应的时间,并让交互式应用体验更流畅。
当快速响应贯穿整个工作流时,其价值才最为凸显:智能体编写代码、调用工具、检查结果,然后决定下一步操作。Ultrafast 将 Astra 的能力带入这些时间敏感的场景。当开发者需要时,NVIDIA AI 基础设施帮助 OpenAI 提供更多有用的模型输出。
"NVIDIA 在工具和文档方面的深度投入,使我们能够将模型打造为非常擅长编程 Blackwell 和 Rubin GPU 的形态,"OpenAI 推理负责人 Philippe Tillet 表示。"Astra 能够将这种知识转化为高性能内核,使 NVIDIA 硬件在延迟、吞吐量和成本的完整前沿都具有竞争力。有了 Astra Ultrafast,意味着智能体在编写代码、使用工具和处理复杂任务时能获得更快的模型响应。"
持续提升性能
性能提升不会在模型部署后就停止。OpenAI 正在使用自身模型帮助优化运行在 NVIDIA GPU 上的推理软件,利用平台的可编程性来测试和实现改进。这项持续工作可以使模型响应随时间推移变得更快,部署的基础设施更加高效。
"我们与 NVIDIA 的合作正在帮助我们让 AI 变得更快、更有用,"OpenAI 计算首席技术官 Uday Ruddarraju 表示。"我们使用内部模型来优化 NVIDIA GPU 上的推理,而 NVIDIA 的可编程性帮助我们实现了 Astra Ultrafast 背后的加速。"
可编程的 NVIDIA 平台使开发者和研究者能够在模型演进过程中复用训练、推理和强化学习的基础设施。这种灵活性帮助团队根据需求变化重新分配计算资源,提高利用率并避免为每个工作负载过度配置。
开发者现在可以通过 API 使用 GPT-6 Astra Ultrafast。参见 Ultrafast 指南了解访问权限、定价和实现细节。