Prime Intellect在NVIDIA Blackwell上推出OpenAI兼容的推理平台,GLM-5.3模型通过KV压缩实现每用户101 tok/s的高吞吐。
Prime Intellect 推出了 Prime Inference,一个面向前沿开源模型的推理服务平台。该平台提供无服务器端点和按需预留容量两种模式,底层依托 Prime 自有 GPU 集群,遍布多个数据中心。在正式公开发布前,平台已在内部日均处理近万亿 tokens,流量来源涵盖 RL rollout、合成数据生成、评测任务以及长时间运行的编程 Agent。
Prime Inference 是 Prime Intellect 开源训练栈的推理服务层。该公司此前已推出后训练工具链,包括 prime-rl、verifiers 和 sandboxes。推理服务的补全打通了整个闭环:部署的模型产出的生产级 trace 可以直接回流至训练流程。Prime 披露其 GLM-5.3 端点在 OpenRouter 上属于速度最快的梯队,同时宣称工具调用错误率接近零,自上线以来保持 100% 可用率。
两种模式:serverless 端点应对波动型需求,预留容量承接持续型负载。
OpenAI 兼容:指向任何 OpenAI SDK 接入 https://api.pinference.ai/api/v1(文档)。
可用性:跨数据中心自动故障转移,将流量路由至健康的实例。
硬件:当前基于 NVIDIA Blackwell,Vera Rubin 已在路线图中。
计费:统一计费体系,支持团队级用量追踪。各模型定价尚未在文档中完全公开。
该栈整合了 NVIDIA Dynamo、vLLM、Mooncake 和 FlashInfer,与 Inferact 和 NVIDIA 联合构建,修复方案已贡献回上游。
目标负载类型为 Agentic。一个典型的 Agent 对话轮次向 140K tokens 的提示词追加约 6K tokens。Prime 使用 SemiAnalysis AgentX 和注入冷启动请求对该混合负载进行基准测试。
Prefill/decode 分离:Prefill 和 Decode 运行在不同的 GPU 分组上。Dynamo 负责路由,vLLM 在各分组上执行模型推理。Decode 节点通过 NIXL 拉取已计算的 KV。Prime 报告其测试中 p90 inter-token 延迟降低近 40%。
缓存感知路由:Dynamo 的 KV 感知路由器在缓存前缀重叠度与排队任务之间权衡权重。各轮对话保持在同一 Decode 节点上运行。Mooncake 在主机 DRAM 中增加了第二层 KV 缓存。
交互性目标为每用户每秒端到端 100 个 output tokens。以此为基准,1:4 prefill/decode 配比可服务最多用户。在该配比下,每个 prefill 分组达到 66 个并发会话,每用户 101 tok/s,每 GPU 100 output tok/s。
DEP8 prefill 拓扑:在相同硬件上,可用前缀缓存容量约为 TEP8 的 5 倍。
更小的 prefill 预算:将每步 tokens 从 8K 减半至 4K per GPU,中位队列等待时间从 550ms 降至 110ms。中位首 token 时间(TTFT)降低约 20%。
NVFP4 KV 压缩:每个 MLA cache row 从 576 字节缩减至 352 字节。每个 decode 节点可缓存的 tokens 从 1.09M 提升至 1.63M。
原生 sparse-MLA kernel:15 query tokens 场景下约 12.0 μs,对比分阶段处理的 17.7 μs 和 FP8 的 13.7 μs。Prime 指出该数据与具体负载相关。
BLHNC KV 布局:传输描述符从 19,559 降至约 1,940。平均传输时间从 146ms 降至 78ms。
Agent 在工具调用携带错误名称或破损参数时会失败。Prime Intellect 团队向 Dynamo 贡献了 structural-tag builder 以支持 GLM 的工具格式。vLLM 随后使用 xgrammar 对违反工具 schema 的 token 进行 mask。团队还修复了解析 bug,包括 < 在代码内部被错误解码为 <。
| 功能 | Prime Inference | Together AI | Fireworks AI | Baseten |
|---|---|---|---|---|
| GLM-5.3 无服务器版 | 有(来源) | 有(来源) | 有(来源) | 有(来源) |
| GLM-5.3 价格,百万 tokens 输入/输出 | 文档中尚未公开 | $1.40 / $4.40(来源) | $1.40 / $4.40(tracker) | $1.40 / $4.40(tracker) |
| 专用或预留容量 | 预留容量;一键专用部署已在路线图 | 专用模型端点(来源) | 按需专用 GPU 部署(来源) | 专用 GPU 部署(来源) |
| OpenAI 兼容 API | 是 | 是 | 是 | 是 |
| 批量推理 | 已在路线图 | 有(来源) | 此处未比较 | 此处未比较 |
| 公开的推理栈 | 开源:Dynamo、vLLM、Mooncake、FlashInfer | Together 推理研究栈 | Fireworks 推理栈 | Baseten 推理栈(来源) |
竞品价格于 2026 年 10 月 2 日核实。Tracker 数据来源于第三方价格追踪平台 ComputePrices。
Prime Inference 现已上线,提供无服务器和预留容量两种推理服务模式,面向开源模型。
GLM-5.3 运行在 GB200 NVL72 上,底层技术栈为 Dynamo、vLLM、Mooncake 和 FlashInfer。
1:4 prefill/decode 配比下,每个 prefill 分组达到 66 个并发会话,每用户 101 tok/s。
NVFP4 KV 缓存将每个 decode 节点的容量从 1.09M 提升至 1.63M tokens。
批量推理和一键专用部署已列入路线图。