同一开源模型经不同服务商推理速度可差4-10倍;Baseten工程师详解缓存感知的路由调度、投机解码策略、量化误差相互抵消的层预测技术,比NVIDIA方案压缩率提升20%。
同一个开源模型,由不同提供商部署,速度差异可达 4 倍甚至 10 倍。所以"用哪个模型"只回答了一半的问题。另一半是谁来做推理。
Baseten 的 Philip Kiely 和 Ali Taha 在 Latent Space 节目中对整个推理栈做了完整剖析。有几点值得借鉴:
第一个问题不是"用哪个 GPU",而是"你之前给我发过这个吗"。缓存感知的路由会寻找有空闲 prefill worker 且已缓存部分输入的副本,这样就能跳过部分 prefill 阶段。然后 prefill 和 decode 在不同的 GPU 集合上运行。一个 speculator 模型坐在前面,如果它训练时假设你是在写代码,那你的 draft token 接受率就会很高。让它去总结所有《哈利·波特》书籍,速度反而会降下来。
行业共识认为量化是有损的,所以压缩得越狠就越差。但 Baseten 的研究表明,量化误差可以相互抵消,而且可以预测哪些层会相互抵消。对那些层进行量化。经过第 1、5 和 10 层量化的模型可以胜过只量化了第 1 和 2 层的模型。他们的 GLM-5.2 量化方案比 NVIDIA 的方案多量化了 20%,这意味着在更好质量的条件下实现 20% 的吞吐量提升。他们用 KL 散度对比全精度 logit 分布来证明这一点,而不是基准测试。
一个 1T 参数的模型,在现成引擎上运行,没有 speculator、没有 KV 路由、没有 disaggregation,运行速度大约在 30 到 50 tokens/秒。优化后,300 到 400。倍数关系:BF16 到 NVFP4 大约 2x,speculative decoding 大约 2x,prefill/decode disaggregation 大约 2x,再加上更好 kernels 的两位数提升。10 倍是激进的,4 到 6 倍是现实的。固定硬件,纯推理工作能拿到 2x 到 4x。speculation 加 quantization 大约能覆盖 95%。
我最喜欢的一句话正是关于此的。在金融领域,你用基点来衡量进展,5 个基点就是大新闻。而在推理领域,数字仍然是 20%、100%、200%。当你看到研究人员开始发表关于"提速 1%"的论文时,就说明推理问题已经解决了。
对于任何基于模型 API 构建应用的人来说,这很令人不安。模型是可以替换的,但推理质量不是。这意味着真正的决策从来不只是选哪个模型,而是选哪个模型、由谁来做推理、以什么价格。
基于 Philip Kiely 和 Ali Taha 在 Latent Space 的节目。技术细节来自原始节目和 Baseten 发表的研究。