通过自适应学习和投机执行加快 LLM 推理速度,对实际应用中降低延迟和成本有直接帮助。
在 AI 原生云 Together AI,我们对性能有着近乎执着的追求。要让大型语言模型更快、更便宜、更高效,无法只靠某一个技巧解决——它需要沿多个维度同时进行优化。这正是 Together Turbo 背后的理念:这套推理创新方案融合了算法、架构和模型训练方法等多个领域的研究成果。我们很高兴推出 AdapTive-LeArning Speculator System(ATLAS,自适应学习 Speculator 系统)。这是首个无需任何手动调优,便能自动提升性能的同类 Speculator。
ATLAS 提供了一种全新的 speculative decoding 方式——它能够在运行时动态改进,并且可以与其他 Turbo 技术无缝配合,例如专有的 Together Turbo Speculator 或 Custom Speculators。但我们为什么要创建一个具备自适应学习能力的 Speculator 系统?
标准 Speculator 面向通用工作负载进行训练。Custom Speculator 则根据你的特定数据训练,但它只适用于某个特定时间点的数据快照。随着工作负载不断演变——代码库扩大、流量模式转移、请求分布改变——即使经过高度定制的 Speculator,也可能逐渐跟不上变化。相比之下,ATLAS 会随着使用自动演进,同时从历史模式与实时流量中学习,持续实时对齐目标模型的行为。这意味着,我们的推理服务用得越多,ATLAS 的表现就会越好!
ATLAS 构建在 Together Turbo Speculator 之上。在完全适配的场景中,它可以让 DeepSeek-V3.1 达到最高 500 TPS,让 Kimi-K2 达到最高 460 TPS——比标准 decoding 快 2.65 倍,甚至超过了 Groq 等专用硬件(图 1)。
Speculative decoding 是加速推理最强大的手段之一。² 它不再让目标模型逐个生成每个 token,而是由一个速度更快的 Speculator(也称为 draft model)提前提出多个 token,再由目标模型通过一次 forward pass 并行验证这些 token。验证过程可以确保输出质量与非 speculative decoding 的分布保持一致,同时通过一次接受多个 token 获得速度提升。
整体速度受到接受率 $α$ 和 draft 相对于目标模型的延迟比 $c$ 影响。接受率 $α$ 指目标模型同意 Speculator 所生成 draft token 的频率。通常,参数更多、规模更大的 Speculator 因为容量更高,能够取得更高的接受率,但生成 draft token 的速度也更慢。因此,性能改进需要从两个方向同时推进:一方面,对齐 draft model 与目标模型以提高 $α$,涉及训练目标、数据和算法;另一方面,设计能够在保持 $α$ 的同时降低 $c$ 的 draft model 与 kernel,涉及稀疏化、量化、轻量级架构和 kernel 高效架构。理想的平衡点,是让较高的 $α$ 与较低的 $c$ 相结合,从而最大限度降低端到端延迟。
在 Together AI,Turbo 团队综合运用架构、稀疏化、算法、后训练方案和数据等领域的进展,开发出高性能 Speculator,并在 NVIDIA Blackwell 上实现了世界领先的 decoding 速度 [1-9]。我们构建了一套 Speculator 设计与选择框架,用于确定最优的 Speculator 架构,包括宽度与深度、lookahead、稀疏化与量化,以及 KV 复用;同时还构建了可扩展的训练系统,能够快速、可复现地为规模最大、最具挑战性的开源目标模型训练 Speculator,例如 DeepSeek-V3.1 和 Kimi-K2。
以 Kimi 为例,它本身并未附带开箱即用的 Speculator,但我们可以快速完成训练和部署。在相同硬件和 batch 设置下,将 Kimi 从开箱即用时约 150 TPS 提升到 270+ TPS,同时保持目标模型的输出质量不变(参见图 1 中的黄色柱状图)。这套 pipeline 为 Turbo Speculator 提供了支撑,使其能够实现业界领先的 decoding 延迟;它也为下一阶段奠定了基础:构建一个能够实时根据工作负载调整 token drafting 策略的 Adaptive-Learning Speculator System。
Together AI 承载着广泛多样的推理工作负载。然而,目前的 speculative decoding 方法受限于静态 Speculator:它们在固定数据集上训练,部署后便无法继续适应。如果输入分布发生变化,性能就会不断下降。这个问题在 serverless 多租户环境中尤其突出,因为其中的输入极其多样。新用户不断涌入,并带来各自独特的工作负载,而固定 Speculator 在训练期间可能从未见过这些负载。
此外,这些 Speculator 通常采用固定的 lookahead,无论自身置信度如何,都会预测相同数量的 token。简单来说,静态 Speculator 无法跟上持续发生的变化。
为了解决这些局限,我们设计了由两个相互协作的 Speculator 组成的 Adaptive-Learning Speculative System,如图 3 所示:
一个重量级静态 Speculator,在广泛语料库上训练,提供强大且通用的 speculation 能力。
一个轻量级自适应 Speculator,能够基于实时流量快速更新,更新开销较低,并可即时针对新出现的领域进行特化。
一个能够感知置信度的 controller,在每一步决定应信任哪个 Speculator,以及应采用多长的 speculation lookahead;当 Speculator 置信度较高时,就使用更长的 speculation。
通过静态 Speculator 建立效率护栏。 静态 Turbo Speculator 提供了一条始终生效的速度底线:它在广泛语料库上完成训练,面对不同工作负载时依然保持稳定,因此即使流量模式发生变化,或者自适应路径尚处于冷启动状态,TPS 也不会骤降。在 ATLAS 中,我们使用它来快速获得初始速度,并提供故障安全回退机制——当置信度下降或检测到分布漂移时,controller 会缩短 lookahead,或切换回静态路径,在自适应 Speculator 重新学习期间维持延迟表现。
Customized Speculator 与 Adaptive-Learning。 根据我们之前的研究,如果使用真实流量中能够反映预期使用模式的样本来训练 Customized Speculator,就能进一步提升速度。Adaptive-Learning Speculator 则让我们可以实时实现更深度的定制。例如,在 vibe-coding 会话中,自适应系统可以针对正在编辑、且训练期间从未见过的相关代码文件,对轻量级 Speculator 进行特化,从而进一步提高接受率和 decoding 速度。这种即时特化能力很难通过静态 Speculator 实现。
加速 RL 训练。 强化学习(RL)会在两个阶段之间交替进行:(1)rollout 阶段,当前 policy 生成 trajectory 并接收 reward;(2)update 阶段,使用 reward 更新 policy。在实践中,rollout 往往是瓶颈,约占总墙钟时间的 70%。³ 一般来说,由于 policy 分布会在训练过程中持续变化,静态 Speculator 很快就会与目标 policy 失去对齐,导致吞吐量无法达到最优。⁴ ATLAS 通过在线适应不断演变的 policy 和特定 RL 领域来解决这一问题,从而维持对齐并减少总体 rollout 时间。RL 所具有的领域特定性和迭代特征,也进一步支持快速适应,从而带来持续且不断增长的加速效果。如图 4 所示,将 ATLAS 应用于 RL-MATH pipeline 后,随着训练推进,加速效果会不断提高。
作为 Turbo 优化套件的一部分构建。 Adaptive-Learning Speculator System 是完整 Turbo 优化套件的核心组件,其中每一层优化都会叠加并放大其他优化所带来的收益。如图 5 所示,性能首先通过近乎无损的量化逐步提升——这种量化经过校准以保持输出质量——随后叠加 Turbo Speculator,最后再加入 Adaptive-Learning Speculator System。该套件还包含其他优化,例如用于降低 time-to-first-token 延迟的 TurboBoost-TTFT(图中未展示),进一步推动端到端加速。
极致的峰值效率。 当输入分布较窄,并且输出与之前见过的 token 高度相似时,自适应系统可以快速完成特化。在这种场景下,controller 会更有信心地使用轻量级 Speculator 提供的更多 token,并增加 lookahead token 的数量。由此带来的 TPS 能够持续高于静态 Speculator 或一次性 Custom Speculator 所能维持的水平。
如图 1 和图 5 所示,在完全适应 Arena-Hard 流量后,DeepSeek 使用 4 块 B200 GPU、batch size 为 1 时,可以达到每秒最多 500 个 token。与 FP8 baseline 相比,其速度提升了 400%,即从 105 TPS 提升到 501 TPS。
我们的工作建立在充满活力的 speculative decoding 研究生态之上:从早期的 draft-and-verify 方法,如 Fast Inference from Transformers via Speculative Decoding 和 Speculative Sampling,到 Medusa、OPT-Tree 和 EAGLE 系列等结构化变体。较新的研究则让 speculation 具备了自适应能力:Online Speculative Decoding,