分布式算力新架构:性能翻倍成本砍半
新的分布式计算架构通过 PD 分离优化资源调度,延迟降 50%、成本降 40%。对大规模分布式系统开发有技术借鉴价值。
新的分布式计算架构通过 PD 分离优化资源调度,延迟降 50%、成本降 40%。对大规模分布式系统开发有技术借鉴价值。
在刚刚落幕的 2026 WAIC 世界人工智能大会上,无问芯穹首次公布了其在大模型推理系统架构中的新突破——跨集群异构推理架构 PDD。
技术报告地址:https://github.com/infinigence/pdd
该架构以高性价比的广域网以太网串联多地已建成的同构数据中心,并将传统的 PD 分离链路“P-D”创新解构为“P-RLD-MD”三级分离式推理架构。
在让“偏科”的硬件只做自己最擅长的工作的同时,更突破性地解决了以太网环境下 KV Cache 的传输延迟痛点。
实测数据显示,该架构在实现首 Token 延迟降低 51.5% 的同时,单 Token 成本可降低 37.5%。
这不仅意味着用户端的速度体验得到了显著提升,更实现了全域异构算力的最大化调度,让分散各处的存量集群资源能够充分释放产业价值。
今天,无问芯穹推理团队将首次分享这一架构的完整设计推演,深度还原技术创新背后的思考路径与攻坚细节。
过去一年里,大模型推理的成本和效率,成为整个行业共同面对的“生死线”。
行业共识在于:LLM 的推理存在 Prefill(预填充,计算密集型)和 Decode(解码,访存密集型)两个特性迥异的阶段。
理论上最理想的解法是“异构分离”路线:让算力强的卡负责 Prefill,让显存带宽高的卡负责 Decode。
要在同一个集群里构建大规模异构算力资源,不仅采购成本极其高昂,而且一旦模型架构发生变化,这些固定配比的硬件便很容易出现部分闲置的情况。
为什么不把分布在各地、已经建好的同构集群,通过低成本的广域网以太网连接起来,实现跨集群的异构分离式推理呢?
这一想法看似水到渠成,但一旦落实到具体工程实践中,便立刻撞上了一堵“叹息之墙”——KV Cache 的跨集群传输带宽和延迟瓶颈。
PDD 架构正是为了攻克这一难题而设计的。
但在深入介绍这一架构的设计与实现细节之前,想先与大家分享无问芯穹团队在前期研究中发现的几个极其关键的“底层规律”。它们也是整个跨集群 PD 方案能够成立的核心前提。
要理解 PDD 的设计,需要从无问芯穹在 PDD 技术报告 Background 部分揭示的三个核心 Insights 入手。
LLM 推理的 Prefill 与 Decode 两个阶段对硬件资源的需求南辕北辙。无问芯穹团队在内部基准测试中也发现,芯片的性能极度“偏科”:
以 8 卡的某旗舰高性能 GPU 为基线,某厂商的 E 芯片在处理计算密集型的 Prefill 阶段时,只能达到基线约 81% 的性能;但在访存密集型的 Decode 阶段,它却能爆发出基线 210% 的性能。
如果把这类“偏科”芯片放在同构集群里,既要承担 Prefill 计算,又要负责 Decode 输出,不但自身的长板优势无从发挥,反而会拖慢 Prefill 阶段的整体效率。
这一发现强烈激发了无问芯穹团队的想法:将 Prefill 与 Decode 拆分、解耦,分别部署在最适合它们的硬件上。
仅仅考虑计算和访存还不够,跨集群传输庞大的 KV Cache 会瞬间耗尽广域网带宽。
但好在 Agent 业务有一个显著特征:前缀缓存命中率极高。
利用这一特性,团队在 Decode 端部署了前缀缓存 RadixCache,简称 DRC。
简单来说,DRC 会在 Decode 实例上缓存历史请求的 KV Cache。
当 Prefill 端发现某个请求命中了前缀缓存,它便不需要把整个上下文的 KV Cache 全量传输过去,只需要传输那一点点“增量”即可。
在平均命中率达到 90% 的情况下,DRC 理论上能够将跨集群的带宽需求降低多达 10 倍,初步缓解带宽瓶颈。
然而,带宽虽然降下来了,延迟问题却依然棘手。
在 DRC 技术的加持下,KV Cache 的传输数据量得以降低一个数量级。于是,跨集群 PD 分离最棘手的痛点,集中到了 KV Cache 的传输延迟上。
智能体工作负载具有“三极”特征:上下文极长(动辄 64K)、缓存命中率极高(平均 90%),但输出极短(经常不到 100 个 Token)。
用户发出一个请求,整个输出过程不过十几秒,但首字延迟却要等待几十秒,产品体验直接被宣判死刑。
也正因如此,优化跨集群 KV Cache 的传输延迟,成为必须突破的核心关卡。
如下图所示,团队分析了线上真实业务中的 600 万条请求,其中约 30% 的请求输出 Token 数少于 100 个,约 40% 的请求输出不超过 500 个 Token。
而对于这些请求来说,1~20 秒的 KV Cache 传输占其端到端总延迟(e2el)的 43%~56%,成为最主要的性能瓶颈。
尽管降低跨集群 KV Cache 传输延迟的重要性已经十分明确,但对于这 1~20 秒延迟的具体来源及分布,我们仍然一无所知。
为了探寻延迟的真实分布,首先需要了解输入请求的实际情况:平均 90% 的缓存命中率背后,具体的命中率分布是什么样的?
在拉取真实业务 Trace 进行分析后,我们发现:输入请求的命中率分布极度偏斜。
大约 70%~80% 的请求,命中率都在 95% 以上;只有极少部分低命中率请求,才会携带巨大的 KV Cache 数据包。
随后,无问芯穹团队在 20Gbps 的跨集群专线上进行了微基准测试,对比“真实偏斜分布”和“均匀分布(85%~95% 命中率)”的传输表现,结果令人震惊:
在真实偏斜分布下,P50 传输延迟极低,仅为 248ms,只有极少数低命中率请求会出现 18 秒以上的长尾延迟。
而在均匀分布下,所有请求都具有中等大小的数据包,导致网络连接池瞬间被打满(利用率 100%),引发严重的排队阻塞,P50 延迟飙升至 1210ms,全面崩盘。这还没有计算因连接池耗尽而产生的平均 1682ms 排队时长。
这个发现极为关键:极端传输延迟只集中在极少数低命中率的“刺头请求”上。
在偏斜分布下,大量轻量级请求利用了 TCP 的公平性机制,不会被高负载请求阻塞,并且能够迅速释放连接池。
这说明,想要解决跨集群 PD 传输 KV Cache 的延迟瓶颈,并不需要从全局解决网络延迟,只需要针对这一小部分“刺头”进行优化即可。
基于上述洞察,无问芯穹提出了 PDD(Prefill-RelayDecode-MainDecode)架构。
传统的 PD 分离只有 Prefill(P)和 Decode(D)两层,而无问芯穹团队在中间插入了一个“中继站”——RelayDecode(RLD)实例。
正是这个中继实例,起到了掩盖以太网 KV Cache 传输延迟的作用。
P 实例:位于主集群,负责处理输入 Prompt,生成 KV Cache。
RLD 实例:与 P 实例位于同一个集群,通过高速 RDMA 网络互联,KV 传输延迟仅为几十毫秒。
MainDecode 实例(MD 实例):位于遥远的异地集群,通过广域网以太网与主集群相连,KV 传输延迟达到数秒甚至更久。
当 P 实例完成 Prefill 计算后,它会同时做两件事:
第一,通过高速 RDMA 网络,把 KV Cache“瞬间”传给同一机房内的 RLD 实例;
第二,通过速度较慢、延迟不稳定的以太网,把 KV Cache 传给异地的 MD 实例。
RLD 实例拿到 KV Cache 后,立刻开始解码,向用户输出 Token。
此时,用户根本感觉不到跨集群的 KV 传输延迟,因为屏幕上已经开始显示文字。而在后台,以太网可能仍在传输数据。
几秒钟后,MD 实例终于收到完整的 KV Cache,解码任务便会从 RLD 无缝交接给 MD,由 MD 完成后续大部分的 Token 输出工作。
这就是 PDD 的核心思想:利用本地 RLD 算力,精准掩盖跨集群场景下极少数低命中率请求的网络延迟。
PDD 的三级架构听起来简单,但最大的工程难题在于:当 MD 实例准备就绪后,如何无缝接管 RLD 正在执行的解码任务?
传统做法是,RLD 一边解码,一边把新生成的“增量 KV Cache”通过以太网传给 MD。
但这又掉进了跨域网络传输延迟的坑里,而且还要经过繁琐的 H2D/D2H(显存到内存、内存到显存)拷贝,延迟高且不稳定。
于是,无问芯穹提出了一个反直觉却极其高效的机制:Extend-Decode Handoff(扩展解码交接)。
它的做法是:RLD 绝不传输庞大的 KV Cache,只把生成的“Token ID”传给 MD。传输几个 Token ID 只有几 KB 的数据量,网络开销几乎为零。
MD 收到这些 Token ID 后,利用一种名为“Extend-Decode”的技术——常见于 MTP 多 Token 预测和投机解码——在本地重新计算这些 Token 对应的 KV Cache,同时生成下一个新 Token。
这里又涉及一个反直觉的硬件原理:Decode 阶段是访存密集型的,实际计算量非常轻。
无问芯穹团队在 MD 端重新计算 100 个 Token 的 KV Cache,平均耗时仅为 305.2ms,最大延迟被牢牢控制在 321.4ms,标准差极小,仅为 4.8ms。
而对于数量更少的 Token,重新计算的平均耗时会更低,甚至基本与单个 Token 的解码时间一致。这也是 MTP、投机解码等机制能够加速解码阶段的基本工作原理。
如果采用传统方式,通过以太网传输 KV Cache,平均需要 185.4ms;一旦网络拥堵,峰值便会飙升至 512.6ms,标准差高达 96.3ms。此外,还有额外增加的 24.5ms H2D/D2H 开销没有计算在内,更不用说实际运行中很可能面临的额外排队延迟。
通过这种“只传 Token、本地重算”的方式,无问芯穹团队把一个受网络波动影响极大、不可控的操作,转化成一个确定、可预测的本地计算操作。
为了平衡用户体验与 RLD 负载,他们还设计了“追赶式”和“一次性”两种交接模式,可以根据系统的实时负载动态切换。
如果采用追赶式交接模式,PDD 会以略微增加 RLD 负载为代价,保证用户的首字延迟(TTFT)和每秒输出 Token 数(OTPS)体验,与同一集群内的 PD 分离别无二致。
因此,无问芯穹团队的原则是:RLD 只负责“掩藏延迟”,只给它极少量的计算资源,绝不能让它承担重活。
基于此前发现的“命中率极度偏斜”规律,团队设计了两种不同的流水线编排方式:
P-MD 流水线:对于命中率大于 95% 的高频请求(占比超过 70%),由于数据包极小,可以直接通过以太网传给 MD,根本不需要 RLD 中继。
P-RLD-MD 流水线:只有那些命中率低、数据包大、传输必然卡顿的“刺头请求”,才会被送到 RLD,由其掩盖延迟。
这种设计排除了 P-RLD 编排方式,有效保证 RLD 不会被压垮。
在团队的实测中,RLD 只承担了系统 6.2% 的 Token 生成任务,而 93.8% 的重活都由 MD 完成。
此外,非常关键的一点是,它还保证了 MD 端的缓存命中率始终与 P 端保持一致。
这种一致性进一步保证了 RLD 的负载能够稳定地维持在低位。否则,如下图所示,如果请求的生命周期终结于 RLD,就会产生一种恶性正反馈循环,最终导致 RLD 负载过高而崩溃。
架构设计得再精巧,最终都要在真实业务的压力下接受检验。
因此,团队在 DeepSeek-V4-pro 模型上,使用真实的 Agentic 工作负载 Trace,对 PDD 架构进行了一次全方位测试。
CDC-PD(跨集群、异构芯片的 PD 分离):同样进行跨数据中心传输,使用 DRC 降低传输量,但不使用 RLD 延迟掩盖机制。
IDC-PD(单机房、同构芯片的 PD 分离部署方案):传统的某旗舰高性能 GPU 单机房集群,P 和 D 完全同构,并且都位于同一个 RDMA 网络域内。
实测结果不仅验证了团队提出的理论,甚至超出了最初预期,主要体现在三个维度:
在跨集群场景下,传统 PD 分离架构中用户感受到的 TTFT,会受到广域网以太网传输延迟的制约。
由于网络拥堵,以及部分低命中率请求带来的高传输负载,TTFT 的 P90 延迟飙升至 18.3 秒,P99 甚至逼近 30 秒。
而 PDD 架构成功地将这部分传输延迟掩盖在 RLD 的抢先输出阶段。
由于 RLD 通过同一机房内的 RDMA 获取 KV Cache 后会立刻开始输出 Token,用户无法感知后台以太网长达几秒至十几秒的慢速传输。
最终,PDD 的 P90 TTFT 降低约 46%,从 18.3 秒降至 9.8 秒;P99 也从 29.7 秒降至 14.4 秒。
团队非常关注 RLD 实例是否会成为系统瓶颈。
实测数据打消了这一疑虑:在真实流量下,RLD 实例只承担了系统 6.2% 的 Token 生成任务,约 27 万个 Token;远端 MD 实例则承担了 93.8% 的重活,约 412 万个 Token,两者负载相差高达 15.2 倍。
这证明了无问芯穹团队路由策略的有效性:绝大多数高命中率请求直接通过 P-MD 管线快速完成,只有那些携带庞大 KV Cache 的“刺头请求”才会借用 RLD 的算力进行短暂缓冲。这些请求完成 KV Cache 传输后,会迅速将后续解码任务交接给远端 MD 实例,不会让长输出请求无限期占用 RLD 的计算和存储资源。
这是最重要的结果,直接展现了采用 PDD 架构所带来的有效吞吐(Goodput)提升,证明了 PDD 的实际生产价值。
无问芯穹团队将 PDD 与传统的“单机房同构某旗舰高性能 GPU 集群(IDC-PD)”进行了成本收益核算对比。
在 PDD 部署中,团队在以某旗舰高性能 GPU A 为核心算力的主机房部署 P 实例和极少量 RLD 实例,在以某旗舰高性能 GPU B 为核心算力的远端机房部署 MD 实例。
在严格的 TTFT 约束下(P90 TTFT < 10s,P99 TTFT < 15s),结果显示:
在总成本下降约 3.5%~7.1% 的前提下,PDD 的请求有效吞吐量(RPS Goodput)反而提升了 27.8%,最终使性价比(Benefit-Cost Ratio,BCR)提升高达 37.5%。
需要特别指出的是,这一结果还不是 PDD 的极限。
受测试资源限制,无问芯穹的 RLD 使用了 3 个某旗舰高性能 GPU A 节点,这是以 DP 并行方式运行 DeepSeek-V4-pro 的最小规模。
如果部署规模进一步扩大,RLD 的固定开销将被进一步摊薄。
如果引入比某旗舰高性能 GPU B 更极致的专用推理芯片,性价比还将拥有巨大的提升空间。
此外,由于与 DRC 暂时存在兼容性问题,这次实验并未开启某些关键优化机制,例如 MTP。
开启这些优化机制后,异构方案的性价比还有进一步提升的空间。
PDD 架构不仅仅是一种跨域以太网传输延迟优化技巧,它也承载着无问芯穹对下一代模型即服务(Model-as-a-Service,MaaS)基础设施的核心设计理念与底层判断——极简局部异构,加上灵活远端分离。
未来,我们不需要在同一个机房里堆砌庞杂的异构芯片,只需要在主算力中心保留极小比例的“接力手”,就能像云原生调度资源一样,把庞大的解码任务分发到全国乃至全球的低成本算力节点上。
这为下一代大模型推理基础设施勾勒出了一幅极具弹性和经济性的蓝图。
多种异构算力可以零散、低成本地分布在多个集群中,而这些集群之间则通过扩展性极强的跨域以太网,构成包括“多对一”“多对多”在内的复杂拓扑推理基础设施。
面对因模型迭代、PD 配比变化而产生的资源闲置问题,这种“极简局部异构+灵活远端分离”的跨集群范式,也能大幅盘活存量算力,降低资源闲置比例。
最终,每一块芯片都能被用来完成自己最擅长的工作,全域内的异构算力都将最大限度地释放产业价值。
这一技术突破的背后,是无问芯穹推理团队日夜奋战的成果。
大模型的规模化落地是一场漫长的技术长跑,无问芯穹也将继续深入系统架构的深水区,持续探索、向前突破。
欢迎大家阅读英文技术报告原文,也期待在评论区与各位技术同好交流探讨。
论文地址:https://github.com/infinigence/pdd
超越 OpenAI、Anthropic!国产 AI 安全智能体杀进全球前四、国内第一 2026-07-29
首个鸿蒙 PC 开源 AI 统一工作台 JiuwenSwarm,办公编程一站式搞定 2026-07-29
国产世界模型登顶李飞飞团队榜单!适配国产昇腾算力、代码权重全开源 2026-07-24
AI 最尴尬的短板,中国科学院出手了 2026-07-27
筑基面向 M×N 生态格局的 AI Native 基础设施
量子位 QbitAI 版权所有 © 北京极客伙伴科技有限公司 京 ICP 备 17005886 号-1