8.0
热点
AI SCORE
技术实践2026-08-24 10:09
摩尔线程发布 S5000 白皮书:Prefill/Decode 解耦破解长上下文推理成本困局
IT之家#摩尔线程#LLM推理#长上下文
Editor brief · 编辑速览
摩尔线程提出将 Prefill(计算密集)与 Decode(访存密集)彻底解耦,分别部署在专用算力池,实现单位 Token 基础设施成本下降,为 Agent、代码生成、超长文档分析等场景提供可落地方案。
随着大模型输入上下文规模快速迈入数百 K 到 1M 级别,长文本输入带来的算力消耗与首字时延压力持续攀升,正日益成为制约企业推理服务效率与总拥有成本(TCO)的关键瓶颈。传统同构集群的算力部署模式,已难以应对不同计算阶段对硬件资源的差异化需求。
核心痛点在于结构性错配:在大模型在线推理中,输入阶段的 Prefill(预填充)属计算密集型任务,受浮点算力约束;输出阶段的 Decode(解码)属访存密集型任务,受显存带宽约束。
两者在同一物理资源池中混跑,必然导致双向浪费——按 Decode 带宽选型,则 Prefill 的大容量显存长期低效;按 Prefill 算力选型,则 Decode 计算单元大面积空转。《白皮书》指出,突破这一瓶颈的关键在于将 Prefill 与 Decode 彻底解耦,使二者各自运行在最契合自身计算特性的硬件资源池上:
通过硬件分层投入,算力配置从"通用冗余"转向"按需匹配",在满足服务质量(SLO)约束的前提下,实现单位 Token 基础设施成本下降。
