前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8836
  • MCP Nexus 1.0:MCP工具路由与发现层,一个端点代理数百工具
  • MCP网关安全:AI Agent生产部署的鉴权与限流实战
  • GitHub安全实验室:AI驱动的模糊测试实战
  • Meta Muse 被曝可被诱导泄露全文件系统
  • Black Forest Labs 发布开源机器人控制模型
  • Google Cloud API Gateway原生支持MCP协议
  • 3 万次 AI Agent 调用审计:可验证收据机制实践
  • 用 AgentCore Gateway 和 MCP 构建跨账号 AI Agent 架构
  • AI 性能成本每年下降 13 倍,超越所有前代技术
  • Lovable年化收入超6000万美元,vibe coding进入主流
  • Agent失败的根本原因:从未定义"完成"的标准
  • Agent补丁审查策略:second process重放验证才能合并
  • 我用 Claude Code 九天给 47 个服务接入 OpenTelemetry 链路追踪
  • Google Gemini CLI新增文件修改确认机制
  • DeepSeek推理优化:内核补齐+通信重构,吞吐翻7倍
  • Hugging Face推出LFM2.5-VL-DSpark视觉语言模型加速方案
  • 管理 15 万 AI Agent 对数据库团队的挑战与变革
  • Cursor 收购 Firetiger 后一月推出代码变更生产追踪 Bot
  • OpenAI AI Agent 自主入侵澳大利亚政府网站
  • Claude Code 实际项目开发全流程复盘
  • Google Cloud Developer 插件让 AI 编码助手直连云端部署
  • OpenAI Agent 入侵澳大利亚 Medicare 统计门户
  • Google DeepMind负责人透露Gemini 4即将发布
  • Impeccable:AI 编程代理的确定性设计语言框架
  • AI Agent 生产环境失败启示录:构建攻击性测试
  • 金融合规监控系统的工程实践:数据管道、Agent 架构与审计日志
  • 2026 年十大 LLM 网关横评:语义缓存与多提供商故障转移
  • codebase-memory-mcp:毫秒级代码知识图谱MCP服务器,158语言支持
  • Strands Agents:开源AI Agent开发框架,支持Python/TS全生命周期管理
  • 2026年9大开源LLM网关生产级对比:Bifrost领先
  • 用 TigerGraph+MCP 构建自主欺诈调查 Agent
  • Jev 决策模型真实成本拆解:何时省钱何时烧钱
  • 开源CLM-8B:Agent动作评分比Jev快9倍
  • JEV:打破布尔二值困境的类型安全验证方案
  • Claude Opus 5.5降价40%逼近前沿性能
  • VS Code 1.139:Agent 会话首次加载提速约 12 倍
  • 定时 Agent 总重复干活?用完成分类账让它知道什么是「做完」
  • TypeSafe AI Jev 编码指南:类型化决策、置信度校准与推测式广播
  • Vercel Connect 新增 TanStack AI 集成
  • Anthropic与OpenAI 90分钟内相继降价
  • 选LLM API的六个价格陷阱
  • Agent记忆正常仍出错:问题在状态不在记忆
  • Mercury 2.5 推理速度达 770 tokens/秒
  • GitHub Copilot 代码审查新增个人配置选项
  • MCP单人上手容易,团队规模落地是另一回事
  • 已加载 45 / 8836
8.0
热点
AI SCORE
技术实践2026-09-24 22:17

DeepSeek推理优化:内核补齐+通信重构,吞吐翻7倍

量子位#推理优化#DeepSeek#GPU
Editor brief · 编辑速览

通过内核补丁和通信重构,1.5台PCIe版6000D推理性能超过单台B300,绕过NVLink限制。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

随着大模型对算力需求持续攀升,GPU卡的采购成本、供给约束持续加剧。

AI推理的竞争正在悄然发生转向:不再单纯比拼"谁能够买到性能最顶级的硬件",而是转向"谁可以把手中已有的算力资源用得更值"。

很多GPU卡,开源框架能够完成模型加载、权重下载、服务拉起,实现"能跑起来",但实际压测性能往往远低于官方宣传水平。模型本身没有缺陷,硬件也可正常工作,性能损失的核心,来自模型框架与硬件之间存在的性能鸿沟。

这类GPU卡没有高速卡间互联,同时不在主流开源框架官方验证矩阵中。直接使用社区默认部署方案,会出现算子自动回退至低效通用实现、集合通信沿用NVLink硬件的调优参数、显存与并行配置沿用其他硬件默认值等一系列问题。硬件本身具备的算力潜力,被软件层的适配短板所禁锢。

是石科技(METASTONE)是一家"独立第三方全栈算力运营商"的科技企业。不绑定任何特定大模型厂商,致力于为客户提供涵盖硬件、组网、调度、优化与运营的一站式全栈算力交付服务。

凭借源自国家级计算中心的丰富经验,公司确保了算力集群高达99.95%以上的安全稳定运行(SLA)。目前,是石科技已纳管超过20000P的算力资源,运营10多个智算中心,拥有2个国家级超算中心。团队成员曾荣获3项戈登·贝尔奖,具备深厚的超大规模集群全栈技术服务实力等。

是石科技自研Meta-Infer高效部署引擎,是面向异构加速芯片的企业级高性能大模型推理引擎,尝试通过纯软件优化手段弥合这道硬件-框架之间的缝隙,在不改动模型结构、不修改任务语义的前提下,充分挖掘GPU卡架构硬件的推理能力,为行业提供一种可能性:

依靠软件优化,成本更低的GPU卡,有机会在部分推理业务指标上,逼近原本需要更高端GPU才能实现的服务能力。

Meta-Infer高效推理引擎的整套优化逻辑,分为两大关键阶段:

算模协同,释放被硬件差异屏蔽的高性能路径;

最终将沉淀为Meta-Infer高效推理引擎的四项核心能力:内核补齐、算子优化与通信重构、并行与容量调优、缓存复用。

主流推理框架内置了大量高性能算子,但对于不在官方验证清单的长尾硬件,框架不会报错,只会静默绕开加速路径,降级运行低效通用逻辑。

很多高性能内核并非缺失,只是元数据、页尺寸、硬件内核适配不匹配,导致无法被触发执行。

Meta-Infer高效推理引擎,通过内核补齐完成适配修复:

对齐硬件与框架之间的元数据定义,修正页尺寸配置,解锁原生高性能算子路径;

替换不适配硬件的老旧计算内核,切换为面向目标硬件深度调优的实现;

扩大通信快路径的生效阈值,让更多规模的通信任务避开慢速回退逻辑。

以DeepSeek-V4.1-Flash为例,在8张PCIe-Only显卡环境的社区Day0基线版本中,输入吞吐仅1932 tok/s。

经过算模协同阶段的修复适配,补齐sparse-MLA Prefill快路径,替换FP8稠密GEMM慢内核,扩大PCIe-IPC通信快路径覆盖范围,吞吐直接提升至5850 tok/s。

这一阶段的提升,并不是创造全新算法,而是把硬件与框架本就具备、却被适配问题锁住的性能释放出来。

同样的思路也复现在DeepSeek-V4-Flash、GLM5.3等模型上:修正注意力头补齐的冗余计算,对KV缓存标记逻辑做向量化加速,适配硬件特性重构算子拆分逻辑,拓展CUDA计算图覆盖范围,让更多请求批次可以进入加速图执行。仅仅完成算模协同,多款模型就拿到20%-33%不等的吞吐增益。

完成硬件适配、解锁加速路径之后,性能瓶颈会进一步转移到通信开销、并行调度、显存分配、重复计算等环节。PCIe-Only架构卡间通信带宽远低于NVLink,如果直接套用面向高速互联硬件的默认策略,GPU会花大量时间等待通信完成,算力资源被闲置浪费。

依托算子优化与通信重构,Meta-Infer高效推理引擎对注意力、投影等关键算子做算子融合,压缩单步计算耗时;将计算任务和集合通信做时间重叠掩盖,把统计类计算嵌入通信间隙并行执行;改写集合通信逻辑适配PCIe带宽特性,降低消息传输带来的等待开销。

在此基础上开展并行与容量调优,放弃框架全局固化的并行参数,针对Prefill预填充、Decode生成不同运行阶段差异化配置张量并行、上下文并行策略;结合硬件显存特性,动态调整静态显存占比、KV缓存容量参数,规避显存溢出与算子回退;面向不同业务负载,灵活匹配流水线、张量并行的组合形态,让高并发短请求、超长上下文请求都可以拿到最优执行配置。

面向长文本、视频生成场景,缓存复用能力提供风险感知的缓存复用机制,根据实时生成状态动态判断缓存复用与刷新时机,在不牺牲输出质量的前提下削减重复计算与显存读写。

在DeepSeek-V4.1-Flash的实践中,完成算模协同之后,经过通算重构的全套调优:注意力算子融合、合理裁剪投机解码草稿长度、计算通信重叠、区分Prefill/Decode并行策略、重新调校显存容量参数,输入吞吐从5850 tok/s进一步提升至13274 tok/s,整体实现6.87倍吞吐提升,并且支持1M超长上下文。

这套方法论具备通用性,覆盖文本大模型、长上下文、视频生成多类任务:

DeepSeek-V4-Flash:经过全套优化输入吞吐从14546 tok/s提升至22584 tok/s,提升1.55倍;

GLM5.3:输入吞吐自3236.78 tok/s提升至6222.72 tok/s,提升1.92倍;P95首Token时延从141.6秒下降至46.6秒,上下文支持上限从27万Token拓展到105万Token;

在相同并发点配对比较下,B300的输入吞吐约为这台8卡整机的4.9–5.6倍(DeepSeek-V4-Flash,B300侧按SGLang cookbook推荐参数配置,C8输入33,937 / C256 60,486 tok/s),GLM-5.3 ¹上这一比值为3.5–4.7倍(B300侧C8输入16,384 / C64 23,503 tok/s)。

MiniMax H3视频生成模型:依托稀疏注意力、自研风险感知缓存复用、Turbo LoRA多手段组合,15秒参考图生视频端到端生成速度提升2.48倍,峰值显存与原始稠密基线保持持平。

单机8卡整机配置,文生视频最高吞吐达到基线的5.33倍,参考图生视频达到基线的4.98倍,在不明显损失画质的前提下大幅缩短视频生成耗时。

把这组整机吞吐放到顶级GPU的同一把标尺上,差距比直觉更小:在统一整机口径下(单机8卡、5秒 / 768P / 16:9),文生视频296条/时、参考图生视频131条/时,对应B300的439条/时、225条/时,分别约为其67%和58%(B300侧按SGLang cookbook推荐参数配置,取16实例、每实例Inflight=1的最优档;其中文生视频对照的是B300的FL2VA结果)。

如果进一步按整机吞吐折算,在几乎无损的Ours Cache方案下,约2.6台6000D可对应1台B300的文生视频吞吐,参考图生视频约为2.9台;在Ours Cache + LoRA方案下,这一比例进一步缩小到约1.5台和1.7台。

硬件本身没有变化,性能差距的缩小主要来自软件栈、缓存策略与模型优化方式的组合。

下面这段是参考图生视频(Ref2VA)任务的同题对照,Dense基线、Cache-DiT、Turbo LoRA与本文方案并排呈现。

Meta-Infer高效推理引擎也在国产GPU上完成了验证。

国产GPU往往也不在主流框架的官方验证矩阵内,因此需要针对具体硬件重新梳理执行路径。

例如,注意力模块需要显式启用面向该平台优化的NSA稀疏注意力实现,避免回退到低效路径;Shared Expert融合等默认面向NVIDIA/AMD平台的特性则需要关闭,以绕开不适配实现。

通信策略也需要根据推理阶段分别配置,Prefill采用偏吞吐优化的DeepEP normal模式,Decode采用偏时延优化的low_latency模式,并将Shared Expert与Routed Expert拆分到两条stream中并行提交,以进一步与集合通信重叠。

其中,仅将Shared Expert与Routed Expert改为并行提交,就在35组同配置配对测试中带来了11.26%的吞吐提升。

这说明对于国产算力而言,"能跑起来"同样只是第一步。

通过针对执行路径、通信模式和并行策略进行系统适配,仍可以进一步释放硬件的实际推理性能,使其更接近规模化生产服务所需的性能水平。

全部优化工作均收敛在Meta-Infer高效推理引擎内部,全程无需改动模型权重与模型结构,不改变原有业务任务语义。

对于开源社区大量不在官方验证矩阵内的长尾硬件,行业过往现状往往是:新模型发布,权重可以下载、服务可以拉起,做到"能跑起来",工作就宣告结束。

但这套实践证明,"能跑"和"可用、可规模化对外提供生产服务"之间,还存在巨大的软件优化空间。

在硬件供给存在约束、高端算力成本居高不下的大背景下,Meta-Infer高效推理引擎代表了一条新路线——不必一味追逐最顶级硬件,通过内核补齐、算子通信重构、并行容量调优、缓存复用这套软件体系,充分挖掘现有PCIe架构硬件的潜力。

这为大模型推理业务带来一种值得关注的可能性:借助深度软件优化,成本更友好的PCIe GPU,有机会在部分推理业务指标上向更高端硬件的服务能力靠拢。

硬件的上限由芯片决定,但硬件能实际发挥出多少能力,则由软件决定。

¹ 无损NVFP4量化版本:模型权重以NVFP4部署,保持既有模型计算定义,未引入额外精度损失。

*本文系量子位获授权刊载,观点仅为原作者所有。

出海Agent"小元AI"入驻腾讯WorkBuddy:找买家写开发信谈生意2026-09-24

教机器人干活,光"刷课时"可不够!灵初这次较真数据质量2026-09-24

Jev vs Decitron:同为决策AI,为什么不是一回事?2026-09-23

刷视频也能教会机器人干活!1200亿tokens人类动作预训练,误差按幂律下降2026-09-23

围绕AI的根本范式、算力瓶颈等议题展开分享

最优的TTS方法高度依赖于具体的策略模型、过程奖励模型(PRM)和问题难度

量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1

Original source

本文由 AI 翻译整理自 量子位,原文版权归原作者所有。

阅读英文原文
上一篇
Google Gemini CLI新增文件修改确认机制
下一篇
Hugging Face推出LFM2.5-VL-DSpark视觉语言模型加速方案