8.0
热点
AI SCORE
技术实践2026-08-08 19:50
单卡运行284B MoE模型:79%时间在等硬盘
dev.to · AI#MoE模型#推理优化#DeepSeek
Editor brief · 编辑速览
DeepSeek V4 Flash通过MoE稀疏激活+专家流式加载技术,在32GB显卡上运行大模型,延迟问题本质是带宽问题。
混合专家模型每处理一个 token 只会唤醒自身的一小部分。256 个专家中取 6 个,分布在 43 层中。所以问题不再是"如何把 96 GiB 塞进 32 GiB 的显存",而是"从硬盘读取缺失部分的速度能有多快"。
Crow 将始终活跃的部分保留在显卡上,每层保留 64 个最有用的专家紧邻其侧,在 GPU 工作的同时流式传输缺失的部分。主机端峰值内存为 1.28 GiB。在 200k 上下文下解码速度约为 12 tok/s。
真正有趣的不是吞吐量。是 79% 的请求时间都在等硬盘,所以这是个戴着带宽面具的延迟问题,所有有效的优化手段都作用在延迟上。
模型:DeepSeek V4 Flash 完整详情见 GitHub:Crow on Github