技术文章通过实际测试对比CPU和GPU上本地LLM推理的速度差异。帮助开发者选择合适的硬件方案部署本地模型。
这是我对本地 LLM 推理速度研究的第一部分。这里还有第二部分和第三部分。
我整理了一张表,汇总评论区里的所有测试结果。表格顶部优先放置我亲自测量的数据,因为这些测试的环境由我控制,我对测量一致性也更有信心(例如使用了正确的模型、消息长度相近,并确保各项设置保持一致等)。
一个小发现:在对 RTX 4060 和 4090 超频时,我注意到 LM Studio/llama.cpp 并不能从核心频率提升中获益,但提高显存频率却能带来性能增益。
3 月 14 日更新:测试了更多配置。
如今,LM Studio 等工具让我们可以轻松地在消费级硬件上查找、下载并运行大型语言模型。典型的量化 7B 模型(拥有 70 亿个参数,并将每个参数压缩至 8 bit 甚至更小)需要 4~7GB RAM/VRAM,这正是普通笔记本电脑通常具备的配置。
LM Studio 允许你选择使用 CPU 和 RAM 运行模型,或使用 GPU 和 VRAM 运行模型。它还会在聊天对话框底部显示 tok/s 指标。
我使用了这个经过微调、大小为 5.94GB 的 Mistral 7B 版本,对这两种方案(CPU 与 GPU)进行了快速测试,结果如下。我还加入了几个启用 Flash Attention(FA)的测试场景(该选项是在近期版本的 LM Studio 中新增的,位于「Model initialisation」类别下)。
2021 款 M1 MacBook Pro,10 核 CPU(8 个性能核心和 2 个能效核心)、16 核 iGPU、16GB RAM。
2021 款 M1 MacBook Pro,10 核 CPU(8 个性能核心和 2 个能效核心)、16 核 iGPU、16GB RAM。
2023 款 AOKZOE A1 Pro 游戏掌机,AMD Ryzen 7 7840U CPU(8 核、16 线程)、32GB LPDDR5X RAM、Radeon 780M iGPU(使用系统 RAM 作为 VRAM),TDP 为 30W;3DMark Time Spy GPU 得分 3000,3DMark Time Spy CPU 得分 7300。
2023 款 AOKZOE A1 Pro 游戏掌机,AMD Ryzen 7 7840U CPU(8 核、16 线程)、32GB LPDDR5X RAM、Radeon 780M iGPU(使用系统 RAM 作为 VRAM),TDP 为 30W。
3DMark Time Spy GPU 得分:3000。
3DMark Time Spy CPU 得分:7300。
2023 款 MSI Bravo C7VF-039XRU 笔记本电脑,AMD Ryzen 5 7535HS CPU(6 核、12 线程、54W)、16GB DDR RAM、GeForce RTX 4060(8GB VRAM、105W)。GPU 进行了轻微降压/超频;3DMark Time Spy GPU 得分 11300,3DMark Time Spy CPU 得分 7600。
2023 款 MSI Bravo C7VF-039XRU 笔记本电脑,AMD Ryzen 5 7535HS CPU(6 核、12 线程、54W)、16GB DDR RAM、GeForce RTX 4060(8GB VRAM、105W)。
GPU 进行了轻微降压/超频,3DMark Time Spy GPU 得分:11300。
3DMark Time Spy CPU 得分:7600。
台式 PC,AMD Ryzen 7 7800X3D(8 核、16 线程,测试期间功耗为 78W)、DDR5-6200、GeForce RTX 4080(16GB VRAM,轻微超频,测试期间功耗为 228W)。
台式 PC,AMD Ryzen 7 7800X3D(8 核、16 线程,测试期间功耗为 78W)、DDR5-6200、GeForce RTX 4080(16GB VRAM,轻微超频,测试期间功耗为 228W)。
我突然意识到,普通人的打字速度大约为每分钟 30~40 个单词,而 RTX 4060 能达到每秒 38 tokens(约每秒 30 个单词),相当于每分钟 1800 个单词。
感谢 Sergey Zinchenko 补充了第四套配置(7800X3D + GeForce RTX 4080)。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。