指南介绍本地运行开源模型的关键约束是内存容量,详细讲解量化精度(2-8bit)对质量和大小的权衡,以及Apple Silicon和NVIDIA的消费级GPU选型建议。
在前两期中,我介绍了评估开源权重模型时需要关注的四个指标,以及如何通过第三方提供商访问这些模型。
本期的主题是在本地硬件上运行开源权重模型。
主要限制因素基本上是内存。权重文件必须能容纳在你所用机器的内存中。如果文件大于可用 RAM(或 VRAM),性能会直接归零,根本无法运行。量化是本地使用时最需要关注的指标。模型的发布或转换通常采用 2-bit、4-bit、6-bit 或 8-bit 精度。位深越低,文件越小,但通常会带来明显的质量损失。
目前本地推理有两个主流硬件系列。
Apple Silicon 覆盖 MacBook Air、MacBook Pro、Mac Mini 和 Mac Studio。内存从低配的 16 GB 到顶配的 512 GB 不等。统一内存架构在这类工作负载下表现出奇地快,这也是为什么即使是中配的 Mac,在运行良好量化的模型时也能有不错的响应速度。
NVIDIA 是另一个主要选择。消费级 GPU 通常提供 8 GB 到 24 GB 的 VRAM。基于 Blackwell 平台构建的大型系统(DGX Spark 以及遵循相同规范的其他厂商主板)提供更大容量。在某些配置下,还可以连接多台机器来聚合它们的内存。
一个粗略的实用对照大致如下:
高端配置都不便宜,超大容量的配置对大多数人来说仍然遥不可及。然而,中端配置对于很多实际工作已经足够实用。
运行模型只是任务的一部分。你仍然需要一种方式来与它对话、管理会话,以及赋予它工具。这一层叫做 harness,这将是最后一期的主题。
第三期已上线。完整系列播放列表:https://youtube.com/playlist?list=PLKxL2crAoLBU&si=3nDQeNgCw51rFDuG