完整指南教你在中等配置设备上部署开源 LLM,兼容 Meta、Apple 等框架。
如果你关注大量投资 AI 的公司,如 Meta、OpenAI 或 Apple,你会发现它们都在试图解决一个问题。我发现 Apple 的解决方案比其他方案更有趣,那就是在你的设备上本地运行 AI。为什么这很重要?我希望你读读我的这篇博客文章,这样你即使没有高端设备,也能在你的 PC 或笔记本上运行 AI 模型。如果你不是极客,你可能不知道这个问题在几年前是难以想象的,只有强大的计算机才能做到,但现在在开源社区的帮助下,这已经不是梦想了。
在本指南中,我们将探讨为什么在本地运行 AI 很重要,2025 年你实际需要什么硬件和软件,以及通过一个简单实用的设置来让你的第一个本地模型立即运行。如果你喜欢,请通过阅读我的博客文章来支持我。
在本地运行 AI 模型提供了许多你可能关心的好处,让我们来深入讨论一下。
🔐 完全隐私和控制
网上有一个著名的梗:没有云,只有别人的电脑。
为什么别人能看到我们的聊天、照片和其他一切?
⚡ 即时速度和离线访问
想象一下你的互联网延迟很高或上传速度很弱。你对消除这类限制有什么看法?
额外好处:本地模型完全离线工作。没有互联网连接,没有服务中断,没有速率限制。
💰 长期成本节约
虽然可能需要前期硬件投资,但在本地运行模型消除了反复的 API 费用。你可以进行无限制的推理,无需按标记或按请求收费,将支出从持续的运营费用转移到可预测的一次性设置。对我来说,不再检查剩余标记 :))
多年前,AI 科学家认为 CPU 是我们进行机器学习和 AI 所需的主要动力,但经过测试和比较,他们发现 GPU(Graphics Processing Unit,图形处理单元)比 CPU 更好、更高效。GPU 擅长并行处理,允许它们同时处理数千个操作——这是 CPU 设计效率不高的工作。
Video RAM (VRAM) 是在本地运行 AI 模型的唯一最重要的因素。
把 VRAM 想象成模型的工作区:如果模型不适合,性能会下降——或者根本无法运行。VRAM 的数量直接决定了:
为了能顺利使用现代模型,在 2025 年,8–12 GB 的 VRAM 是实际最低配置。
让我们学习 AI 世界中最重要的词汇之一。量化是一种聪明的技术,可以缩小 AI 模型,使其适应更小的 VRAM 预算。
想象一个专业摄影师的大型高分辨率 RAW 照片。它非常详细——但太大了,无法快速共享或在手机上查看。通过将其压缩为 JPEG,文件变得更小,加载速度更快。虽然损失了少量细节,但图像在视觉上仍然很好,更实用。
量化对 AI 模型的工作方式相同。它大幅度地压缩它们,使其可以在消费者硬件上使用,质量损失最小——通常是难以察觉的。
Pro Tip: 在 Hugging Face 等平台浏览模型时,寻找标记为 GGUF 的文件。这些是预量化的模型,设计用于与 LM Studio 和 Ollama 等工具高效运行。
如果模型太大,无法适应 VRAM——即使在量化之后——系统会退回到使用系统 RAM 和 CPU。
在这些情况下,原始 GPU 速度不如内存带宽和稳定性重要。令人惊讶的是,对于某些工作流程,服务器级 CPU 可以超越 GPU 密集型设置的性能。
Apple 的 M 系列芯片使用统一的内存架构,允许 CPU 和 GPU 共享单个高带宽内存池。这种设计有效地规避了传统的 VRAM 限制,使 Apple Silicon 机器能够运行非常大的模型——通常超过同价位的离散 GPU 能处理的。
要使本地 AI 变为现实,你需要两样东西:
将 AI 模型视为强大的引擎。运行器是围绕它构建的汽车——它让你启动引擎,用提示符引导它,并看到结果。
虽然你的选择可能取决于硬件和经验水平,但这三个工具在 2025 年主导了本地 AI 生态系统。
你的运行器通过专门的加速框架与 GPU 通信:
你通常不需要手动安装这些——最新的图形驱动程序处理一切。
在本部分中,我们将使用 LM Studio,这是在本地运行 AI 模型最简单和最用户友好的工具之一。最好的部分是什么?你不需要 GPU。LM Studio 与纯 CPU 系统完美配合,如果你有 GPU,它会自动使用。
LM Studio 附带了你需要的一切。没有 CUDA,没有环境变量。
一旦 LM Studio 打开:
💡 提示: 如果你的系统没有 GPU,从较小的模型(3B–8B)开始。它们在现代 CPU 上运行得出人意料地好。
你也可以从 Hugging Face 网站下载你想要的模型,那是 AI 模型的 Github。
LM Studio 自动检测你的硬件:
你现在可以开始与你的本地 AI 聊天——完全离线。
要点:GPU 是一个性能升级,不是必需的。在我看来,用 CPU 运行模型只是为了实验和学习。我用第 10 代 Intel CPU 运行了一个小模型,它需要一分钟来写一个大约 100 个单词的段落。
在本地运行 AI 不再是精英或昂贵的实验。
LM Studio 等工具已经消除了几乎所有的摩擦。你不需要是机器学习工程师、Linux 向导或拥有高端 GPU。
下载一个模型。在本地运行它。并按你的方式体验 AI。
只要你有大约一小时的空闲时间,尽快尝试这个过程,这是值得的。
我在聊天机器人的帮助下制作了这篇博客文章的封面照片和硬件照片 ;)
对于进一步的行动,你可以考虑阻止此人和/或报告滥用。