文章给出使用 mlx-lm 安装、加载量化模型、命令行生成及 Python 调用的最小示例,并比较 MLX 与 llama.cpp 的平台适配。前者侧重 Apple Silicon 和统一内存效率,后者拥有更广泛的硬件后端。
如果你有一台搭载 M1/M2/M3/M4 芯片的 Mac,就可以完全在本地设备上运行真正的 LLM——不需要 API key,没有云服务账单,prompt 也不会离开你的电脑。在 Apple Silicon 上,主要有两款工具:MLX(Apple 自己的机器学习框架)和 llama.cpp(可跨平台运行的 C++ 引擎)。下面介绍如何在五分钟内运行 MLX,以及什么情况下该选择哪款工具。
隐私:你的 prompt 永远不会离开笔记本电脑。
成本:已有硬件之外,每个 token 的成本为 0 美元。
离线:无论是在飞机上、小屋里,还是任何地方,都能正常使用。
MLX 以 Python 包的形式发布(需要 Python 3.10+):
pip install mlx-lm
拉取一个 4-bit 量化模型并运行:
mlx_lm.generate \
--model mlx-community/Llama-3.2-3B-Instruct-4bit \
--prompt "Write a haiku about Apple Silicon."
3B 模型可以在 16 GB 内存上轻松运行。
如果要集成到应用中,可以直接调用:
from mlx_lm import load, generate
model, tokenizer = load("mlx-community/Llama-3.2-3B-Instruct-4bit")
out = generate(model, tokenizer,
prompt="Explain MLX in one sentence.",
max_tokens=128)
print(out)
mlx_lm.chat --model mlx-community/Llama-3.2-3B-Instruct-4bit
两者都能运行相同系列的量化权重,而且表现都非常出色。在 Mac 上,MLX 通常速度更快、开销更低;如果还必须支持 Linux、Windows 或边缘设备,那么 llama.cpp 更胜一筹。
我在 GitHub 上放了一个克隆后即可使用的 Starter——包含单命令引导脚本、聊天服务器和 Python 客户端,并采用 MIT 许可证:
👉 https://github.com/ptrken01/mlx-apple-silicon-starter
这个 Starter 可以帮你完成「hello world」。如果你需要完整的部署手册——包括生产级 API Server 模式、批处理、评测框架,以及我每天实际使用的具体配置——我已经把它们整理到了这里,并为读者提供限时首发优惠:
👉 https://ptrk-en.gumroad.com/l/mlx-deploy-playbook?offer_code=LAUNCH40(限时使用优惠码 LAUNCH40 可享 6 折优惠)
完整的文字指南——包括故障排查表、视觉模型服务,以及重启后仍能持续运行的 launchd 持久化配置——请参阅:https://autoincomesys.com/articles/mlx-local-llm-apple-silicon-setup-2026
在本地运行,守住隐私,快速交付。
如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。