开源项目 Alpaca.cpp 让开发者在本地 MacBook 上运行指令微调的 LLM。直接可用,解决本地推理和离线场景需求。
在您的设备上本地运行一个快速的类 ChatGPT 模型。下面的屏幕录像不是加速的,运行在一个带有 4GB 权重的 M2 MacBook Air 上。
这个项目结合了 LLaMA 基础模型和斯坦福大学 Alpaca 的开放复现——对基础模型的微调以遵守指令(类似于用于训练 ChatGPT 的 RLHF),以及对 llama.cpp 的一系列修改以添加聊天界面。
alpaca.cpp 的更改已随后被上游到 llama.cpp 中。
从最新版本下载对应您操作系统的 zip 文件。在 Windows 上,下载 alpaca-win.zip;在 Mac 上(Intel 或 ARM 均可),下载 alpaca-mac.zip;在 Linux(x64)上,下载 alpaca-linux.zip。
下载 ggml-alpaca-7b-q4.bin 并将其放在 zip 文件中聊天可执行文件的同一文件夹中。有多个选项可用:
下载模型权重并将其放在与 chat 或 chat.exe 可执行文件相同的目录中后,运行:
./chat
权重基于 alpaca-lora 发布的微调模型,使用修改后的脚本转换回 pytorch 检查点,然后使用 llama.cpp 以常规方式进行量化。
git clone https://github.com/antimatter15/alpaca.cpp
cd alpaca.cpp
make chat
./chat
下载并安装 CMake:https://cmake.org/download/
下载并安装 git。如果您以前没有使用过 git,考虑使用图形客户端如 https://desktop.github.com/
使用您选择的 git 客户端克隆此仓库(对于 GitHub Desktop,转到 File -> Clone repository -> From URL 并粘贴 https://github.com/antimatter15/alpaca.cpp 作为 URL)
在您克隆仓库的文件夹中打开 Windows Terminal
逐个运行以下命令:
cmake .
cmake --build . --config Release
通过上面"快速开始"中的任何链接下载权重,并将文件保存为 Alpaca 主目录中的 ggml-alpaca-7b-q4.bin。
在终端窗口中,运行此命令:
.\Release\chat.exe
(您可以根据需要在同一行上添加其他启动选项,如 --n 8)
您现在可以在终端中与 AI 进行文字交互,它将作出回复。尽情享受吧!
这个项目结合了 Facebook 的 LLaMA、斯坦福大学的 Alpaca、alpaca-lora 和 Eric Wang 对应的权重(使用了 Jason Phang 在 Hugging Face Transformers 之上的 LLaMA 实现),以及 Georgi Gerganov 的 llama.cpp。聊天实现基于 Matvey Soloviev 为 llama.cpp 开发的交互模式。受 Simon Willison 的 LLaMA 入门指南启发。参考了 Andy Matuschak 关于适配 13B 的讨论,使用了 Sam Witteveen 提供的微调权重。
请注意,模型权重仅供研究使用,因为它们是 LLaMA 的衍生品,并使用了斯坦福大学 Alpaca 项目发布的指令数据,这些数据由 OpenAI 生成。OpenAI 禁止使用其输出结果来训练竞争性模型。