Llamafile 让开发者无需复杂配置,用一个可执行文件分发和运行 LLM,大幅降低 LLM 应用的部署门槛。
llamafile 让你可以通过单个文件分发并运行 LLM。
llamafile 是一个 Mozilla Builders 项目(参见其公告博客文章),目前由 Mozilla.ai 重新打造。
我们的目标是让开发者和终端用户都能更轻松地使用开放 LLM。为此,我们将 llama.cpp 与 Cosmopolitan Libc 整合到一个框架中,把 LLM 的所有复杂性都封装进一个单文件可执行程序(称为“llamafile”)。它无需安装,即可在大多数操作系统和 CPU 架构上本地运行。
llamafile 还包含 whisperfile,这是一款基于 whisper.cpp 构建、采用相同 Cosmopolitan 打包方式的单文件语音转文本工具。它支持在上述所有平台上转录和翻译音频文件,同样无需安装。
从 0.10.0 开始,llamafile 采用了新的构建系统,旨在让我们的代码更容易与 llama.cpp 的最新版本保持同步。这意味着新版本支持更新的模型和功能,但同时也可能缺少一些你已经习惯的特性(可查看这份文档,了解相关改动的概要说明)。如果你更喜欢“经典体验”,仍然可以随时从我们的 releases 页面获取旧版本。我们预构建的 llamafile 始终会标明其捆绑的 server 版本(例如 0.9.、0.10.),因此你总能清楚自己下载的是哪个软件版本。
我们希望听到你的声音!无论你是新用户还是长期支持者,都欢迎分享你认为 llamafile 最有价值的地方,以及哪些改进能让它对你更有用。你可以通过博客了解更多信息,并在此参与讨论、发表意见。
只需几分钟,即可下载并运行你的第一个 llamafile:
# Download an example model (Qwen3.5 0.8B)
curl -LO https://huggingface.co/mozilla-ai/llamafile_0.10/resolve/main/Qwen3.5-0.8B-Q8_0.llamafile
# Make it executable (macOS/Linux/BSD)
chmod +x Qwen3.5-0.8B-Q8_0.llamafile
# Run it
./Qwen3.5-0.8B-Q8_0.llamafile
我们选择这个模型,是因为它是我们目前构建过 llamafile 的最小模型,因此最有可能在你的设备上开箱即用。如果你拥有性能强劲的硬件和/或 GPU,也可以选择规模更大、表达能力更强的模型,它们通常能够提供更准确的回答。
Windows 用户:运行前,请重命名文件并为其添加 .exe 扩展名。
注意——Windows 只能运行小于 4GB 的可执行文件,因此任何超过 4GB 的 llamafile 都无法运行。你可以下载 llamafile binary,并搭配任意外部权重/模型(GGUF)运行。
请前往 docs.mozilla.ai/llamafile 查看完整文档,也可以直接进入以下任一子章节:
尽管 llamafile 项目采用 Apache 2.0 许可证,但我们对 llama.cpp 和 whisper.cpp 所做的修改采用 MIT 许可证(与这些项目本身相同),以便保持兼容,并确保未来如果有需要,可以将改动提交至上游。
本页面中的 llamafile logo 是在 DALL·E 3 的协助下生成的。