在英特尔处理器上高效部署 LLM,对成本敏感的边缘计算和私有部署场景有实用价值。
Intel 不会为本项目提供或保证任何开发或支持,包括但不限于维护、Bug 修复、新版本发布或更新。Intel 已不再接受针对本项目的补丁。本项目已被确认存在已知安全问题。
IPEX-LLM 是一个面向 Intel GPU(例如配备 iGPU 的本地 PC,以及 Arc、Flex 和 Max 等独立 GPU)、NPU 和 CPU 的 LLM 加速库¹。
IPEX-LLM 可与 llama.cpp、Ollama、vLLM、HuggingFace transformers、LangChain、LlamaIndex、Text-Generation-WebUI、DeepSpeed-AutoTP、FastChat、Axolotl、HuggingFace PEFT、HuggingFace TRL、AutoGen、ModeScope 等无缝集成。
已有 70 多个模型在 ipex-llm 上完成优化或验证(例如 Llama、Phi、Mistral、Mixtral、DeepSeek、Qwen、ChatGLM、MiniCPM、Qwen-VL、MiniCPM-V 等),并提供业界领先的 LLM 优化、XPU 加速和低比特(FP8/FP6/FP4/INT4)支持;完整列表见此处。
[2025/05] 现在借助 ipex-llm 中的 FlashMoE,只需 1~2 块 Intel Arc GPU(例如 A770 或 B580),即可运行 DeepSeek V3/R1 671B 和 Qwen3MoE 235B 模型。
[2025/04] 我们发布了 ipex-llm 2.2.0,其中包含 Ollama Portable Zip 和 llama.cpp Portable Zip。⚠️ 警告(针对 llama.cpp Portable Zip):在多租户或共享主机环境中,llama.cpp 基于 mmap 的模型加载方式可能通过侧信道泄露数据。若要禁用 mmap,请添加:--no-mmap
⚠️ 警告(针对 llama.cpp Portable Zip):在多租户或共享主机环境中,llama.cpp 基于 mmap 的模型加载方式可能通过侧信道泄露数据。若要禁用 mmap,请添加:
--no-mmap
[2025/04] 我们新增了对 Intel GPU 上 PyTorch 2.6 的支持。
[2025/03] 我们在最新版 llama.cpp Portable Zip 中新增了对 Gemma3 模型的支持。
[2025/03] 现在借助最新版 llama.cpp Portable Zip,我们可以在 Xeon 平台上使用 1~2 块 Arc A770 运行 DeepSeek-R1-671B-Q4_K_M。
[2025/02] 我们新增了面向 Intel GPU(Windows 和 Linux)及 NPU(仅限 Windows)的 llama.cpp Portable Zip 支持。
[2025/02] 我们新增了 Ollama Portable Zip 支持,无需手动安装,即可直接在 Windows 和 Linux 的 Intel GPU 上运行 Ollama。
[2025/02] 我们新增了在 Intel Arc GPU 上运行 vLLM 0.6.6 的支持。
[2025/01] 我们新增了在 Intel Arc B580 GPU 上运行 ipex-llm 的指南。
[2025/01] 我们新增了在 Intel GPU 上运行 Ollama 0.5.4 的支持。
[2024/12] 我们为 Intel Core Ultra NPU(包括 100H、200V、200K 和 200H 系列)同时新增了 Python 和 C++ 支持。
[2024/11] 我们新增了在 Intel Arc GPU 上运行 vLLM 0.6.2 的支持。
[2024/07] 我们新增了使用 Intel GPU 上的本地 LLM 运行 Microsoft GraphRAG 的支持;快速入门指南见此处。
[2024/07] 我们新增了对大型多模态模型的广泛支持,包括 StableDiffusion、Phi-3-Vision、Qwen-VL 等。
[2024/07] 我们新增了 Intel GPU 上的 FP6 支持。
[2024/06] 我们为 Intel Core Ultra 处理器新增了实验性 NPU 支持;示例见此处。
[2024/06] 我们新增了对流水线并行推理的全面支持,使开发者能够轻松使用 2 块或更多 Intel GPU(例如 Arc)运行大规模 LLM。
[2024/06] 我们新增了在 Intel GPU 上通过 ipex-llm 运行 RAGFlow 的支持。
[2024/05] ipex-llm 现在支持使用 Axolotl 在 Intel GPU 上微调 LLM;快速入门见此处。
[2024/05] 现在可以通过 Docker 镜像轻松使用 ipex-llm 进行推理、Serving 和微调。
[2024/05] 现在只需“一条命令”,即可在 Windows 上安装 ipex-llm。
[2024/04] 现在可以使用 ipex-llm 在 Intel GPU 上运行 Open WebUI;快速入门见此处。
[2024/04] 现在可以通过 ipex-llm,使用 llama.cpp 和 Ollama 在 Intel GPU 上运行 Llama 3;快速入门见此处。
[2024/04] ipex-llm 现在同时支持在 Intel GPU 和 CPU 上运行 Llama 3。
[2024/04] ipex-llm 现在提供 C++ 接口,可作为在 Intel GPU 上运行 llama.cpp 和 Ollama 的加速后端。
[2024/03] bigdl-llm 现已更名为 ipex-llm(迁移指南见此处);原始 BigDL 项目见此处。
[2024/02] ipex-llm 现在支持直接从 ModelScope(魔搭)加载模型。
[2024/02] ipex-llm 新增了初步的 INT2 支持(基于 llama.cpp 的 IQ2 机制),从而可以在配备 16GB VRAM 的 Intel GPU 上运行大规模 LLM,例如 Mixtral-8x7B。
[2024/02] 用户现在可以通过 Text-Generation-WebUI GUI 使用 ipex-llm。
[2024/02] ipex-llm 现在支持 Self-Speculative Decoding。在实际应用中,它可分别将 Intel GPU 上的 FP16 推理延迟和 Intel CPU 上的 BF16 推理延迟优化约 30%。
[2024/02] ipex-llm 现在全面支持在 Intel GPU 上微调 LLM,包括 LoRA、QLoRA、DPO、QA-LoRA 和 ReLoRA。
[2024/01] 借助 ipex-llm QLoRA,我们使用 8 块 Intel Max 1550 GPU,针对 Standford-Alpaca 在 21 分钟内完成了 LLaMA2-7B 的微调,并在 3.14 小时内完成了 LLaMA2-70B 的微调(相关博客见此处)。
[2023/12] ipex-llm 现在支持 ReLoRA(参见《ReLoRA:通过低秩更新实现高秩训练》)。
[2023/12] ipex-llm 现在同时支持在 Intel GPU 和 CPU 上运行 Mixtral-8x7B。
[2023/12] ipex-llm 现在支持 QA-LoRA(参见《QA-LoRA:大语言模型的量化感知低秩适配》)。
[2023/12] ipex-llm 现在支持在 Intel GPU 上进行 FP8 和 FP4 推理。
[2023/11] 现已初步支持将 GGUF、AWQ 和 GPTQ 模型直接加载到 ipex-llm 中。
[2023/11] ipex-llm 现在同时支持在 Intel GPU 和 CPU 上进行 vLLM 连续批处理。
[2023/10] ipex-llm 现在同时支持在 Intel GPU 和 CPU 上进行 QLoRA 微调。
[2023/10] ipex-llm 现在同时支持在 Intel CPU 和 GPU 上提供 FastChat Serving。
[2023/09] ipex-llm 现在支持 Intel GPU,包括 iGPU、Arc、Flex 和 MAX。
[2023/09] ipex-llm 教程正式发布。
请查看以下演示,了解如何使用 ipex-llm,在 Intel Core Ultra iGPU、Intel Core Ultra NPU、单卡 Arc GPU 或多卡 Arc GPU 上运行本地 LLM。
请查看下方 Intel Core Ultra 和 Intel Arc GPU 上的 Token 生成速度¹(更多详情请参阅 [2][3][4])。
你可以按照 Benchmarking Guide,自行运行 ipex-llm 性能基准测试。
请查看下方的 Perplexity 结果(使用此处的脚本在 Wikitext 数据集上测试)。
Ollama:无需手动安装,即可在 Intel GPU 上运行 Ollama。
llama.cpp:无需手动安装,即可在 Intel GPU 上运行 llama.cpp。
Arc B580:在 Intel Arc B580 GPU 上运行 ipex-llm,用于 Ollama、llama.cpp、PyTorch、HuggingFace 等。
NPU:通过 Python/C++ 或 llama.cpp API,在 Intel NPU 上运行 ipex-llm。
PyTorch/HuggingFace:在 Windows 和 Linux 的 Intel GPU 上运行 PyTorch、HuggingFace、LangChain、LlamaIndex 等(使用 ipex-llm 的 Python 接口)。
vLLM:在 Intel GPU 和 CPU 上,通过 vLLM 运行 ipex-llm。
FastChat:在 Intel GPU 和 CPU 上,通过 FastChat Serving 运行 ipex-llm。
在多块 Intel GPU 上提供 Serving:利用 DeepSpeed AutoTP 和 FastAPI,在多块 Intel GPU 上运行 ipex-llm Serving。
Text-Generation-WebUI:在 oobabooga WebUI 中运行 ipex-llm。
Axolotl:在 Axolotl 中运行 ipex-llm,以进行 LLM 微调。
Benchmarking:在 Intel CPU 和 GPU 上运行 ipex-llm 基准测试,包括延迟和吞吐量测试。
C++ GPU 推理:借助 ipex-llm,在 Intel GPU 上运行 llama.cpp、Ollama 等。
Python GPU 推理:借助 ipex-llm,在 Intel GPU 上运行 HuggingFace transformers、LangChain、LlamaIndex、ModelScope 等。
GPU 上的 vLLM:借助 ipex-llm,在 Intel GPU 上运行 vLLM Serving。
CPU 上的 vLLM:借助 ipex-llm,在 Intel CPU 上运行 vLLM Serving。
GPU 上的 FastChat:借助 ipex-llm,在 Intel GPU 上运行 FastChat Serving。
GPU 上的 VSCode:使用 VSCode 和 Python,在 Intel GPU 上运行和开发 ipex-llm 应用。
GraphRAG:借助 ipex-llm,使用本地 LLM 运行 Microsoft GraphRAG。
RAGFlow:借助 ipex-llm 运行 RAGFlow,一个开源 RAG 引擎。
LangChain-Chatchat:借助 ipex-llm 运行 LangChain-Chatchat,使用 RAG Pipeline 进行知识库问答。
Coding copilot:借助 ipex-llm 运行 Continue,即 VSCode 中的 Coding Copilot。
Open WebUI:借助 ipex-llm 运行 Open WebUI。
PrivateGPT:借助 ipex-llm 运行 PrivateGPT,与文档进行交互。
Dify 平台:在 Dify 中运行 ipex-llm。Dify 是一个可用于生产环境的 LLM 应用开发平台。
Windows GPU:在配备 Intel GPU 的 Windows 上安装 ipex-llm。
Linux GPU:在配备 Intel GPU 的 Linux 上安装 ipex-llm。
更多详情请参阅完整安装指南。
低比特推理 INT4 推理:在 Intel GPU 和 CPU 上进行 INT4 LLM 推理。FP8/FP6/FP4 推理:在 Intel GPU 上进行 FP8、FP6 和 FP4 LLM 推理。INT8 推理:在 Intel GPU 和 CPU 上进行 INT8 LLM 推理。INT2 推理:在 Intel GPU 上进行 INT2 LLM 推理,基于 llama.cpp IQ2 机制。
INT4 推理:在 Intel GPU 和 CPU 上进行 INT4 LLM 推理。
FP8/FP6/FP4 推理:在 Intel GPU 上进行 FP8、FP6 和 FP4 LLM 推理。
INT8 推理:在 Intel GPU 和 CPU 上进行 INT8 LLM 推理。
INT2 推理:在 Intel GPU 上进行 INT2 LLM 推理,基于 llama.cpp IQ2 机制。
FP16/BF16 推理 FP16 LLM 推理:在 Intel GPU 上进行 FP16 LLM 推理,并可选择采用 Self-Speculative Decoding 优化。BF16 LLM 推理:在 Intel CPU 上进行 BF16 LLM 推理,并可选择采用 Self-Speculative Decoding 优化。
在 Intel GPU 上进行 FP16 LLM 推理,并可选择采用 Self-Speculative Decoding 优化。
在 Intel CPU 上进行 BF16 LLM 推理,并可选择采用 Self-Speculative Decoding 优化。
分布式推理:在 Intel GPU 上进行流水线并行推理;在 Intel GPU 上进行 DeepSpeed AutoTP 推理。
在 Intel GPU 上进行流水线并行推理。
在 Intel GPU 上进行 DeepSpeed AutoTP 推理。
保存和加载低比特模型:保存和加载 ipex-llm 低比特模型(INT4/FP4/FP6/INT8/FP8/FP16 等)。GGUF:将 GGUF 模型直接加载到 ipex-llm 中。AWQ:将 AWQ 模型直接加载到 ipex-llm 中。GPTQ:将 GPTQ 模型直接加载到 ipex-llm 中。
低比特模型:保存和加载 ipex-llm 低比特模型(INT4/FP4/FP6/INT8/FP8/FP16 等)。
GGUF:将 GGUF 模型直接加载到 ipex-llm 中。
AWQ:将 AWQ 模型直接加载到 ipex-llm 中。
GPTQ:将 GPTQ 模型直接加载到 ipex-llm 中。
微调:在 Intel GPU 上微调 LLM,包括 LoRA、QLoRA、DPO、QA-LoRA 和 ReLoRA;在 Intel CPU 上进行 QLoRA 微调。
在 Intel GPU 上微调 LLM,包括 LoRA、QLoRA、DPO、QA-LoRA 和 ReLoRA。
在 Intel CPU 上进行 QLoRA 微调。
与社区库集成:HuggingFace transformers、标准 PyTorch 模型、LangChain、LlamaIndex、DeepSpeed-AutoTP、Axolotl、HuggingFace PEFT、HuggingFace TRL、AutoGen、ModeScope。
HuggingFace transformers。
标准 PyTorch 模型。
HuggingFace Transformers 风格的 API(Auto Classes)。
适用于任意 PyTorch Model 的 API。
FAQ 与故障排查。
已有 70 多个模型在 ipex-llm 上完成优化或验证,包括 LLaMA/LLaMA2、Mistral、Mixtral、Gemma、LLaVA、Whisper、ChatGLM2/ChatGLM3、Baichuan/Baichuan2、Qwen/Qwen-1.5、InternLM 等;具体列表见下方。
如需报告 Bug 或提交 Feature Request,请创建 GitHub Issue。
如需报告安全漏洞,请创建 GitHub Security Advisory 草稿。
性能会因使用场景、配置及其他因素而异。对于非 Intel 产品,ipex-llm 可能无法实现相同程度的优化。更多信息请参阅 Intel Performance Index。↩ ↩2
性能会因使用场景、配置及其他因素而异。对于非 Intel 产品,ipex-llm 可能无法实现相同程度的优化。更多信息请参阅 Intel Performance Index。↩ ↩2