LMCache:LLM 推理吞吐性能提升 3 倍
无损优化技术将 LLM 推理吞吐量提升 3 倍,对构建高效 AI 推理服务和降低成本有直接价值。
无损优化技术将 LLM 推理吞吐量提升 3 倍,对构建高效 AI 推理服务和降低成本有直接价值。
用于可扩展 LLM 推理的 KV Cache 管理层
博客 | 文档 | 加入 Slack | 社区会议 | 路线图
⭐ 如果 LMCache 能帮助你更快、更低成本地提供 LLM 服务,请为我们点亮 Star——这能帮助更多团队发现这个项目。
[2026/05] 🔥 AMD MI300X 上的 Agentic 工作负载基准测试(博客)。
[2026/04] 🔥 LMCache 全新多进程(MP)架构发布(博客)。
[2026/03] LMCache 亮相 GTC 2026(帖子)。
[2026/01] LMCache 多节点 P2P CPU 内存共享:从实验性功能走向生产环境(博客)。
[2025/11] LMCache × CoreWeave 为 Cohere 加速高效 LLM 推理(博客)。
[2025/10] LMCache 加入 PyTorch Foundation,Tensormesh 正式亮相(博客、PyTorch)。
[2025/09] NVIDIA Dynamo 集成 LMCache,加速 LLM 推理(博客)。
[2025/08] 🎉 LMCache 的 GitHub Star 数突破 5,000(博客)。
[2025/08] LMCache 首日即支持 gpt-oss(20B/120B)(博客)。
[2025/07] 使用 LMCache 和 Redis 获得更快的 LLM 推理与成本更低的响应(Redis 博客)。
[2025/07] LMCache 在 vLLM V1 中将其涡轮加速能力扩展至多模态模型(博客)。
[2025/06] LLM Production Stack 实现跨硬件支持:AMD、Arm 和 Ascend(博客)。
LMCache 是面向 LLM 推理的 KV Cache 管理层。它将 KV Cache 从临时状态转变为可复用的 AI 原生知识:这些知识可以持久化存储、在多个服务引擎之间复用、通过可观测性技术栈进行监控,还可以通过转换来提升生成质量。因此,LMCache 能够缩短 TTFT(time-to-first-token,首个 token 延迟)并提高吞吐量,尤其适用于长上下文 Agentic、多轮对话和知识增强型工作负载(例如 RAG)。
LMCache 不绑定任何厂商。它可以作为 KV Cache 层,与各种主流开源服务引擎、推理框架、硬件厂商、存储系统和基础设施提供商配合使用。这种厂商中立性让用户可以自由切换服务引擎和存储厂商,同时继续复用已经存储的 KV Cache。
独立于引擎的部署:LMCache 作为独立的 daemon 进程运行,与推理引擎进程相互独立地管理 KV Cache。因此,即使推理引擎崩溃,KV Cache 也不会丢失(即不会与引擎命运绑定)。
独立于引擎的部署:LMCache 作为独立的 daemon 进程运行,与推理引擎进程相互独立地管理 KV Cache。因此,即使推理引擎崩溃,KV Cache 也不会丢失(即不会与引擎命运绑定)。
持久化、分层的 KV Cache 卸载与复用:将 KV Cache 从 GPU 内存迁移至由 CPU 内存、本地存储和远程后端构成的分层存储体系,使其能够跨请求、会话和引擎实例复用,从而减少重复的 prefill 计算并改善 TTFT。
持久化、分层的 KV Cache 卸载与复用:将 KV Cache 从 GPU 内存迁移至由 CPU 内存、本地存储和远程后端构成的分层存储体系,使其能够跨请求、会话和引擎实例复用,从而减少重复的 prefill 计算并改善 TTFT。
生产级 KV Cache 可观测性:LMCache 提供一套丰富的 KV Cache 可观测性指标,包括常见的 Kubernetes 指标(健康状况监控、性能诊断)、KV Cache 专用指标(请求级和 token 级前缀缓存命中率、生命周期、请求级 KV Cache 性能)、管理指标(特定用户的使用情况)等。
生产级 KV Cache 可观测性:LMCache 提供一套丰富的 KV Cache 可观测性指标,包括常见的 Kubernetes 指标(健康状况监控、性能诊断)、KV Cache 专用指标(请求级和 token 级前缀缓存命中率、生命周期、请求级 KV Cache 性能)、管理指标(特定用户的使用情况)等。
可插拔的存储与传输后端:通过统一接口轻松集成远程存储和 KV 传输后端,实现跨存储提供商的 KV Cache 卸载与共享。借助这一接口,LMCache 支持的存储后端包括 CPU RAM、本地磁盘(SSD)、Redis/Valkey、Mooncake、InfiniStore、兼容 S3 的对象存储、NIXL 和 GDS。
可插拔的存储与传输后端:通过统一接口轻松集成远程存储和 KV 传输后端,实现跨存储提供商的 KV Cache 卸载与共享。借助这一接口,LMCache 支持的存储后端包括 CPU RAM、本地磁盘(SSD)、Redis/Valkey、Mooncake、InfiniStore、兼容 S3 的对象存储、NIXL 和 GDS。
非前缀 KV 复用:不再局限于前缀缓存,可以复用 prompt 中任意位置的已缓存 KV block。该功能利用 CacheBlend 选择性地重新计算 token,以恢复生成质量。
非前缀 KV 复用:不再局限于前缀缓存,可以复用 prompt 中任意位置的已缓存 KV block。该功能利用 CacheBlend 选择性地重新计算 token,以恢复生成质量。
PD 解耦与 KV 传输:通过 NIXL 等传输层,支持使用 NVLink、RDMA 或 TCP,将 KV Cache 从 prefill worker 传输至 decode worker。
PD 解耦与 KV 传输:通过 NIXL 等传输层,支持使用 NVLink、RDMA 或 TCP,将 KV Cache 从 prefill worker 传输至 decode worker。
可插拔的 KV 转换:通过灵活的 SERDE 接口,为研究人员提供一个简单接口,用于实现压缩、token 丢弃和自定义序列化。
可插拔的 KV 转换:通过灵活的 SERDE 接口,为研究人员提供一个简单接口,用于实现压缩、token 丢弃和自定义序列化。
LMCache 正在成为 LLM 推理生态系统中不可或缺的一层。由社区推动的集成范围涵盖服务引擎、推理框架、硬件厂商、存储系统和基础设施提供商。
要使用 LMCache,只需通过包管理器安装 lmcache,例如使用 pip:
pip install lmcache
有关更多配置选项和示例,请参阅:
我们欢迎并重视各种贡献与合作。加入我们,一起改进 LMCache。你可以查看贡献指南或加入我们的 Slack 社区,开始参与项目。
LMCache 正在汇聚一个不断壮大的社区,其中包括开发者、研究人员、行业采用者和合作伙伴,他们共同构建下一代高效 LLM 推理系统。
作为一个独立的开源项目,LMCache 正在成为 LLM 推理领域 KV Cache 管理事实上的标准。Tensormesh 为项目的持续开发和社区工作提供了部分支持。
LMCache 建立在 KV Cache 管理领域的相关研究之上,包括缓存复用、卸载、压缩和服务优化。如果你在研究中使用了 LMCache,请引用 LMCache 论文及相关工作。
@article{cheng2025lmcache,
title={LMCache: An Efficient KV Cache Layer for Enterprise-Scale LLM Inference},
author={Cheng, Yihua and Liu, Yuhan and Yao, Jiayi and An, Yuwei and Chen, Xiaokun and Feng, Shaoting and Huang, Yuyang and Shen, Samuel and Du, Kuntai and Jiang, Junchen},
journal={arXiv preprint arXiv:2510.09665},
year={2025}
}
@inproceedings{liu2024cachegen,
title={Cachegen: Kv cache compression and streaming for fast large language model serving},
author={Liu, Yuhan and Li, Hanchen and Cheng, Yihua and Ray, Siddhant and Huang, Yuyang and Zhang, Qizheng and Du, Kuntai and Yao, Jiayi and Lu, Shan and Ananthanarayanan, Ganesh and others},
booktitle={Proceedings of the ACM SIGCOMM 2024 Conference},
pages={38--56},
year={2024}
}
@inproceedings{yao2025cacheblend,
title={Cacheblend: Fast large language model serving for rag with cached knowledge fusion},
author={Yao, Jiayi and Li, Hanchen and Liu, Yuhan and Ray, Siddhant and Cheng, Yihua and Zhang, Qizheng and Du, Kuntai and Lu, Shan and Jiang, Junchen},
booktitle={Proceedings of the twentieth European conference on computer systems},
pages={94--109},
year={2025}
}
LMCache 代码库采用 Apache License 2.0 许可。详情请参阅 LICENSE 文件。