8.0
热点
AI SCORE
工具产品2023-06-21 03:17
vLLM推理框架性能大幅优化
Hacker News · vllm.ai#推理优化#开源#高性能
Editor brief · 编辑速览
PagedAttention 技术实现大模型推理的 5 倍加速,已成为生产环境部署开源模型的标配方案。
简单、快速、经济高效的 LLM 推理服务,人人皆可使用。
在任意硬件上部署种类最丰富的开源模型。内置可直接替代的 OpenAI-compatible API,轻松完成即时集成。
通过 PagedAttention 最大化吞吐量。先进的调度机制与 continuous batching 可确保 GPU 利用率始终处于峰值。
通过最大限度提升硬件效率,大幅降低推理成本。我们致力于让每个人都能以可负担的成本使用高性能 LLM。
选择你的偏好设置,然后运行安装命令。Stable 代表当前经过最充分测试并获得支持的 vLLM 版本。如果希望使用最新构建版本,可以选择 Nightly。
📦 需要 Python 3.10+。推荐使用 Python 3.12+。
⚡ 我们推荐使用 uv,以获得更快、更可靠的安装体验。
🔧 如需了解其他平台,请参阅 docs.vllm.ai
🔍 查询某个 PR 包含在哪个 release 中
💡 兼容所有 CUDA 13.x 版本(13.0 - 13.1)· 故障排查
vLLM 是一个社区项目。以下组织为我们的开发和测试提供了计算资源支持。感谢你们的支持!
我们通过 GitHub 和 OpenCollective 接受捐赠。我们计划将这些资金用于支持 vLLM 的开发、维护与推广应用。
一个引擎,无限可能。在任意硬件上运行任意模型。
跨平台的统一 API
最新热门开源模型,已完成优化并可用于生产环境
无论你是刚刚入门,还是正在调试复杂的部署问题,我们的社区都向所有人开放。没有什么问题会因为太基础而不值得提问!
示例 notebook 与教程
基准测试与对比
项目路线图与里程碑