前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
返回 AI 情报前线
All News · 全部资讯3543
  • LLM 白日梦现象的深度分析
  • Claude Artifacts 战略对标 ChatGPT 的差异设计
  • OpenAI 漏洞负责任披露机制
  • Claude 在金融服务中的应用案例
  • Claude Code 深度功能评测与实战指南
  • Kiro IDE:规范驱动的 AI 开发新范式
  • Amazon Kiro 对标 Copilot:编程工具新竞争
  • 大模型上下文扩展的性能衰减规律
  • Kiro:Amazon 推出的规范驱动 AI IDE
  • OpenRouter 顶级编程 Agent 排名与对比
  • AI Agent 通过结构化辩论实现协议一致
  • ArchGW:开源 Agent 智能网关代理
  • Cursor IDE 快速集成 MCP:Algolia 实战
  • 30 分钟快速构建语音 AI Agent
  • 瑞士两校发布开源大模型,降低获取门槛
  • Claude Opus vs Grok 4:复杂编程任务对标测评
  • Docker 中运行 Claude Code 与 VSCode 的实践方案
  • Vibe Kanban:AI Agent 任务管理看板
  • AI Agent 基准测试的系统性缺陷分析
  • RAG 通过改进检索仍有长期价值,别妄言已死
  • LLM 推理优化完全手册:从部署到性能调优
  • Prompt 评估的新视角:系统化质量评估方法
  • Cactus:手机版本地 LLM 运行工具
  • 开源替代品:Perplexity Comet 的社区版本
  • Algolia MCP 开发挑战赛:3000 美元奖金
  • 用英文驾驭 FFmpeg —— 浏览器里的 LLM 辅助编辑
  • MCP 生态扩展:将 Anna's Archive 接入 LLM
  • Agent 设计权衡:何时硬编码,何时用 LLM
  • AI 赋能知识管理:捕获、组织、复用代码知识
  • 远程 MCP 服务器开发:3 个常见坑点总结
  • Smollm3:多语言、长上下文的轻量推理模型
  • 开源终端 AI 编程工具 Opencode
  • 用 Claude Code 开发 Mac 应用完全指南
  • 突破 Claude Code Pro 限制的优化技巧
  • LLM 工作流工具选择的微分优化
  • 从 Prompt 到完整游戏:AI 编码全过程实战拆解
  • 浏览器中跑 AI Agent:WASM 运行时方案来了
  • 从 AI Studio 一键部署到 Cloud Run 的新方式
  • AI Agent 热潮中:你真的需要 Agent 吗?
  • Gemini 极速上手:2 分钟完成 AI 应用开发
  • 绕过 AI:编程和创意的 8 个替代策略
  • DEV 推出 AI Studio 教学计划,全球开发者参与热潮
  • Prompt 到上线只需 2 分钟:AI 驱动开发工作流加速
  • 为什么我减少了 LLM 的使用
  • GitHub Copilot 指令系统完全指南
  • Gemini CLI 高阶用法 7 招
  • MCP 服务器开发入门
  • Core:用户主权的 LLM 记忆数据库
  • 小模型才是 Agent AI 的未来
  • Claude Code 新增 Hooks 自动化功能
  • 构建会学习的 AI Agent:从架构到实现
  • 已加载 51 / 3543
8.0
热点
AI SCORE
技术实践2025-07-11 10:40

LLM 推理优化完全手册:从部署到性能调优

Hacker News · bentoml.com#LLM#推理优化#性能
Editor brief · 编辑速览

系统性讲解 LLM 推理优化的最佳实践,包括模型部署、性能调优等,对程序员部署 LLM 有直接指导。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

LLM Inference Handbook 是你的技术词汇表、指南和参考手册,三合一。

它涵盖了 LLM inference 的方方面面,从核心概念和性能指标(如首字节时间和每秒 Token 数),到优化技术(如连续 batching 和前缀缓存),GPU 架构,以及 BYOC 和本地部署等部署模式。

关于在生产环境中部署、扩展和运维 LLM 的实践指导。

通过交互式计算器、模拟器和可视化工具来探索各个概念。

使用针对你的具体场景量身定制的优化技术来提升性能。

持续更新最新的最佳实践和实战验证的洞察。

我们编写这本手册是为了解决开发者面临的一个共同问题:

LLM inference 的知识往往是零散的;它们埋在学术论文中,散落在各种厂商博客上,隐藏在 GitHub issue 里,或者在 Discord 讨论串中传来传去。更糟的是,其中许多资料都假设你已经理解了整个栈的一半。

很少有资源能够将所有内容整合在一起 — 比如 inference 与 training 的区别、为什么 goodput 对于满足 SLO 比原始吞吐量更重要,或者 prefill-decode 分离在实践中如何工作。

所以我们开始把所有内容汇集在一起。

这本手册面向的是谁

这本手册面向的是在生产环境中部署、扩展或运维 LLM 的工程师,无论你是在微调一个小型开源模型,还是在自己的栈上运行大规模部署。

如果你的目标是让 LLM inference 更快、更便宜或更可靠,这本手册就是为你准备的。

如何使用这本手册

你可以从头到尾阅读它,也可以把它当作查询表来使用。没有错误的浏览方式。我们将继续更新这本手册,因为 LLM inference 正在快速演变,今天有效的方法可能不是明天最好的方案。

交互式工具和学习资源

这本手册提供了各种交互式工具,帮助你通过直接尝试这些概念来学习:

  • LLM Inference Visualizer:浏览请求生命周期,查看 token 如何通过 prefill 和 decode 流动。

  • LLM Lifecycle Visualizer:查看 training 和 inference 在模型生命周期中的位置,以及 inference 如何在每个请求上运行。

  • Token-by-Token Decode Loop:逐步执行自回归解码,观看每个新 token 如何扩展序列和 KV cache。

  • Latency Timeline Visualizer:查看每个 decode 步骤后如何跟随反 tokenization,以及 TTFT、ITL 和 E2EL 跨越哪些阶段。

  • Context Window Simulator:查看完整对话如何在每轮重新发送并填充上下文窗口。

  • Latency Metrics Playground:探索 TTFT、E2EL、TPOT 和基于 SLO 的 goodput。

  • Top-p vs Top-k Filter:比较每个过滤器如何处理尖峰、混合和平坦分布。

  • Model Explorer:浏览流行的开源 LLM,比较它们的架构、规模、上下文和典型的 GPU 部署。

  • GPU Comparison Table:将流行的开源 LLM 与合适的 NVIDIA 和 AMD GPU 进行匹配。

  • GPU Memory Calculator:估算用于 serving LLM 的 VRAM 需求。

  • Quantization Memory Impact Visualizer:比较不同量化格式的权重内存。

  • Batching Strategy Simulator:比较静态、动态和连续 batching 的行为。

  • Chunked Prefill Scheduler:查看整个 prefill 如何暂停活跃的 decode,以及分块如何让它们继续。

  • KV Cache Memory Calculator:估算 KV cache 消耗多少内存。

  • GPU Execution and Memory Map:可视化 threads、warps、SM 和 GPU 内存层级如何配合。

贡献

我们欢迎贡献!如果你发现错误、有改进建议或想添加新主题,请在我们的 GitHub 仓库中提出 issue 或提交 pull request。

Original source

本文由 AI 翻译整理自 Hacker News · bentoml.com,原文版权归原作者所有。

阅读英文原文
上一篇
RAG 通过改进检索仍有长期价值,别妄言已死
下一篇
Prompt 评估的新视角:系统化质量评估方法