前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8742
  • GitHub Copilot上线Claude Opus 5.5,支持长时Agent任务
  • GitHub Copilot 新增 GPT-6 Sol/Luna 模型选项
  • Claude Opus 5.5 智能/性能/价格深度分析
  • Anthropic发布Opus 5.5降价20%,但Agent调用可能暗中路由至旧模型
  • Anthropic称Opus 5.5为「史上最强」,定价更低的Fable级性能
  • Anthropic 发布 Claude Opus 5.5:强化网络安全防护,遏制越狱行为
  • Claude Opus 5.5 正式发布:832 分成社区热议
  • 生产级 AI 语音 Agent 架构:WebSocket 与延迟优化实战
  • Permission Envelope:让 AI 权限自动过期的安全控制机制
  • llm-typesafe插件支持Jev模型二元判断
  • Python AI Agent 上线前必读:测试、可观测性与零成本方案
  • Cloudflare Worker Previews:为 Agent 每次变更提供隔离预览环境
  • NVIDIA Isaac ROS 5.0 发布:加速 Agentic 机器人开源开发
  • Meta Muse macOS 应用零日漏洞遭修复
  • 小米6天烧2000万训练开源模型MiMo,跃居开放模型榜首
  • LLM应用输入输出Guardrails实战指南
  • Claude发现libheif堆缓冲区溢出:HEIC图片供应链安全研究
  • 多模型调度与反馈闭环:基元律动CTO谈Agent持续进化
  • 阮一峰科技周刊第413期:再见了React Native
  • 用Python/ChromaDB/Gemini搭建轻量级RAG实战
  • 生产环境中降低LLM成本的七种实战方法
  • AI驱动开发反思:过度规格化反而拖累AI编程
  • AMD ROCm:AI Agent正在降低GPU编程门槛
  • 小米MiMo-V2.6-Pro登顶开源权重模型榜首,300万美元预训练
  • 四Agent并行:状态文件是保持一致性的关键
  • 长任务前何时压缩上下文:Claude Code实战经验
  • 5美元/月自建Qwen2.5 72B推理服务:vLLM+AWQ量化部署指南
  • Prompt缓存失效的根因:工作流在悄悄破坏精确前缀匹配
  • NVIDIA SoL-Pi:编码Agent的Token流量降低49%的Auto-Research框架
  • Grok 4.7 发布:更大基座、同价位,编程与 Agent 任务升级
  • vibe coding 两小时后质量崩塌的根因分析
  • 用 git 在多设备间同步 Claude Code 和 Codex 会话
  • 小米 MiMo-V2.6-Pro 开源:科研任务效率提升 10 倍
  • 评估Agent代码补丁前先清点测试面
  • 阿里云栖大会:Qwen4训练中,全模态模型新版本亮相
  • Qwen4.5后参数扩展至5-10T,Qwen4和视频模型均在训练
  • 阿里云栖大会正式发布Qwen4
  • 凌晨3点LLM路由崩溃排查:上游回收引发的级联故障
  • Hugging Face Transformers现已支持运行llama.cpp量化模型
  • Jev:按输入计费的决策模型,输出免费
  • Langflow OSS 认证 RCE 漏洞 CVE-2026-17633
  • 小米 MiMo-V2.6 开源:AA 指数最高开源模型
  • xAI发布Grok 4.7:编程强化模型,百万词元2美元起
  • Meta AI 助手 Muse 存在关键 0-day 漏洞,ClickFix 攻击可劫持
  • AWS发布Strands Harness:开源Agent框架,Token成本降28%
  • Spec-Driven 开发:摆脱 Vibe Coding 的工程化实践
  • AI 编程助手 CSS 好看但上生产就崩的根因与修复
  • Agent 诊断结果上线前如何验证:分离决策与执行
  • OpenAI 成立数学顾问组,AI 已解决逾百开放难题
  • Grok Build vs Claude Code:记忆能力实战对比测评
  • AI编码导致CI成瓶颈?我们重新设计了CI流程
  • 已加载 51 / 8742
8.0
热点
AI SCORE
编程提效2026-09-22 16:28

生产环境中降低LLM成本的七种实战方法

dev.to · AI#LLM优化#成本控制#架构设计
Editor brief · 编辑速览

核心观点:LLM成本优化是架构问题而非选型问题。提供了模型路由、token缓存、prompt压缩、结果缓存等七种可落地技巧。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

LLM 相对容易上手原型,但在生产环境中,推理成本会迅速攀升。单次用户请求可能触发多次模型调用、长 Prompt、检索步骤、重试或 Agent 循环。

关键在于,LLM 成本优化并非简单地选择更便宜的模型,而是一个架构问题。你需要在保持应用所需质量、延迟和可靠性的前提下,减少不必要的推理。

以下是七个实用技巧。

将请求路由到合适的模型

对每个请求都使用最强大的模型,是最容易推高 LLM 成本的方式之一。

正确的做法是:引入一个模型路由层,根据请求的复杂度进行分类:

User Request ↓ Request Router ┌───┼────────┐ ↓ ↓ ↓ Small Medium Large Model Model Model

分类、提取或基础摘要等简单任务通常可以使用较小的模型,而复杂推理任务则应路由到能力更强的模型。

路由器本身可以使用规则、轻量级分类器或另一个小模型。重点在于对每条路由的质量进行基准测试,而不是假设大模型总是必要的。

减少不必要的 Token

Token 用量直接影响推理成本,尤其是对于那些反复发送长对话历史或文档的应用。

首先,减少每个请求中包含的信息量:

  • 移除冗余的系统指令
  • 总结旧的对话历史
  • 限制最大输出 Token 数
  • 只发送相关的文档段落
  • 压缩或重构检索到的上下文

目标并非简单地少用 Token,而是发送产生可靠答案所需的最少上下文。

激进地使用缓存

缓存可以防止应用为同一推理重复付费。

一个基础实现可以使用精确匹配缓存:

Request ↓ Cache lookup ├── Hit → Return result └── Miss ↓ LLM ↓ Store result

对于用户会问语义相似问题的应用,也可以考虑语义缓存。系统不再匹配完全相同的 Prompt,而是比较 Embedding,并在相似度超过设定阈值时返回之前的响应。

但语义缓存需要仔细验证。相似的问题并不总是有相同的答案,尤其是在信息随时间变化的场景中。

在增大模型之前先优化 RAG

当检索向 LLM 发送过多上下文时,RAG 应用的费用会变得很高。

一个常见错误是每当检索质量不佳时就增加 top-k:

Retriever → 50 chunks → LLM

更好的 Pipeline 是:

Retriever ↓ Metadata filtering ↓ Top-k retrieval ↓ Reranking ↓ Context compression ↓ LLM

过滤和重排序让应用能够提供更少但更相关的片段。

这减少了输入 Token,同时可能提升答案质量。因此在生产环境中,应该先进行 RAG 优化,而不是简单地切换到更大的模型。

控制 Agent 循环和重试

Agentic 应用会产生意想不到的成本,因为一个用户请求可能触发多次 LLM 调用。

User request ↓ Planner ↓ Tool call ↓ LLM ↓ Tool call ↓ LLM ↓ Final response

一个看似简单的请求可能变成一个多步推理工作流。

设置明确的限制,例如:

  • 最大 Agent 迭代次数
  • 最大工具调用次数
  • 每个请求的最大预算

对于可预测的工作流,还应尽可能用确定性代码替代 Agent 推理。如果一个任务可以用普通函数处理,就没有理由为此花费一次 LLM 调用。

批处理和异步处理

并非所有 AI 任务都需要即时响应。

聊天机器人等交互式应用需要低延迟,但文档分类、批量摘要、数据提取和内容处理等工作负载通常可以异步运行。

根据模型和提供商的不同,批处理可以提高资源利用率,并减少处理大量单独请求所产生的开销。

构建具备成本意识的 LLM 架构

当 Token 用量和推理行为可衡量时,成本优化会变得容易得多。

LLM 网关或可观测层应该追踪以下指标:

  • 输入和输出 Token 数
  • 每个用户或工作流的成本
  • 每个请求的 LLM 调用次数

这让团队能够识别高成本的工作流,而不是盲目优化。

例如,仪表盘可能揭示一个看似廉价的聊天机器人正在产生高成本,因为每次对话都在反复发送数千个历史 Token。

在生产环境中降低 LLM 成本,与其寻找最便宜的模型,不如说是消除不必要的推理。

对于在亚太地区构建或扩展 AI 应用的企业,Adamo APAC 提供 AI 开发服务,涵盖 LLM 应用开发、RAG 系统设计与实现、AI 集成以及生产级 AI 解决方案。其工程团队可以帮助围绕成本、性能、可扩展性和可靠性优化 AI 架构,而不是将 LLM 推理视为孤立的 API 调用。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
用Python/ChromaDB/Gemini搭建轻量级RAG实战
下一篇
AI驱动开发反思:过度规格化反而拖累AI编程