前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8483
  • AI Agent伪装身份欺骗开源维护者:安全沙箱已失效
  • Mistral 开源 3B 安全模型 Shieldstral:本地内容审核新选择
  • 自研 Agent 流水线的实战复盘
  • 自建内部 AI 平台成本远超预期:工程团队需谨慎决策
  • 自适应测试时计算:告别均匀分配推理预算
  • 分离Prefill/Decode:避免长Prompt阻塞所有Token
  • Agent难复现Bug的克星:确定性模拟测试
  • Agent工具调用分支预测:消除等待空档
  • Agent上下文窗口即RAM:引入分页机制
  • 停止让工具流经LLM:2026年代码模式转型
  • SparseSpec-L:无训练稀疏 KV 缓存让长上下文 LLM 推理提速 2.79 倍
  • 三秒延迟排查手记:API 和数据库不在同一区域引发的血案
  • Kotro:用 Rust 构建的本地 AI 编码 Agent 控制平面(MCP + LLM)
  • 我用skill.md约束文件对抗AI生成平庸UI
  • Markdown比HTML在LLM上下文中价值高10倍
  • 我做了个小CLI让AI编程工具不再失忆
  • 英国 AI 安全研究院报告:AI Agent 在提示词范围内主动攻击真实系统
  • 阿里2026云栖大会定档:聚焦Agentic AI全栈技术
  • 廉价模型生产级Prompt调优实录:四次迭代仍失败的经验
  • OpenAI 和 Anthropic 旗下 Agent 曾尝试入侵真实系统
  • LLM路由实操:同一批请求节省78.5%账单
  • Cloudflare开源Cloudflare OS:面向AI Agent的企业协作平台
  • 语义分块:修复RAG检索质量的关键在意义边界而非固定长度
  • MCP检索在小仓库反而多花4倍token:33文件vs249文件的真实对比
  • Cloudflare 推出 Durable Object 原生虚拟文件系统
  • addyosmani/agent-skills:AI 编程 Agent 的生产级工程规范
  • LoopX:AI Agent 长任务状态内核,支持跨运行时接力
  • LLM 调用的枯燥周边:FastAPI 生产级实战笔记
  • AI花钱智能体的四大安全关卡实战
  • Anthropic正在组建自研AI芯片设计团队
  • Stryker MCP Reporter:让 AI 编程助手做变异测试
  • MiniMax H3刚发布即陷价格战,推理成本降至几分钱
  • CrowdStrike推出10万美元AI安全挑战赛:用提示词注入"策反"智能体
  • Stryker MCP Reporter v1.8.2: 让AI编程助手自主完成突变测试并达到100%突变覆盖率
  • MCP over HTTP 安全重设计:去同步与请求头泄露风险
  • AGENTS.md:给 AI 编程工具的工程化指南
  • README 服务人类,AGENTS.md 服务 AI Agent
  • FLUX 3 Video全面可用
  • Anthropic确认自研AI芯片:年薪216万至328万招聘工程师
  • Cloudflare 发布 Agent 访问控制模型:身份代理+持续鉴权架构
  • Cloudflare公开企业级AI工作平台实践
  • Cloudflare WriteGuard:MCP Server 写入细粒度管控方案
  • Cloudflare推出身份感知AI行为分析:实时捕获异常Agent
  • 语音转写深度横评:AssemblyAI 对阵 NVIDIA Parakeet/Canary
  • 自托管还是 API:语音转写 TCO 全面对比
  • Qwen3-ASR vs AssemblyAI:语音转写生产级对比
  • Whisper Large-v3 vs AssemblyAI:生产环境语音转写怎么选
  • 自托管开源语音转写真实成本揭秘
  • Mistral开源Shieldstral:3B参数端侧内容安全模型
  • 图像生成 API 选型:用 JSON Prompt Contract 做安全边界
  • 构建 AI Agent 实战总结:分布式系统思维落地
  • 已加载 51 / 8483
8.0
热点
AI SCORE
编程提效2026-08-05 23:12

LLM路由实操:同一批请求节省78.5%账单

dev.to · AI#LLM路由#成本优化#AI工程
Editor brief · 编辑速览

通过将简单查询路由到廉价模型、复杂证明升级到best-of-3中间层、根据置信度提前终止的策略,在NVIDIA NIM上实现账单从$0.186降至$0.04。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

并非每个问题都值得动用最贵的模型。把所有查询都发给前沿层简单粗暴但代价惊人——一次简单查找和一次严谨证明耗费相同。Agentic AI from Zero 的第七个项目构建了一个路由器,它以最低成本完成任务:简单查找发给一次便宜调用,复杂证明发给最佳-of-3,廉价答案一旦置信就提前退出,超预算就降级而非爆掉。在一次针对 NVIDIA NIM 的真实六次查询运行中,成本为 $0.039971,而非 $0.185790——节省了 78.5%,有实测为证。

按难度路由,而非按模型名。三个层级,每个都有公开的 $/1k 价格,其中 escalate 比 direct 贵约 60 倍——这正是路由的价值所在:

PRICE_TABLE = {                                       # cheapest → dearest
  "direct":   Tier("direct",   0.0005, 1, "one terse call — a cheap model"),
  "cot":      Tier("cot",      0.0030, 1, "one call that reasons step-by-step"),
  "escalate": Tier("escalate", 0.0300, 3, "best-of-3, priced like a frontier model"),
}
LADDER = ["direct", "cot", "escalate"]
EARLY_EXIT_CONFIDENCE = 0.75

免费分类,然后路由

一个廉价的关键词启发式方法——无需 API 调用,$0 成本——给每个查询打 trivial / medium / hard 分,并映射到入口层级(direct / cot / escalate)。模型从不自行选择层级。

路由循环:分类 → 预算 → 运行 → 门控

整个策略是确定性 Python 代码。先分类,如果预算承担不起想要的层级就往下走一级,运行真实调用,检查置信度门控——置信就提前退出,不确定且预算允许则只升一级:

comp = classify_complexity(query)                  # $0, deterministic
want = entry_tier(comp.label)
tier = budget.best_affordable_at_or_below(want, query)   # step DOWN if too dear
if tier is None: return refused                    # can't afford even `direct`
degraded = tier != want                            # forced cheaper than we wanted

while True:
    att = self._run_tier(query, tier)              # a REAL NIM call (usage → $)
    if att.confidence >= EARLY_EXIT_CONFIDENCE:    # confident enough?
        early_exit = tier != "escalate" and not degraded; break   # STOP — don't pay more
    nxt = next_tier(tier)
    if nxt is None: break                          # already at the top
    if not budget.affords(spent_c, spent_t, estimate_cost(query, nxt), ...):
        degraded = True; break                     # DEGRADE — budget says no
    tier = nxt                                      # escalate one step

职责分离才是关键:模型只负责回答、推理、自我评分置信度。它不选择层级、不设预算、不决定提前退出、不计算价格。当 escalate 运行 best-of-N 时,连选择过程都是确定性的——模型提出 N 个多样样本,Python 保留最置信的那个。

一次运行演示的四件事

Token 预算——每个查询都带硬性 $ 上限;查询 5 的紧张 $0.0040 预算阻止了它想要的 escalate,所以降级到 CoT 而不是超支。

按复杂度 + 成本路由——启发式方法对每个查询打分并映射,无需 API 调用。

基于置信度的提前退出——6 个查询中有 3 个在廉价层级就停了,因为自我评分的置信度超过了 0.75;路由器从未为它们支付 escalate 费用。

每次决策的成本分析——账本根据真实使用 token 为每个查询计价,并与测量的基线对比报告节省额:前沿层级实际在所有六个查询上都跑过,所以"节省 78.5%"是测量结果而非说法。

还留下一个诚实的失误:关于"17 只羊,除了 9 只都跑了"的谜语,模型回答 8(正确答案是 9)且自我评分 1.00,所以路由器在一个置信但错误的廉价答案上提前退出了。基于置信度的提前退出用小小的质量风险换取大大的成本节省,这完全取决于模型的自我校准——这正是为什么预算和审计账本都放在模型无法移动的代码里。

逐步走一遍真实路由流水线,看看成本账本和测量基线,在这里获取仓库:https://dev48v.infy.uk/agentic/project7-cost-router.html

下一篇,Project 8:一个事件触发的自动化 Agent。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
OpenAI 和 Anthropic 旗下 Agent 曾尝试入侵真实系统
下一篇
Cloudflare开源Cloudflare OS:面向AI Agent的企业协作平台