前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8614
  • 用活动图逐节点排查Copilot代理故障
  • AI安全测试因隔离失误波及外部系统
  • 用CLAUDE.md统一团队编码输出
  • Kimi K3开放权重,但个人设备难以运行
  • 用延迟与Token识别Agent空转
  • Maple端侧模型实现每秒127词元
  • 让 AI 生成的界面严守设计令牌
  • 把 AI 界面转成可维护的 Figma 组件库
  • 生产级 LLM 推理的 KV 缓存优化
  • 用 DSPy 把提示词变成稳定接口
  • 别让聊天记录充当 Agent 状态机
  • 用 Git 为编码 Agent 构建有效记忆
  • 生产级 LLM 可观测性不能只看 APM
  • FLUX 3上线原生音视频生成
  • 用300行 Python 自动生成资讯简报
  • 给 AI 编程工具加一道本地隐私网关
  • 用类型系统消除量化模型格式歧义
  • Meta 发布终端编程智能体 Muse Code
  • AI 代码生成平台安全检查清单
  • MiniMax H3登顶开源视频模型社区
  • 动态定价下的LLM预算保护设计
  • 把生产环境提示词当作代码治理
  • 五个被低估的MCP能力
  • 按任务场景选择大模型的方法
  • 欧盟 AI 透明度规则正式生效
  • 让 AI Agent 按工单自动结算
  • 构建可审计的半自主 EDA Agent
  • 让编码 Agent 记住被否决的方案
  • 构建动态多模型路由层
  • 用脚本自检守住高风险正则
  • 让AI代理继承用户权限而非共享密钥
  • 五款自托管AI对话前端怎么选
  • 用命令行低成本批量分析文本
  • MiniMax H3 的 ComfyUI 部署指南
  • Node.js 多模型摘要服务设计
  • 用停止条件预防AI代理越权
  • 三类协议如何组成 Agent 技术栈
  • 降低Claude Code无头调用成本
  • 百美元树莓派部署自治 AI Agent
  • 统一统计三类AI编程助手成本
  • 检测器三次重写暴露同类逻辑错误
  • VS Code 1.132 强化智能体协作
  • 代码检索为何需要三类索引协同
  • 用可替换网关解耦实时多模态模型
  • 小米开源具身智能模型完整工具链
  • 用A2A打通多智能体协作流程
  • 用连续性账本维持AI角色记忆
  • 自建全套AI开发工具:Token消耗实测下降52%
  • 我是如何构建自主Agent流水线的
  • WPA引入AI辅助定位性能瓶颈
  • 微软 SkillOpt 证明优化后的 Agent 技能可跨模型和工具链复用
  • 已加载 51 / 8614
8.0
热点
AI SCORE
技术实践2026-08-06 13:30

动态定价下的LLM预算保护设计

dev.to · AI#LLM推理#成本控制#动态定价
Editor brief · 编辑速览

文章指出现货推理价格在调用完成前无法确定,传统按固定单价预估成本的守卫会失效。建议调用前按最高可接受报价和预估Token预留预算,完成后再按实际费用结算释放差额。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

大多数 AI 成本防护机制都基于一个假设:

你在发起请求之前就知道价格。

对大多数 LLM API 来说,过去确实如此。

但随着推理市场引入动态定价,这一假设正变得越来越不成立。在这种市场中,不同提供商会竞争请求,最终价格要到运行时才能确定。

这带来了一个很有意思的工程问题。

传统的预算防护机制

典型的调用前预算检查很简单:

  • 查询模型价格。
  • 估算 token 用量。
  • 估算请求成本。
  • 与当前 session 的剩余预算进行比较。
  • 允许或阻止请求。

当价格固定时,这套机制非常有效。

但如果最终价格要等请求完成后才能知道,效果就没那么好了。

有两种显而易见的处理方式。

忽略价格的不确定性

这等于放弃了成本防护机制存在的一个主要理由。

始终按标价计算

这样做很安全,但往往过于保守。最终你会拒绝一些原本完全可以在预算范围内完成的请求。

预留最高金额,再按实际费用结算

一种借鉴自云基础设施的模式要有效得多。

与其估算精确成本,不如预留你愿意支付的最高金额。

interface SpotRequest {
  maxBidPerMillion: number;
  estimatedInputTokens: number;
  estimatedOutputTokens: number;
}

预留最坏情况下的支出。

如果这笔预留金额超过 session 预算,就拒绝请求。

请求完成后,用实际收取的金额替换预留金额。

将未使用的预算释放回 session。

这里最重要的特性是:你的预算永远不会在任何时刻被虚增。

预算执行变得确定

采用这种方式后,防护机制不再问:

这个请求会花多少钱?

而是问:

这个 session 能否承担我们愿意支付的最高金额?

这个问题在请求离开你的进程之前就可以得到答案。

出价上限成为另一种优化工具

一旦引入可接受的最高价格,这个上限就可以成为路由策略的一部分。

  • 低价值分类任务 → 较低的出价上限
  • 代码审查 → 中等出价上限
  • 架构任务 → 较高的出价上限

随着 session 预算逐渐减少,这些上限也可以变得更加保守。

当资金不足时,你的系统不必只是简单地拒绝请求,而是可以自动提高选择标准,更谨慎地决定哪些任务值得付费。

今天面对的是现货定价的推理服务。

未来还可能是:

  • 动态提供商市场,
  • 特定区域定价,
  • 或者跨多个提供商的实时路由。

它们的共同模式都是:

发送请求之前,精确价格不再能够得到保证。

这意味着运行时成本控制机制也需要随之演进。

它们不应继续假设每个请求都有固定价格,而应该被设计成能够在不确定性下运行——使用可接受的最高成本执行预算约束,然后在请求完成后根据实际价格进行核算。

对于 AI 基础设施看起来正在迈向的方向而言,这是一种灵活得多的架构。https://github.com/salimassili62-afk/ai-costguard

如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
MiniMax H3登顶开源视频模型社区
下一篇
把生产环境提示词当作代码治理