前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8836
  • Google Cloud Developer 插件让 AI 编码助手直连云端部署
  • OpenAI Agent 入侵澳大利亚 Medicare 统计门户
  • Google DeepMind负责人透露Gemini 4即将发布
  • Impeccable:AI 编程代理的确定性设计语言框架
  • AI Agent 生产环境失败启示录:构建攻击性测试
  • 金融合规监控系统的工程实践:数据管道、Agent 架构与审计日志
  • 2026 年十大 LLM 网关横评:语义缓存与多提供商故障转移
  • codebase-memory-mcp:毫秒级代码知识图谱MCP服务器,158语言支持
  • Strands Agents:开源AI Agent开发框架,支持Python/TS全生命周期管理
  • 2026年9大开源LLM网关生产级对比:Bifrost领先
  • 用 TigerGraph+MCP 构建自主欺诈调查 Agent
  • Jev 决策模型真实成本拆解:何时省钱何时烧钱
  • 开源CLM-8B:Agent动作评分比Jev快9倍
  • JEV:打破布尔二值困境的类型安全验证方案
  • Claude Opus 5.5降价40%逼近前沿性能
  • VS Code 1.139:Agent 会话首次加载提速约 12 倍
  • 定时 Agent 总重复干活?用完成分类账让它知道什么是「做完」
  • TypeSafe AI Jev 编码指南:类型化决策、置信度校准与推测式广播
  • Vercel Connect 新增 TanStack AI 集成
  • Anthropic与OpenAI 90分钟内相继降价
  • 选LLM API的六个价格陷阱
  • Agent记忆正常仍出错:问题在状态不在记忆
  • Mercury 2.5 推理速度达 770 tokens/秒
  • GitHub Copilot 代码审查新增个人配置选项
  • MCP单人上手容易,团队规模落地是另一回事
  • 影子测试100%一致率背后:模型实际正确率仅75%
  • 两个都通过的测试,代价却不同:重试的隐性成本
  • 定时运行AI Agent输出飘移的根因与修复
  • Anthropic如何两周将Claude.ai速度提升3倍
  • claude-code-templates:一键装配 Claude Code 开发套件,含 100+ Agent/MCP
  • Agent 删改测试必须拦截:CI 合并门禁实操方案
  • Google Antigravity SDK 支持本地 AI 模型:Gemma 4 26B 可离线跑
  • NVIDIA Warp 与 MjWarp 加速机器人仿真工作流
  • HEMA 用 MCP 和 Amazon Bedrock 实现内部 AI 助手转型
  • 五大LLM网关工具生产环境横评
  • GitHub Copilot应用如何渲染百万行PR
  • 基于 AWS 构建 Agent 式视频智能对话系统架构解析
  • Bedrock 上用开源权重模型做 AI 编程助手
  • Anthropic 实验室:Claude 自主发现类 CRISPR 新型酶系统
  • ChatGPT Voice 集成邮件、日历和 Slack:Altman 心中的"Her"更近一步
  • OpenAI GPT-6 Sol/Luna 和 Claude Opus 5.5 同步降价 50%
  • AI 工具循环必须显式传递 Retry-After 头否则必死循环
  • AI 代码补丁静默引入新工具调用:merge 前必须强制契约检查
  • AI 写 API 文档无法区分 null/0/缺省三态:OpenAPI 契约必须显式约束
  • AI 编程 Agent 工具输出遭截断:应记录 stdout_bytes 和截断标志
  • Anthropic工程师揭秘:Claude为何越进化写作越差
  • Gemini 3.8 Flash / Flash-Lite TTS 发布:千款语音、30秒克隆、逐行台词控制
  • 工程师详解:新版Claude为何写作风格变得怪异
  • 小米MiMo-V3将搭载HySparse 2:100万Token下KV缓存缩小4.5倍
  • GitHub Copilot 应用新增本地沙箱隔离功能
  • AI Agent 调试指南:重启不是调试,七层架构定位根因
  • 已加载 51 / 8836
8.0
热点
AI SCORE
编程提效2026-09-24 07:00

选LLM API的六个价格陷阱

dev.to · AI#LLM#API定价#成本优化
Editor brief · 编辑速览

文章指出比较LLM价格表时的常见误区:token类型混淆、缓存定价忽略、价格无来源无日期、厂商静默调价等。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

你把一张"最便宜的 LLM API"表格 copy 回来,然后按价格列选 model。两周后账单对不上,你却找不到原因。FuturPulse 发表在 Dev.to 上的这篇文章给出了一份读价目表的 checklist,以下是其中可以直接使用的部分。

记录 URL 和日期,不要只记数字

作者的诊断:问题不在于谁在价格上撒谎,而在于比较表格把一个多维度的事物压缩成了唯一一个数字。

按照文章说法,没有来源的价格是谣言,有来源但没有日期的价格是带批注的谣言。供应商会悄无声息地改价目表:没有 changelog,没有通知,只是同一页上出现了一个不同的数字。

所以最低记录单位是三个字段而非一个:model | price | source_url | observed_on。作者说得很清楚,如果你填不出 source_url 用的是 vendor 自己的 pricing 页面——而不是某篇写这个页面的博客——那你就不是有价格,你只是有一个声明。

Input、output 和 cached input 是三个不同的价格

Token output 几乎总是比 token input 贵,通常贵好几倍。Cached input,在有支持的地方,比普通 input 便宜。只有一列的表格正在悄悄选择三种价格中的一种,希望你的 workload 恰好匹配。

文章举了两个实际负载的形态。摘要或提取类任务 input 长、output 短,所以 input 价格占主导。生成内容或运行 agent 则 prompt 短、completion 长、多轮,所以 output 价格占主导——于是"便宜"的 model 在前一种情况下到了后一种情况就变成了贵的。同样的两个 model,结论完全相反,而价目表一个字都没变。

用你自己的日志来计算

作者提议的方法不需要 benchmark,只需要你的日志:取一天真实的请求,计算 input 和 output token 的中位数,再乘以价格。文章里的示例函数按每百万 token 的 USD 价格接收输入,把按缓存比例折算后的 input 部分加上 output 部分,除以一百万得到每次调用的费用,再乘以每天调用数乘以 30 得到月费用。

文章里的示例代码大约十行。作者说,它生成的排名是你的,而表格里的排名是作者以你的名字写的 workload。

两处比较表格完全失效的地方

第一处是 tokenizer。"每百万 token"是一种约定,但 token 不是通用单位——每个 vendor 切分文本的方式不同。对于英文散文,差异小到可以忽略;但对于 code、JSON、非拉丁文字或标点密集的文本则不行。文章没有单独讨论越南语,所以安全做法是在比价前用自己的真实 payload 样本在每个 vendor 的 tokenizer 上跑一遍。

第二处是多模态。图像和音频按每个 vendor 各自的比率换算成 token,取决于分辨率、分块方式,有时还取决于你随请求发送的一个"detail"标志。两个 vendor 可能公布相同的每百万 token 价格,但对同一张图片收费却大相径庭。作者提议唯一诚实的做法:把同样的十个真实 input 发给每个候选者,然后读 response 里的 usage 字段——一个十五分钟的实验。

今天就把 source_url 和 observed_on 两列加到你内部的价目表里。把 input、output 和 cached 分成三列。对于任何"一美元以下"的声明,都要读附带条件——文章提醒这些声明通常没错,但只在特定条件下成立——某个 tier、某个 batch endpoint、某个关于 cached input 的假设,或者某次促销。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
Anthropic与OpenAI 90分钟内相继降价
下一篇
Agent记忆正常仍出错:问题在状态不在记忆