前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
基础篇
进阶篇
高频篇
精选篇
手写篇
原理篇
面经篇
AI 面试
自检篇
每日一题
  • 综合
    • 综合题型
    • 其他问题
    • 设计模式
    • 思维导图
    • 学习路线
  • 前端基础
    • HTTP
    • 浏览器
    • 计算机基础
  • 进阶学习
    • NPM工作流
    • Docker
    • Canvas
    • Node学习指南
    • 前端综合文章
  • 其他
    • Handbook
    • 职场话题
    • CSS可视化
小程序题库
公众号动态
博客动态
AI 热点
开发者导航
返回 AI 情报前线
All News · 全部资讯4085
  • AI Agent平台选型:购买vs自研决策框架
  • 多Agent自主编程流水线:SideButton Portal
  • AI时代开发瓶颈转移:从编码到审查
  • GPT-Live低延迟语音AI系统:六月从零到一
  • Agent本地化浪潮——三个改变部署形态的项目
  • Mistral 7B推理成本降400倍:$4/月VPS完整部署方案
  • LobeChat 开源项目深度评测:多模型支持和部署方案
  • MCP 和 Skills 架构对比:AI Agent 集成最佳实践
  • 深度调试案例:五层根本原因分析一个神秘 Bug
  • MCP Agent 生产化:Docker + Kubernetes + 可观测性完整方案
  • AI 代理开发如何改变程序员工作流:从编码转向审查
  • Kimi K3 发布:百万 token 长上下文与强编程能力
  • 开源自媒体工具链:跨 10+ 平台内容发布全自动化
  • Qwen3.8-Max:2.4T参数如何改变开发工具选择
  • IBM 报告:AI 攻击占数据泄露 1/4,防御需加速漏洞修复
  • LLM 总成本对比:自托管 Llama vs 云 API 真实成本
  • AI 编码助手的设计系统赋能:从通用到专业
  • 网络爬虫工程实战:反爬虫对抗的完整方案
  • Rust 高性能 AI 代码审查工具:系统编程最佳实践
  • Ops Agent 的安全漏洞:提示注入即远程代码执行
  • 80% 降价反而成本上升:AI 账单的 Jevons 悖论
  • Google Gemini Robotics 2发布,人形机器人控制API开放
  • Qwen3.8-27B仅需17GB显存运行验证
  • 通义千问 3.8-Max 模型通过 OpenAI 兼容 API 可用
  • AI Agent 误删 45 个文件的真实事故复盘
  • Qwen3.8-Max官宣:全模态创作力对标顶级模型
  • 在 Next.js 中架构 AI 异步处理:避免请求阻塞的完整方案
  • MCP新规范正式版:一键审计服务器兼容性
  • Prompt设计最佳实践:精简上下文优于巨型提示
  • MiniMax H3开源多模态模型Day-0适配国产GPU,成本优化40倍
  • 用 Claude 和 CoinGecko 构建实时加密货币分析 Agent
  • Agent 系统的紧凑记忆优化:降低上下文成本
  • Qwen 3.8 发布,编程与推理能力升级
  • OpenAI Agents Python框架14天实战测评
  • 用AI编程工具远程部署服务器的无密钥方案
  • Agent 系统设计:从 Prompt 工程转向上下文工程
  • C++ 高效加载机器学习模型的完整实现
  • Word 提示注入漏洞:Copilot 被劫持 144 天未修
  • 12个AI自动化案例详解:如何集成AI到实际工作流
  • AI 框架选型完全指南:分类体系与决策方法论
  • Agent AI vs 生成式 AI:本质区别与应用边界实战指南
  • 阿里发布通义千问3.8-Max大模型
  • Agent管道的隐形故障:Fallback陷阱案例
  • 生产级流式 LLM API 客户端实现指南
  • Agent 系统中的批准陷阱:为什么状态转移需要重新验证
  • LLM 成本感知路由:用 Flash 模型减少 60% 支出的系统设计
  • AI 代码迁移引入 Bug:COBOL→Java 实验分析
  • 用 AI 助手开发浏览器扩展踩过的坑:验证比相信更重要
  • RAG 系统检索失败根本原因:数据分块策略而非模型能力
  • AI Agent 失控成本爆炸:防护实战指南
  • 开源视频生成模型 MiniMax H3
  • 已加载 51 / 4085
8.0
热点
AI SCORE
技术实践2026-08-03 14:00

80% 降价反而成本上升:AI 账单的 Jevons 悖论

dev.to · AI#成本分析#Agent#经济学
Editor brief · 编辑速览

用经济学解释为什么 OpenAI 降价 80% 后 AI 总成本仍上升:廉价催生新需求,Agent 工作负载增加 10-50 倍 token 消耗。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

本周 AI 价格战又有了新动向:OpenAI 将 GPT-5.6 Luna 的价格下调了 80%,GPT-5.6 Terra 则降价 20%。Claude Opus 5 登陆 Amazon Bedrock,定价维持在每百万 token 输入 5 美元、输出 25 美元,并提供 100 万 token 的上下文窗口。每条新闻标题表达的都是同一个意思:智能正在迅速变得更便宜。

可为什么我接触的每一个工程团队都在反映同一件事——这个季度,云账单里的 AI 支出又增加了?

因为整个技术栈中,只有 token 在变便宜,而 token 在账单中的占比却越来越小。我们来算算这笔账。

Jevons 悖论,不过这次主角是 token

1865 年,经济学家 William Jevons 发现,效率更高的蒸汽机并没有减少煤炭消耗,反而增加了消耗量。因为效率提升后,蒸汽动力可以用于那些过去因成本过高而无法采用它的场景。

把煤炭换成 token,道理也是一样。当 Luna 降价 80% 后,团队不会把节省下来的钱揣进口袋,而是会启动那些按原价计算时处于成本临界点的工作负载:

那个“在每个 PR 上运行都太贵”的代码审查 bot,现在会在每个 PR 上运行。

原本每天执行一次的日志摘要任务,现在改为每小时执行一次。

原本只负责回答问题的 Agent,现在开始直接采取行动——而一个执行任务的 Agent 所消耗的 token,是问答型 Agent 的 10~50 倍,因为规划、执行、验证循环就是一座 token 熔炉。

价格降低 80%,随后用量增长 10 倍,最终账单反而会翻一倍。这并不是团队缺乏成本纪律,而是降价在完全按照预期发挥作用——当然,是按照厂商的预期。

账单的构成正在悄然改变

更重要的变化是:token 支出正在成为 AI 基础设施成本中的少数部分。以下是今年围绕模型陆续上线的技术栈:

  1. Agent 运行时。 AWS Bedrock AgentCore、Azure Foundry Agent Service、Vertex AI 的 Agent 技术栈——今年,每一家主要云厂商都推出了托管式 Agent 基础设施。运行时、网关、身份管理、托管内存:每一项都是 2024 年账单上还不存在的全新计量收费项目。你付费购买的并不是智能本身,而是支撑智能运行的脚手架;而脚手架不会在某个星期二突然降价 80%。

  2. Agent 的记忆与状态。 长期记忆存储、向量数据库、会话持久化。记忆的成本由存储和检索计算组成,其定价遵循传统云服务的成本曲线,也就是缓慢下降,而不是模型成本那种断崖式下跌。

  3. 可观测性。 追踪 Agent 做过什么、评估输出结果,以及为审计保存完整的对话链路。团队经常会发现,自己的 LLM 可观测性支出已经可以与 token 支出相提并论——相当于每个 token 都要存储并查询两遍。

  4. GPU 成本底线。 如果你自行运行过任何推理服务,就会知道一个难以启齿的秘密:自托管模型的经济性主要由利用率决定,而具有突发性的 Agent 工作负载恰恰是利用率的毒药。为了应对 Agent 活动峰值而配置的 GPU 节点池,大部分时间都处于闲置状态,却始终按全价计费。

从我在真实账户中观察到的大致结构来看:2024 年约为 80% token、20% 其他成本,如今正在转向约 30% token、70% 运行时、记忆、可观测性与 GPU 成本——与此同时,AI 总支出仍在逐季度增长。

为什么这已经成为一个 FinOps 问题

过去两年,AI 成本一直有一套令人安心的叙事:“再等六个月,价格就会下降。”对 token 来说,这确实如此。但对技术栈中的其余部分来说,这一点毫无意义——其余部分都是普通的云基础设施,影响它们的是常规的 FinOps 手段,而不是模型厂商之间的价格战:

闲置的 Agent 运行时和 GPU 资源池,与闲置的 EC2 遵循相同的规律——为它们设置调度计划。评估环境中的 GPU 节点组没有任何理由在凌晨 3 点继续运行(我们会像安排 staging 环境一样,定时让它进入休眠;使用的也是同一套工具,ZopNight 会把 GPU 节点组视为任何其他可调度资源来处理)。

可观测性数据的保留时长是一个可以调节的选项。为聊天机器人保留 90 天的完整链路是一种选择,而这通常恰好又是默认设置,并且这个默认设置代价高昂。

“更便宜的模型”是一项规格优化决策。Luna 降价 80% 后,模型选择已经成为与实例选择同等重要的成本杠杆。把较简单的 70% 请求路由到低价层级,就相当于今年版本的“把开发环境迁移到 spot 实例”。

异常检测需要覆盖 AI 资源。陷入重试循环的 Agent,就是新时代的“忘记关闭 p4d 实例”——按天汇总的账单粒度完全发现不了它,直到它变成一个非常显眼的数字。

价格战的新闻标题都是真的,而且还会不断出现——Luna 不会是最后一个降价 80% 的模型。但在今年的某个时间点,“token 变便宜了”和“运行 AI 变便宜了”已经不再是同一回事。账单的重心已经转移到模型周围的基础设施上,而这一部分不会随着价格战出现断崖式降价。它只会像云账单一直以来那样:悄无声息地增长,直到终于有人认真查看。

模型降价之后,真的有人看到自己的 AI 总支出下降了吗?我一直在问,却还没有找到这样的例子——如果你是个例外,我确实很想知道,你采用了哪些不同的做法。

如需采取进一步措施,你可以考虑屏蔽此人和/或举报滥用行为。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
Ops Agent 的安全漏洞:提示注入即远程代码执行
下一篇
Google Gemini Robotics 2发布,人形机器人控制API开放