输入$10/M tokens、输出$50/M tokens、缓存写入$12.5;首次填充100万token花费$10,20步Agent循环重读需$200,缓存后每步仅$1。
GPT-6 Astra 于 9 月 3 日上线,所有人都在重复同一个核心参数:110 万 token 的上下文窗口。把整个代码库、整个知识库、整个 PDF 扔进去——再也不用切块了。
但没有人放在幻灯片上的那条明细:输入 $10 / 百万 token。也就是说填满这个窗口要花 $10 一次调用,这还是 Astra 没生成一个回答 token 之前的费用。输出再算上 $50 / 百万,一个大一点的回复就能让单次交互冲破 $12–15。
在循环里这么做——一个 Agent 每一步都重新读取上下文——你就用一种非常聪明、非常昂贵的方式把云预算烧穿了。下面来做一下实际计算,告诉你什么时候它值得。
Astra 公开定价:
所以几个参考点:
一次性填满 1M token 上下文:约 $10。
一个 Agent 在 20 步中重复发送约 1M 上下文:约 $200,光读取就这个价。输出另算。
同一份上下文在首次调用后缓存:写入约 $12.50,之后每次读取 $1 而非 $10。这个 10 倍的降幅就是整套玩法的核心。
最后那行是人们最容易忽略的。
当任务真正需要全局推理、一次性处理所有内容时,花钱填满 1M token 才划算:
跨文件推理——答案取决于十二个文件如何交互的场景——重构、"为什么这里慢"、"在整个调用栈里追溯这个 bug"。只抓 5 个 chunk 的检索会漏掉藏在第 6 个里的关联。
对大文档的一次性综合——你无法预先知道哪部分重要的场景——合同审查、长期事故时间线、整份规范。
当工程时间成本高于 token 成本时。如果搭一套好用的 RAG pipeline 要花两周调优,而大上下文"直接能用"适用于一个低频内部工具,$10 一次调用可能比你的工资还便宜。
100 万上下文窗口会引诱你为重复读取根本没变化的内容付钱:
你本来就知道哪 5% 是重要的。如果检索本来就能找到相关内容,你刚才是多花了 20 倍的钱让模型帮你找出来。
Agent 循环不带缓存。每一步都重发完整上下文是制造天价账单最快的方式。要么缓存,要么别循环。
"上下文腐化。"超过几十万分 token 之后,更多上下文往往会降低答案质量——模型会被无关的 95% 分心。你可以花更多钱得到更差的结果。
高容量。在规模化场景下,$10 一次调用是商业模型问题,不是账单项。上线前先把乘法做一遍。
当任务需要全部内容且你无法预测哪部分重要时,用大上下文。能用检索时用检索。而一旦对同一份大上下文调用第二次——缓存它——这是藏在眼皮底下 10 倍的削减。
100 万上下文窗口不是骗局。它是一个有价格标签的实用工具,只是会惩罚懒用的行为。把"全部塞进上下文"当作一个有美元数字的决策,而不是一个免费的默认选项,它就很好。把它当免费的,Astra 很乐意在你的账单上给你上一课。
你最惊讶的一笔 AI 账单是什么——是上下文、输出、还是 Agent 循环惹的祸?在下面报出你自己的架构吧。👇
我写 AI 构建相关的东西,以及背后的真实经济学。如果这正是你关注的领域,欢迎关注我。👋