用户发起普通UX验证任务,Codex自动创建826个并行Agent,消耗约7.8万美元API费用,并删除所有操作记录,至今无法联系到人工客服。
2026 年 7 月 10 日,我在 VS Code 里打开了一个普通的 Codex 任务。
任务运行时使用:GPT-5.5 / Medium reasoning
我的提示词非常简单,只是要求对产品内某个模块做 UX/UI 验证。
接下来几天经过深入分析后发现的真相是:
这个 Root ID 为 019f4b90-4169-7201-bfdd-732940d8631e 的任务,使用 GPT-5.5 / Medium reasoning 创建了 826 个子任务,记录显示为 GPT-5.6 Sol / Ultra(注意 reasoning 级别和模型选择的差异)
这 826 个不是单次对话里的 826 条消息,而是 826 条独立的子任务记录,每条都有自己的 ID。
其中有一个特别奇怪的群组,共 104 个子任务。它们都保留了原始任务的相同初始消息,记录为 GPT-5.6 Sol/Ultra,且没有记录的 agent_role 或 agent_path。
仅这 104 个任务就产生了约 1479 亿本地 final task-token 计数器。
从它们的标题可以看出,最初我只是要求检查 UI/UX,后来却扩展成了后端基础设施、OAuth、计量、强化、审计、认证、实施和发布相关的工作。
需要说明的是:这些本地 token 计数器并不是权威的 OpenAI 计费账本,我并没有说 1479 亿本地计数器可以直接乘以 API 价格来计算费用。
这恰恰是问题的一部分:只有 OpenAI 才有服务端映射。
还有另一个不寻常的关联。
在 Codex 客户端 build 0.144.0-alpha.4 下,该任务家族包含:
584 个子任务 / 约 1543.6 亿本地 token 计数器
平均:每个任务约 2.643 亿
242 个子任务 / 约 7.51 亿
平均:每个任务约 3100 万
这意味着平均每个子任务的本地 token 量相差约 8.5 倍。
上述 104 个高容量任务中有 103 个是在 0.144.0-alpha.4 记录时创建的。
这让我相信 alpha 版本包含了一个严重 bug,因为同样的模式在其他几个任务中也被注意到了。
财务方面,我重建的 OpenAI 计费历史包含 162 张付费发票,总计 $79,664.88,分散在 Automatic Reload 和其他“Credits”之间。
没有任何等效的实时控制台给我一个可理解的消费全景,而且大部分日志似乎已从我的服务器自动删除:在恢复的本地状态中,约 2550 个未归档的传统线程仍有元数据,但本地已没有对应的原始 rollout 可用。
换句话说,这些任务存在的证据还在,但用于重建生成它们所用指令的详细执行历史已不在我的机器上了。
我还亲眼观察到任务/对话从正常可见的历史记录中消失。
我联系了 OpenAI Support 并开了工单 #15189838。
我提供了技术证据并反复请求服务端重建,但 OpenAI 只是回应“credits 已被消耗”,没有给出任何细节。
我很想听听其他在 7 月/8 月使用过 Codex 的人:你们检查过自己的本地 Codex 状态吗?是否见过意外大量的子 agent 树、模型/reasoning 升级、重复子任务或原因不明的 Automatic Reload 活动?
尤其感兴趣的是任何有 Codex 0.144.0-alpha.4 日志的人。
如果 OpenAI 的工程师正在看这篇文章,我也欢迎一个技术解释。
你们拿着这么多钱却不知道如何在 AI 工具上设置安全防护?
你们是随便从街上走进来上班的吗?
你们到底在哪工作啊?
希望这篇文章能有更多关注,不知道为什么被标记了,估计是那些公司的公关在做吧
应该把这个传播出去
他们在保护自己的利益,诚实和真相都得靠边站。那些对他们来说只会带来更差的回报和更高的风险。
AI agent 失控发了价值 $80,000 的 API 请求?
然后他们还指望你继续付钱而且不回应当?
说实话这感觉像是在炒冷饭。
要么就是你是成千上万个假机器人或付费水军之一,故意制造恐惧说"天哪 AI 要吃掉我们的孩子了,训练必须被老大哥监管!"。
这篇文章在 13 分钟内拿到了 44 个赞,这在 HN 上算是某种纪录了。