Epoch AI 数据显示 AI 达到固定性能基准的成本每年下降约 13 倍;MIT 测算算法进步贡献约 3 倍/年,但推理模型因计算量更大成本反而上升。
在特定 AI 基准测试上达到固定性能水平的成本,自 2023 年以来大幅下降。
跟踪 AI 趋势的研究机构 Epoch AI 表示,成本平均每季度下降约 47%,即每年约 13 倍。该机构称,没有其他变革性技术的下降速度能与之相比。这一数字反映的是固定基准分数对应的市场价格,而非纯粹的算法或架构进步——更不是现实生活中的生产力成本,那是另一个话题了。
麻省理工学院的研究人员参考了可比数据,认为成本每年下降 5 到 10 倍。他们剔除更便宜的硬件和竞争性定价压力后,将算法效率的实际提升定在每年约 3 倍。每次运行的最佳性能实际上可能更贵,因为更新的推理模型每个任务消耗的计算量要大得多。
不过,两项研究问的是不同的问题。匹配去年的顶级能力?成本大幅降低。运行当前的最佳模型?每次查询的费用往往显著更高。
Epoch 以 OpenAI 的 o3 为例。2025 年初,o3 在 GPQA Diamond(一项博士级科学测试)上得了 75 分,估计每次问题花费 30 美分。18 个月后,GPT-5.6 系列模型以相同的分数获得了四分钱的成绩。Epoch 表示这是原始价格的 1/725。如果汽车以同样的速度降价,一辆 5 万欧元的汽车将不到 70 欧元。OpenAI 就在几天前发布了更便宜的 GPT-6 Sol 和 Luna 模型,所以差距可能进一步拉大。

Epoch 的分析基于涵盖数学、科学和逻辑谜题的五个基准测试。由于样本范围较窄,该机构称其发现是"基于最佳可用数据的合理但粗略的测量"。
Hans Gundlach 和麻省理工学院的同事使用了比较平台 Artificial Analysis 的定价数据,时间跨度为 2024 年 4 月至 2025 年 11 月,评估的每个测试模型数量比之前的研究要多得多。他们的数字低于 Epoch 的部分原因是,更新的推理模型可以向困难问题投入额外的测试时计算,从而推高每个正确答案的成本,即使每个 Token 的价格在持续下降。Token 是提供商计费的文本单位,单独比较它们会忽略全貌。
当麻省理工学院分解推动价格下降的因素时,更便宜的硬件占了一部分,竞争占了更多。研究人员通过单独查看开源模型来控制竞争因素。剩下的就是纯粹的算法效率提升,结果是每年约 3 倍。Epoch 的 13 倍数字更高,因为它没有剔除硬件和竞争的影响。

麻省理工学院还发现,一些性能提升仅仅是来自投入更多计算。一个在 GPQA Diamond 上击败其前身的新模型从表面看是进步,但作者估计很大一部分改进来自于每个问题使用更多处理能力。它的分数更高,但运行成本也更高。编程和数学基准测试显示出同样模式的较小版本。
并非所有基准测试的进步都是效率的进步。新模型将更好的训练、更好的数据、更好的架构和更多的测试时计算打包在一起。一个单一的分数混淆了所有这些。
还存在"刷基准分"(benchmaxxing)问题:AI 公司可能针对已知测试进行优化,在没有现实世界收益的情况下推高分数。Epoch 通过包含一个基于保密游戏的测试"Mystery Game Puzzles"来防范这一点。在该测试上成本下降最慢,这符合刷基准分理论,但也可能仅仅反映任务格式或数据中的噪声。
当你要为特定任务选择模型时,广泛的成本平均值帮助不大。像 Artificial Analysis 这样的平台会按质量、价格、延迟、上下文窗口和输出速度对模型进行排名,而最便宜的选项很少在每个维度上都胜出。
一个低成本但高延迟的模型对实时聊天机器人毫无用处。一个强大的推理模型可能对自动化工作流来说太慢了。更贵的前沿模型如果能更准确地完成任务并减少重试次数,仍可能省钱。这些都不会出现在简单的每 Token 价格比较中。我们在前沿雷达 #3 中深入探讨了这个 Token 经济问题。
AI 新闻,无炒作——人工精选
订阅 THE DECODER,享受无广告阅读、每周 AI 时事通讯、我们独有的"AI 雷达"前沿报告(每年六期)、完整档案访问权限以及评论 section 访问权限。
继续阅读获取完整图景。