OpenAI内部版本Astra成功证明10条长期数学定理,推理token消耗巨大。该结果表明前沿模型在形式化数学推理上取得突破,但成本仍是实用瓶颈。
OpenAI 本周分享了一项重大研究更新,宣布其下一代前沿模型 Astra 的一个内部版本,为数学和理论计算机科学中的 10 个长期悬而未决的问题创建了机器验证的证明——全部使用约 2000 美元的 GPT-5.6 Sol API tokens 完成。
这个定价可能是周一公告中最重要的方面,因为它表明该公司正在引导用户思考:一个已经存在的新模型,发现新知识的成本可能是多少。
这是 OpenAI 首次向外界提供了一个关于这种量级 AI 推理成本的粗略概念。
值得注意的是,这项工作尚未完成,因为结果还需要经过人类数学家的进一步审查。不过,对开发者而言,最重要的是:OpenAI 表示这个研究过程产生了 10 个新结果,而且首次让我们知道了这种量级的 AI 推理大约要花多少钱。
OpenAI 尚未发布该内部模型,也未宣布使用它的定价。2000 美元的估算是基于同等数量 tokens 在 GPT-5.6 Sol API 费率下的成本。
An internal version of our next major model produced 10 new results on long-standing open problems in mathematics and theoretical computer science, using roughly $2,000 worth of tokens at GPT-5.6 Sol API rates. pic.twitter.com/4cgowmPOpY— OpenAI (@OpenAI) August 3, 2026
这个粗略的比较没有计入模型训练成本、周围研究过程的运行成本,也没有计入专家选择问题和评估答案的费用。不过,即便有这些限制,这个对比对开发者仍然很有参考价值。
研究机构很难根据「模型擅长数学」这样的宣传来做规划。但他们完全可以围绕推理预算来制定计划。如果一个具备前沿推理能力的模型最终可以通过 API 访问,团队就可以自主决定:在一个猜想上投入多少资金来探究、在一个可能的证明上投入多少来验证、或者花多少去寻找一个更好的界限。
对开发这些系统的公司来说,最大的成本差异通常来自电力需求——一直到建设下一代模型所需的数十亿美元。
然而,这些成本对最终可能通过 API 访问成熟模型的研究机构来说,并没有那么重要。对他们而言,关键问题在于:一次认真的尝试需要花多少钱来运行。
这就是 OpenAI 估算透露出的基调。创业公司不再需要自己的前沿模型或装满 GPU 的仓库,因为它可以直接购买训练好的模型的推理能力——就像现在的公司租用计算资源而不是自建数据中心一样。
当然,花更多钱并不能保证突破。模型可能消耗了数千美元的 tokens,最终仍然一无所获。
但这种不确定性本来就是科研的一部分,使用 API 也不会改变这一点。只不过,它确实会为研究人员提供另一个追求答案的有效机会。
OpenAI 研究员 Noam Brown 表示,模型使用的测试时计算量相对有限,更大的推理预算仍有待探索。
And yes we did try other major problems without success. Sadly no Millennium Prize problems (yet).But also, we didn't spend a lot on each problem. It's possible to push test-time compute much further.— Noam Brown (@polynoamial) August 1, 2026
该模型没有解决任何千禧年大奖难题(Millennium Prize Problems),但 OpenAI 似乎认为它尚未达到更多推理所能产出的极限。
不过,开发者和研究团队可能很快就需要决定:一个困难的问题值多少钱。一所大学可能会花几千美元来探索一个数学问题,而一家制药公司如果模型能帮助缩小新药搜索范围,则可以证明花费高得多是合理的。
OpenAI 展示的是:前沿推理可以像任何其他计算工作负载一样被讨论。
开发者已经在估算让模型生成代码、分析数据库或处理一批文档的成本,而研究机构最终也可能做出类似的计算——这将改变谁能 experimentation with 前沿系统。构建它们可能仍然是少数富裕公司的领域,但使用它们可能成为一种 API 费用,向小型研究团队开放。