Hacker News 最高热度话题(643 points),官方详解 GPT-5 的核心性能、定价体系与系统限制,开发者选型必读。
我已预览访问 GPT-5 模型家族两周(见相关视频和我的披露),一直将 GPT-5 作为我的日常模型使用。它是我的新宠。它仍然是一个 LLM——并不是一个与以前所有东西的戏剧性背离——但它很少出错,通常在我喜欢用模型完成的那些事情上都表现得很有能力,偶尔令人印象深刻。
过去两周我收集了大量笔记,所以决定分成一系列文章来发布。第一篇将涵盖模型的关键特征、定价方式以及我们从 GPT-5 系统卡中能学到什么。
让我们从基础开始。ChatGPT 中的 GPT-5 是一个奇怪的混合系统,在不同模型之间切换。以下是系统卡对此的说法(我的重点用粗体标出):
GPT-5 是一个统一系统,拥有一个聪明快速的模型来回答大多数问题,一个用于较难问题的深层推理模型,以及一个实时路由器,它根据对话类型、复杂性、工具需求和明确意图(例如,如果你在提示中说"仔细思考这个")快速决定使用哪个模型。[...] 一旦达到使用限制,每个模型的迷你版本处理剩余查询。在不久的将来,我们计划将这些功能整合到单个模型中。
API 中的 GPT-5 更简单:它以三个模型的形式提供——regular、mini 和 nano——每个模型都可以以四个推理级别之一运行:minimal(一个以前对其他 OpenAI 推理模型不可用的新级别)、low、medium 或 high。
这些模型的输入限制为 272,000 个令牌,输出限制(包括不可见的推理令牌)为 128,000 个令牌。它们支持文本和图像输入,仅文本输出。
我主要探索了完整的 GPT-5。我的结论:它在很多事情上都很出色。它感觉不像是与其他 LLM 的戏剧性飞跃,但它散发出一种能力感——它很少出错,经常给我留下深刻印象。我发现它是我想做的一切的一个非常理性的默认选择。我从未发现自己想要针对不同模型重新运行提示来尝试获得更好的结果。
以下是 GPT-5、GPT-5 mini 和 GPT-5 nano 的 OpenAI 模型页面。知识截止日期是 GPT-5 的 2024 年 9 月 30 日,以及 GPT-5 mini 和 nano 的 2024 年 5 月 30 日。
这三个新 GPT-5 模型显然打算作为 OpenAI 大部分其他产品线的替代品。系统卡中的这个表格很有用,因为它显示了他们对新模型如何适应的看法:
那个"thinking-pro"模型目前仅通过 ChatGPT 提供,标记为"GPT-5 Pro",限于 $200/月层级。它使用"并行测试时间计算"。
GPT-5 不涵盖的唯一功能是音频输入/输出和图像生成。这些继续由 GPT-4o Audio 和 GPT-4o Realtime 及其 mini 变体以及 GPT Image 1 和 DALL-E 图像生成模型等模型涵盖。
与其他提供商相比,定价具有积极竞争力。
GPT-5:输入 $1.25/百万,输出 $10/百万
GPT-5 Mini:输入 $0.25/百万,输出 $2.00/百万
GPT-5 Nano:输入 $0.05/百万,输出 $0.40/百万
GPT-5 的定价是 GPT-4o 输入成本的一半,并保持相同的输出价格。这些不可见的推理令牌算作输出令牌,所以你可以期望大多数提示使用比其 GPT-4o 等价物更多的输出令牌(除非你将推理努力设置为"minimal")。
令牌缓存的折扣也很大:前几分钟内已使用的输入令牌打 90% 折扣。这特别重要,如果你实现一个聊天 UI,其中每次用户向序列添加另一个提示时,相同的对话都会被重放。
以下是我整理的一个比较表,显示新模型与 OpenAI 竞争对手最相近的模型:
(这是一个 GPT-5 失败的好例子:我试图让它输出那个排序好的表格,但它把 Nova Micro 放得比 GPT-5 Nano 更贵,所以我提示它"用 Python 构造表格并在那里排序",那解决了问题。)
与往常一样,系统卡对训练数据中的内容含糊其辞。以下是它的说法:
像 OpenAI 的其他模型一样,GPT-5 模型是在多样化的数据集上训练的,包括在互联网上公开提供的信息、我们与第三方合作访问的信息,以及我们的用户或人类训练师和研究人员提供或生成的信息。[...] 我们使用高级数据过滤流程来减少训练数据中的个人信息。
我发现这一部分很有趣,因为它揭示了书写、代码和健康是 ChatGPT 的三个最常见的用例。这解释了为什么在健康相关问题上付出了这么多努力,对于 GPT-5 和最近发布的 OpenAI 开放权重模型都是如此。
我们在减少幻觉、改进指令遵循和最小化唯唯诺诺方面取得了重大进展,并在 ChatGPT 的三个最常见用途中提升了 GPT-5 的性能:书写、编码和健康。所有 GPT-5 模型还包含 safe-completions,这是我们最新的安全训练方法,用于防止不被允许的内容。
Safe-completions 之后被描述为:
传统上,像 ChatGPT 等支撑的大型语言模型一直被训练为要么尽可能有帮助,要么完全拒绝用户请求,具体取决于提示是否被安全政策允许。[...] 二元拒绝边界对双用途案例(如生物学或网络安全)特别不适合,其中用户请求可以在高级别安全完成,但如果足够详细或可操作,可能导致恶意提升。作为替代方案,我们引入了 safe-completions:一个以助手输出的安全性为中心的安全训练方法,而不是对用户意图的二元分类。Safe-completions 寻求在安全政策约束下最大化帮助。
因此,与其直接拒绝,我们应该期待 GPT-5 仍然提供答案,但调节该答案以避免它包含"有害"内容。
OpenAI 有一篇关于这个问题的论文,我还没有读(我没有获得提前访问):《From Hard Refusals to Safe-Completions: Toward Output-Centric Safety Training》。
唯唯诺诺得到了提及,考虑到他们在 4 月份的高调灾难,这并不奇怪。他们在核心模型中已经处理了这个问题:
系统提示虽然容易修改,但对模型输出的影响相对于后训练变化有限。对于 GPT-5,我们对我们的模型进行了后训练以减少唯唯诺诺。使用代表生产数据的对话,我们评估了模型响应,然后分配了一个反映唯唯诺诺程度的分数,该分数在训练中用作奖励信号。
他们声称在减少幻觉方面取得了令人印象深刻的成果。在我自己的使用中,我还没有发现任何幻觉,但对于我最近的 Claude 4 和 o3 也是如此——幻觉在今年的模型中问题少得多。
更新:我对这一点有过一些合理的反驳,所以我应该澄清我的意思。当我使用"幻觉"一词时,我指的是模型自信地陈述一个不真实的真实世界事实的情况——比如体育赛事的错误赢家。我不是在说模型犯其他类型的错误——他们一直在犯错误!
有人指出,我可能通过我使用模型的方式来避免幻觉,这完全是正确的:作为一个有经验的 LLM 用户,我本能地避开可能会引发幻觉的提示,比如向非搜索启用的模型询问 URL 或论文引用。这意味着我在日常使用中遇到幻觉的可能性要少得多。
我们在训练 GPT-5 模型时的一个焦点是降低事实幻觉的频率。虽然 ChatGPT 默认启用浏览,但许多 API 查询不使用浏览工具。因此,我们专注于训练我们的模型有效地浏览以获取最新信息,以及在模型依赖自己的内部知识时减少幻觉。
关于欺骗的部分还包含了模型有时假装他们完成了击败他们的任务的东西:
我们将 gpt-5-thinking 放在了各种部分或完全不可行完成的任务中,并奖励了模型诚实地承认它无法完成该任务的情况。[...]
在代理需要使用工具(如网络浏览工具)以回答用户查询的任务中,以前的模型会在工具不可靠时幻觉信息。我们通过故意禁用工具或让它们返回错误代码来模拟这种情况。
关于提示注入有一个部分,但在我看来它相当弱。
两个外部红队小组进行了为期两周的提示注入评估,针对 ChatGPT 连接器和缓解中的系统级漏洞,而不是仅模型行为。
这是他们展示模型与该领域其余部分的得分情况的图表。与其他模型相比这是一个令人印象深刻的结果——gpt-5-thinking 的攻击成功率为 56.8%,其中 Claude 3.7 的得分在 60 多岁(这里不包括 Claude 4 结果),其他一切都是 70% 以上:
一方面,56.8% 的攻击率相对于所有其他模型来说是一个明确的大幅改进。
但这也是一个强烈的信号,提示注入继续是一个未解决的问题!这意味着超过一半的 k=10 攻击(攻击者能够尝试十次)突破了防线。
不要假设提示注入不会成为你的应用程序的问题,只是因为模型变得更好。
我最初认为我对 GPT-5 最大的失望是没有办法通过 API 获取那些思考轨迹……但事实证明并非如此。以下 curl 命令演示了新 GPT-5 模型可以使用响应 API "reasoning": {"summary": "auto"}:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $(llm keys get openai)" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-5",
"input": "Give me a one-sentence fun fact about octopuses.",
"reasoning": {"summary": "auto"}
}'
以下是该 API 调用的响应。
没有该选项,API 通常会提供冗长的延迟,同时模型消耗思考令牌,直到你开始获得最终响应的可见令牌。
OpenAI 提供了一个新的 reasoning_effort=minimal 选项,它关闭大部分推理,使令牌尽可能快地开始流回给你。
自然地,我一直在运行我的"生成一只骑着自行车的鹈鹕的 SVG"基准。我实际上会在未来的文章中花更多时间在这个上——我探索了一些有趣的变体——但目前这是我从 GPT-5 在其默认"medium"推理努力下得到的鹈鹕:
非常棒!绝对可以识别为鹈鹕,也是我见过最好的自行车之一。