Simon Willison对o3-mini的专业分析,揭示这款轻量级推理模型的实际表现和应用边界。
OpenAI 的 o3-mini 模型 LLM 已支持
OpenAI 的 o3-mini 今日发布。和其他 o 系列模型一样,这个模型有点难以评估——现在我们需要判断一个 prompt 用 GPT-4o、o1、o3-mini 还是(如果有权限)o1 Pro 来运行最合适。
更让人困惑的是,o3-mini 系统卡中的基准测试(PDF)并不是在所有类别上都对 o3-mini 有利。它在大多数方面的基准测试高于 GPT-4o 和 o1,但并非在所有方面都是如此。
o3-mini 最大的优势是在 Codeforces ELO 竞技编程基准测试上,我认为这是由 2025 年 1 月 2 日的论文描述的,分数如下:
o3-mini (medium) 2036
有点奇怪的是,那个 GPT-4o 的分数出现在旧版系统卡 PDF 中,该版本已被更新文档替换,后者完全不提及 Codeforces ELO 分数。
系统卡中有一条针对 OpenAI 自身对 o3-mini 预期应用的说明让我印象深刻:
我们还计划允许用户在 ChatGPT 中使用 o3-mini 搜索互联网并总结结果。考虑到其在越狱和指令层次评估中的表现(详见下面第 4 部分),我们预期 o3-mini 将是一个有用且安全的模型来执行此任务。
这值得关注,因为 ChatGPT 上现有的 o1 模型还没有获得网络搜索工具——尽管搜索和"推理"模型的组合有非常明显的好处。
o3-mini 不支持且永远不会支持视觉功能。我们需要等待 OpenAI 未来的推理模型才能获得这个功能。
我发布了 LLM 0.21,新增了对该模型的支持,还有可调整推理强度的 -o reasoning_effort high(或 medium 或 low)选项——详情见这个 issue。
注意新模型目前仅对 Tier 3 及更高等级的用户开放,这要求你在 API 上花费至少 $100。
o3-mini 的定价为 $1.10/百万输入 token、$4.40/百万输出 token——不到 GPT-4o 定价的一半(目前为 $2.50/$10),远远便宜于 o1($15/$60)。不过 GPT-4o 的对比没有那么直接,因为 o3-mini 的隐藏推理 token 仍然算入你需要付费的输出 token 中。
我尝试用它来总结 Hacker News 上关于 o3-mini 的这段对话,使用了我的 hn-summary.sh 脚本。
hn-summary.sh 42890627 -o o3-mini
结果如下——它使用了 18,936 个输入 token 和 2,905 个输出 token,总成本为 3.3612 美分。
o3-mini(以及 o1-mini)是纯文本模型:它们不接受图像输入。完整的 o1 API 模型可以像 GPT-4o 一样接受图像。
另一个值得关注的特性是 o3-mini 的 token 输出限制——这是指它在一次运行中能够输出多少文本的度量。这是 100,000 token,相比之下 GPT-4o 是 16,000,而 DeepSeek R1 和 Claude 3.5 都只有 8,000。
隐藏的"推理 token"来自同一个预算池,所以很可能无法输出全部 100,000。
该模型接受最多 200,000 token 的输入,相比 GPT-4o 的 128,000 有所提升。
输出限制真正起作用的应用场景是人类语言翻译,其中输出长度有理由预期与输入长度相近。看 o3-mini 在这方面的表现会很有意思,特别是考虑到它的低价格。
更新:这是专业翻译 Tom Gally 在 Hacker News 上对此的精彩评论:
我刚做了一个测试,R1 和 o3-mini 在长文本的后半部分都变得更差。[...]
输出的初步对比表明,虽然 R1 似乎还不错,但 o3-mini 产生的写作风格更接近我在 prompt 中要求的——更流畅更自然的英文。但后来我注意到输出长度分别为:R1 5,855 字符,o3-mini 9,052 字符,我自己打磨的版本 11,021 字符。将三个翻译与原日文并排比较后,我发现 R1 在演讲的后半部分省略了整个段落,o3-mini 在后半部分也改成了奇怪的缩写风格(例如在名词短语之间用斜杠代替"and")。我一个月前用相同的 prompt 和文本运行的 ChatGPT、Claude 和 Gemini 的默认版本都没有这些问题。
OpenAI 对 Hugging Face 的意外网络攻击是发生过的科幻小说 - 2026 年 7 月 22 日
与 Claude Code 团队的 Cat 和 Thariq 的炉边谈话 - 2026 年 7 月 21 日
Kimi K3,以及我们仍能从鹈鹕基准测试中学到的东西 - 2026 年 7 月 16 日
这是 Simon Willison 发布于 2025 年 1 月 31 日的 OpenAI o3-mini,现已在 LLM 中提供。
下一篇:使用 pip 安装一个小于 100MB 的大语言模型
前一篇:为开源发布代码的一个自私的个人论证
以 $10/月赞助我,获取每月最重要 LLM 发展的精选电子邮件摘要。
付费给我发送得更少吧!