揭秘GPT-OSS模型的训练数据真相
深度分析OpenAI新开源模型的训练数据来源和特点,帮助理解模型能力边界。
深度分析OpenAI新开源模型的训练数据来源和特点,帮助理解模型能力边界。
Jack Morris(@jxmnop)
对 OpenAI 新推出的 gpt-oss 模型使用了哪些训练数据感到好奇?我也一样。
于是,我用 gpt-oss-20b 生成了 1000 万个样本,并做了一些分析。结果……相当诡异。
是时候深入研究一番了 🧵
2025 年 8 月 8 日晚上 7:21
100 万次浏览 · 120 · 488 · 5500 · 4000
这是模型生成内容经过 embedding 后的分布图。
这个模型非常偏爱数学和代码。即使我的 prompt 里什么都没有,它也总是在推理。它只顾着讨论数学和代码,而且大部分使用英语。
数学——概率论、ML、PDE、拓扑学、微分方程
代码——Agentic 软件、竞赛编程……
展开
192 · 31 · 1100 · 12000
首先值得注意的是,几乎没有任何生成内容像自然的 Web 文本。但令人意外的是,它们看起来也完全不像正常的聊天机器人交互。
这个模型显然是通过 RL 训练的,目标是进行思考,并解决特定推理 benchmark 中的任务。除此之外,什么都没有。
429 · 1100 · 102000
而且,它确实是一个饱受折磨的模型。
在这个例子里,模型 hallucinate 出了一道关于多米诺骨牌的编程题,并试图解答它,整个过程耗费了超过 30000 个 token。
在完全没有 prompt 的情况下,模型自行生成并尝试解决这道多米诺骨牌题,前后超过 5000 次。
154 · 1100 · 114000
从这张图里看不出来的是,许多思维链一开始使用英语,随后却逐渐滑入「神经网络语」。
这些推理链会自如地在阿拉伯语、俄语、泰语、韩语、中文和乌克兰语之间来回切换。然后通常又会回到英语——但也不总是如此。
121 · 568 · 179000
OCR 猜想:有些样本包含 OCRV ROOT 之类的痕迹,这表明训练数据可能一直在「阅读字里行间」:OpenAI 正在扫描书籍。
(不知道为什么,这个模型特别喜欢提起马来西亚生活着多少聋人。)
796 · 286 · 68000
持续发生 codeswitching,可能有哪些解释?
685 · 916 · 62000
大量输出中也夹杂着少量创意内容。
这里有一个例子:模型开始为一部挪威电影写小品式剧本 🤷♂️
263 · 535 · 57000
我也从这个例子里学到了很多。
这个模型使用 Unicode 的能力真的非常强……
但它的物理可能不太行。这个世界上到底什么是「superhalo function」?
543 · 565 · 51000
如果你想试试这份数据,链接在这里。它已经放到了 Hugging Face:
huggingface.co/datasets/jxm/g…
如果你发现了什么,请告诉我!
410 · 512 · 67000
尽管我改变了随机种子,也使用了 temperature,但大量输出仍然高度重复。
谨慎起见,应该对数据进行去重。我猜这里真正基本唯一的样本可能只有 10 万个,甚至更少。
413 · 244 · 48000
@ZhongRuiqi 在用自然语言描述两个文本分布之间差异的方法方面,做了一些令人惊叹的工作。
我们可以比较 20b 与 120b 模型的输出,也可以将它与 LLAMA 或 GPT-5 进行比较……
82 · 303 · 46000
我们正在研究如何使用 RL 等方法,直接从模型中提取训练数据。
我们将在 COLM 上展示这方面的第一项工作,也期待看到这个领域出现更多成果。
也许有一天,我们能够直接从 120b 模型中提取数据……😎
147 · 385 · 44000
Jeffrey Emanuel(@doodlestein)
这听起来就像某种噩梦般的高烧幻觉:一个聪明的年轻人,被迫无休止地训练数学竞赛题,生活中的其他一切都被彻底排除在外。
他还被要求把 Pólya 的《How to Solve It》当作献给组合数学诸神的教义问答,不断背诵。
431 · 63 · 24000
加入对话
再查看 118 条回复