研究探索当大语言模型从未见过超越小学水平的材料时,其能力与世界观会发生何种变化。
与 LittleLearner 对话
在浏览器中运行的 5B 模型。如果下方聊天未能加载,请在新标签页中打开 ↗。
一个用于研究模型如何获取知识的可控沙箱
现代 LLM 在训练时使用所有数据同时进行训练,因此很难判断某个新技能是被学会了还是仅仅被引诱出来。我们从源头控制训练数据分布本身:一份 880 亿 token 的语料库,经过过滤仅包含美国小学课程内容,从零开始在之上训练模型,并配备了匹配的未过滤对照组。
一份 880 亿 token 的语料库,通过一个与 Common Core 标准(K-5)对齐的五阶段过滤管道从 FineWeb-Edu 精炼而来。明确排除了高于 5 年级教授的概念、事实和词汇。
三个规模(0.6B / 1.3B / 5B),从零开始在 LittleCurriculum 上训练:可对话的模型,拥有可解释的知识边界。每个模型都附带了匹配的 Unfiltered 对照组用于对比。
引诱,而非习得
在我们的实验中,Scaling、SFT+GRPO 后训练以及上下文学习都放大了课程所教授的内容,但没有一项能实质性改善范围之外的性能,这表明预训练过滤器设定了有效的能力上限。

三个规模的 LittleLearner(0.6B / 1.3B / 5B),每个都配有匹配的 Unfiltered 对照组,使用相同的架构、token 数量和训练配方。
Base:预训练模型。GRPO:在 MathCAMPS 上后训练的数学专精模型;响应可能表现出数学导向输出的倾向。Chatty:为通用对话行为调优的变体。
能力停留在课程范围内
标准干预措施能否将模型推过预训练数据所教授的内容?有了这一边界处于实验控制之下,我们可以干净利落地提出这个问题。在我们的实验中,每项干预都放大了范围内的能力;没有任何一项能实质性改善范围之外的性能。

Scaling模型规模可以提升模型在受控知识暴露范围内的表现,并适度扩展到同一学习轨迹上的问题,但在需要更高级的、暴露范围之外能力的问题上,几乎没有改善。
按年级划分的 MathCAMPS 准确率,不同模型规模
通过 GRPO 进行后训练显著提升了范围内的 K-5 能力,但无法恢复范围之外的 5 年级以上能力,即使使用范围外的数据进行训练。

上下文学习与我们测试的 prompt 并没有为我们的训练有素的 5B LittleLearner 解锁超出 K-5 的新推理能力。
按 prompt 条件划分的准确率
你会教它什么?
由于 LittleLearner 的训练暴露是明确指定的,行为和表征的变化可以直接与你引入的概念相关联。我们兴奋地关注三个方向:
RL 能创造能力吗?
先验被限制在 K-5,因此在 RL 下涌现的能力可以归因于 RL 过程本身。作为奖励驱动发现的一个可处理的代理。
观察一个概念被学习的过程
引入负数并测量样本效率、记忆保持和干扰。或者在边界附近探测行为:它会回答、弃权还是幻觉?
机器 vs 儿童学习者
指定的暴露使受控的人机对比成为可能。模型和儿童学习分数需要相似的暴露吗?还是在文字问题上有相似的错误?
带上你的问题
已知的边界把你的想法变成一个干净的实验!
如果你觉得这项工作有用
请引用我们的论文:
@misc{littlelearner2026,
title={LittleLearner: Language Models Under Pedagogically-Controlled Knowledge Exposure},
author={Fanfei Li and Jana Zeller and Manuel Prada-Corral and Thaddäus Wiedemer and Prasanna Mayilvahanan and Ryan Cotterell and Wieland Brendel},
year={2026},
eprint={2608.13545},
archivePrefix={arXiv},
primaryClass={cs.CL},
url={https://arxiv.org/abs/2608.13545}
}