解释测试时训练(test-time training)机制——模型在回答当前问题时更新自身权重,以 GPS 学路况类比,剖析长上下文与高并发的工程权衡。
你用过的每一个模型,在训练结束的那一刻就冻结了。即便你每天都在使用它,答案也始终如一。
如果模型在使用过程中持续学习呢?
GPS 会学习一条绕过每天北向 101 号公路交通的持久捷径,而不是一次性的重新规划路线。Test-time training 对模型做的事情正是如此。当你使用 AI 时,模型会改变它的权重,改变它对记忆的思考方式,从而更好地回答你的问题。
这些改变比在高速公路堵点之后找到一个出口并驶入辅道要深刻得多。
内存需求暴跌。标准 transformer 维护一个 KV-cache,即所有先前 token 的运行记录,因此它的内存随上下文线性增长,每个额外的 token 都会添加到运行记录中。Test-time training 将这段历史压缩成一组固定大小的权重,而不是不断增长的缓存,因此无论对话运行多长,内存都保持平坦。
模型提供商现在必须为每个人单独服务一个模型。一旦模型在你的 prompt 上更新,它就不再是回答过你邻居问题的那一个模型了,因此服务于数百万用户的单个检查点变成了数百万个略有不同的模型,每个模型都由使用它的人塑造。这种分歧是提供商需要解决的问题:GPU 提供商需要在飞行中为每个用户保存一个副本,而不是为所有人共享一个副本,这意味着更多的计算量和更多的芯片来服务相同数量的人。
它快得多。斯坦福对小模型的研究表明,它可能快 2.7 倍,因为 test-time 训练模型的推理延迟保持恒定,无论上下文运行多长,而标准 transformer 则不然。In-Place TTT 也可以直接替换,使一个 4b 模型在无需重新训练的情况下达到具有竞争力的 128k 上下文性能。
这里存在一种张力。标准 AI 受内存限制,test-time AI 受计算量和芯片限制,因此提供商根据是服务长上下文还是服务更多人来做出选择。
只有当个性化能够带来足够价值时,这种成本才值得付出。一个学习你代码库约定的 coding agent,那些反复出现的持久性 bug,最终应该通过内存提供某种形式的锁定,因此每个用户的成本是值得的。一次性的客户支持问题不需要这些。共享的、冻结的、可能经过微调的模型回答它同样好,但提供商的服务成本要低得多。
Test-time training 将成为 2026 年底及以后话语的关键部分。它有潜力改变当前 AI 的经济学。
Sun et al., Learning to (Learn at Test Time): RNNs with Expressive Hidden States ↩︎
Sun et al., Learning to (Learn at Test Time): RNNs with Expressive Hidden States ↩︎
End-to-End Test-Time Training for Long Context ↩︎
End-to-End Test-Time Training for Long Context ↩︎
In-Place Test-Time Training ↩︎
In-Place Test-Time Training ↩︎