通过调整残差缩放指数(α=√(2N),β=1/√(8N)),Transformer块可重复执行以成倍增加展开深度,同时保证一阶扰动稳定性,无需门控或辅助损失。
当前的 Transformer 流程在层层内存触及硬件上限时就会停滞,迫使工程师在模型深度和批量大小之间做取舍。一条简单的残差缩放规则如今让一个紧凑的计算块可以被重复执行,在不增加任何 token 级存储的情况下,有效翻倍了展开深度。
在 DeepLoop 之前,向 Transformer 添加循环传递需要临时的门控机制、学习的缩放因子,或借助辅助损失来防止梯度爆炸,而且大多数实现中 KV 缓存仍然随深度线性增长。因此业界将循环执行视为一种不稳定的旁门左道,而非生产级技术。
DeepLoop 随着循环次数的增加,将残差指数从 ¼ 提升到 ½,对于展开深度 N 设置 α = (2N)^{1/2} 且 β = (8N)^{-1/2},从数学上保证了一阶扰动稳定性,即便参数被反复访问。"DeepLoop 不引入任何门控、学习得到的残差系数、辅助损失或架构特定的调优常数。"[1] 在经验层面,当不重复访问任何块时该方法表现中性,而在 GPT-2 small 和 medium 规模上,随着循环次数增加,最终验证损失持续改善。
该论文的评估止步于 GPT-2 规模模型,留下了同一缩放规律是否适用于数十亿参数模型族或在混合精度流程下的问题。其稳定性分析针对访问对齐系数 κ_R 假设了一个保守的对齐 regime,因此具有高度相关性 token 模式的真实工作负载可能仍会出现梯度尖峰。此外,报告的收益聚焦于验证损失,下游延迟和 KV 缓存嫁接开销并未被量化。
如果这条缩放规则真的能将深度与内存解耦,开发者就能通过循环一个小型物理栈,在现有 GPU 上获得更深的模型容量,改写"更大即更好"的硬件升级叙事。以循环配置重新运行标准语言模型基准测试,如今应该成为任何新部署的基线合理性检查。
DeepLoop: Depth Scaling for Looped Transformers