普林斯顿研究者提出 RLT 架构,用 48 层编码器+48 层解码器实现「无边界时序深度」,每个 Token 执行 96 个逻辑块,状态路径随 Token 数量线性增长,尚未发布代码和权重。
在大多数仅含 Decoder 的 LLM 中,token t 最后一层计算的任何内容都不会馈入 token t+1 的第一层;各位置之间仅通过 Attention 对缓存的 key 和 value 进行通信。普林斯顿研究者 Yifan Zhang 的技术报告——Recurrent Looped Transformer(RLT)——提出关闭这一环路。Decoder 的最终隐藏状态及其层-wise 滑动窗口注意力(SWA)缓存被携带到下一个 token,贯穿 prompt 和 response,全程在边界处不重置。该研究是一份设计规范文档,定义了架构、执行调度和 RL replay 契约,并明确声明未报告任何效率、推理质量或扩展性的实测结果。
Recurrent Looped Transformer(RLT)将因果 Encoder 与循环 Decoder 配对。Encoder 在因果掩码下并行处理 token,生成表示 $e_t$,并从中投影出 key-value 记忆 $M_{\le t}$;记忆组可在 Decoder 层间共享($G = 1$)或保持层间独立($G = L_D$)。
Decoder 承载循环。其完整状态为 $H_t = (s_t, C_t^D)$,其中 $s_t$ 是最终 Decoder 输出,$C_t^D$ 持有每层 Decoder 保留的 SWA key 和 value。对每个 token,门控合并将 $e_t$ 与前一输出 $s_{t-1}$ 组合,然后每个 Decoder block 对 Decoder 激活值执行因果 SWA、Cross-Attention 到 Encoder 记忆,以及 FFN。窗口 $W$ 包含当前 token,因此每层最多保留 $W - 1$ 条历史记录。下一 token 分布从 $s_t$ 读取,初始化在 BOS 前执行一次,使用学习到的起始状态 $s^*$ 和空缓存。
参考的权值绑定配置使用 48 个 Encoder 层和 48 个 Decoder 层,它们之间共享兼容的 Attention 和 FFN 权值。因此每个 token 执行 96 个逻辑 block,不过 Decoder block 额外增加了 Cross-Attention,所以各 block 的 FLOPs 不相等。Zhang 称此为参数复用,而非激活复制。
无界时间深度的潜在推理:处理 $t$ 个 token 后,从 $s_0$ 出发的状态路径穿越 $t \cdot L_D$ 个 Decoder block,在参考配置中为 $48t$。每 token 工作量保持不变,而路径的结构深度随序列增长。研究报告警告称门控和收缩可能抑制长路径;结构深度并非推理的保证。
模型-硬件协同设计:已知 token 的 Encoder 特征和记忆投影使用 token 并行核。Decoder 转换在序列内保持顺序,但来自独立序列的就绪更新可以共享一个批处理核。报告明确声明未对非线性 Decoder 假设并行扫描,未声明减少 prefill 的加速,且标准并行 SWA Decoder pass 不等价于该循环。批处理、核融合和检查点被列为实现目标,而非已完成的核。
模型-RL 算法协同设计:预训练、SFT、采样和 RL replay 共享同一状态转换。对于 RL,采样器在实际的采样分布(包括 temperature 和截断)下记录每个 action 的行为 log 概率。训练器在当前参数下从序列起始重建 Encoder 记忆、循环输出和每个 SWA 缓存,然后对每个 action 进行评分;旧的 rollout 状态从不复用。Proposition 3.1 形式化了收益:移动 prompt-response 分界点对固定 token 历史下的条件分布保持不变。
预训练是全序列下一 token 预测,并进行完整的时间反向传播。SFT 将 loss 掩码到 assistant 目标,但从不掩码状态更新,因此 assistant loss 通过 user 和 tool token 反向传播。附录 B 说明了部分 detach 的风险:状态到状态的 Jacobian 通过 Decoder KV 有交叉项,因此仅 detach $s_t$ 会留下经由缓存的梯度路径;任何截断 BPTT 方案必须命名每个 detach 的 tensor。
对于多轮服务,精确的 prefix 快照包括 Encoder 缓存和记忆、完整的 Decoder 状态、位置元数据、窗口约定和模型版本。固定权重快照可以复用,因为状态与服务分界无关;权值更新使旧状态失效,编辑 prefix 强制从更早的检查点重新计算。多轮 RL 中的外部 token 更新状态但不获得重要性比率因子。
Encoder 派生记忆沿袭自 YOCO(为 cross-decoder 缓存 KV 一次)和 DeepSeek-V4.1-Flash(从最终 Encoder 状态投影 Decoder 全局 KV);RLT 保留了记忆但放弃了 prompt 级 Decoder 跳过。时间反馈基于 Feedback Transformer 和 Recurrent Transformer;RLT 则将前一最终 Decoder 输出馈入下一 Decoder 输入,并在 prompt 上同样运行循环。Depth-wise 复用与 Universal Transformers 和循环深度潜在推理相关;replay 论证延伸了 Zhang 的 prefill-decode 核不匹配注记。
RLT 携带完整的 Decoder 状态(最终输出加上层-wise SWA 缓存)跨越每个 prompt 和 response token,无边界重置。
参考配置:48 个绑定的 Encoder 和 Decoder 层,每 token 96 个逻辑 block,$t$ 个 token 后的状态路径为 $48t$ 个 block。
硬件机会:跨序列的 Encoder 并行性和批处理;未声明并行扫描或减少 prefill 的加速。
RL replay 在当前参数下重建所有状态,同时将记录的 behavior log 概率作为比率的分母。
无实测结果:推理质量、效率和 RL 扩展性仍是待验证的开放目标。
查看技术报告、GitHub 仓库和项目页面。本项目所有荣誉归研究者所有。另请关注我们的 Twitter,别忘了加入我们的 15 万+ ML SubReddit 并订阅我们的通讯。等一下!你用 telegram 吗?现在你也可以加入我们了。
想与我们合作推广你的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会吗?联系我们。