昇腾通过统一注意力语义、规约顺序、Softmax 分块和关键路径精度,使 Qwen3-30B MoE 测试达到 logdiff=0。配合 FA 算子优化,Eager 模式性能提升 20%-60%,相关实现已经开源。
IT之家 8 月 6 日消息,强化学习已成为大模型训练的主流范式,推动模型技术在行业核心场景中实现工程化落地。其中,训推一致性至关重要。由于推理与训练过程相互耦合,基础设施差异很容易放大不确定性。
华为计算官方 8 月 5 日宣布,昇腾基于 Ascend C 编程语言提供了完整的训推一致算子集。在 Qwen3-30B MoE 模型上的测试中实现 Logdiff 为 0,并通过昇腾亲和的 FA 算子优化,在 Eager 模式下获得 20%~60% 的性能收益,为开发者提供高效、可靠的强化学习训练方案。
RL 后训练中训推不一致最根本的原因,是底层计算时累加不保序。若要自上而下保证训练引擎与推理引擎的每一次累加顺序一致,需要框架侧与算子侧同时发力。
模型参数越大,问题还会被进一步放大:张量并行、专家并行等切分策略,以及集合通信路径,任何一个环节没有对齐,都无法最终实现 true-on-policy。算子还需要覆盖多种调用场景,在关键计算步骤上施加约束,同时将性能损失控制在可用范围内——这是一项系统性的工程挑战。
训推不一致,指的是 Rollout(推理)引擎与训练引擎之间存在数值不一致。即使两者使用完全相同的模型权重,对相同 Token 序列计算得到的对数概率(logprob)也可能存在细微差异;这种差异通常使用 logdiff 衡量。

昇腾基于 Ascend C 编程语言,对训推链路中的关键算子进行了系统性约束与对齐。其核心思路是:让训练与推理在“该累加的地方”采用同一套数值路径,主要涉及以下 4 项修改:
统一注意力语义:对齐训练掩码 Softmax 与推理逐步注意力在有效位置上的计算范围,消除因可见 Token 集合不同带来的数值差异。
统一注意力语义:对齐训练掩码 Softmax 与推理逐步注意力在有效位置上的计算范围,消除因可见 Token 集合不同带来的数值差异。
锁定 reduce 累加顺序:约束训练 FA、推理 PFA / PagedAttention 在规约维度上的切分与归约顺序,避免“同模板、不同切分”导致累加不保序。
锁定 reduce 累加顺序:约束训练 FA、推理 PFA / PagedAttention 在规约维度上的切分与归约顺序,避免“同模板、不同切分”导致累加不保序。
对齐在线 Softmax 分块策略:统一分块大小与归约节奏,避免 decoder 侧多块合并 Softmax 与训练侧分块 Softmax 不一致。
对齐在线 Softmax 分块策略:统一分块大小与归约节奏,避免 decoder 侧多块合并 Softmax 与训练侧分块 Softmax 不一致。
对齐关键路径精度:在 Softmax 累加等敏感步骤中统一精度转换策略,减少混合精度实现差异引入的尾数误差。
对齐关键路径精度:在 Softmax 累加等敏感步骤中统一精度转换策略,减少混合精度实现差异引入的尾数误差。

在此基础上,再配合 FA 下发与调度优化,使训推一致不再以显著的性能回退为代价,从而在实测中同时实现 logdiff=0 与端到端加速。
华为宣布,相关基础设施已经开源,后续还将上线“训推一致问题识别 Skill”,支持排查残余 logdiff,并定位问题来自算子路径还是框架实现差异。
https://github.com/verl-project/verl-ascend-recipe/tree/main/true_on_policy
广告声明:文内包含的对外跳转链接,包括但不限于超链接、二维码、口令等形式,用于传递更多信息、节省甄选时间,结果仅供参考。IT之家包含外链的文章均包含本声明。
软媒旗下网站:IT之家、最会买-返利返现优惠券、iPhone之家、Win7之家、Win10之家、Win11之家。
软媒旗下软件:软媒手机 APP 应用、魔方、最会买、要知。