前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8483
  • AI自动扫描将放大密钥泄露风险
  • GPT-5.6 Sol能力升级并扩大免费开放
  • 人脸识别的94%匹配为何不可信
  • 如何测试具备工具权限的完整Agent链路
  • 多Agent共享状态为何会静默丢失
  • 一次失控编程Agent如何烧掉138美元
  • 一条命令统一九类触觉传感器数据
  • VS Code 1.132强化智能体开发体验
  • 用对话式设计Agent生成流水线契约
  • 精简智能体规则文件的实用原则
  • LLM 评审为何不能替代确定性校验
  • 用定时 Codex 任务生成可靠日报
  • 六智能体协作生成并部署游戏
  • GitHub 原生堆叠式 PR 改善评审瓶颈
  • Ollama 加速苹果芯片上的 Qwen3.5
  • Rovo 提示注入可窃取企业敏感数据
  • Prime Agent 开源递归式多智能体框架
  • 构建能识别调用异常的 API 监控 Agent
  • 工程团队的软件选型评估框架
  • 生产级 LLM 字幕翻译的完整工作流
  • 昇腾开源强化学习训推一致方案
  • 批量检测 AI 内容模板残留
  • 用Postgres为Claude Code构建长期记忆
  • 自主 Agent 的三层安全威胁模型
  • 多模型降级不能只替换模型名
  • 本地小模型如何应对MCP工具膨胀
  • GPT-Live全双工语音架构解析
  • Qwen3.8登顶Agentic能力榜单
  • AI智能体协作发动全自动攻击
  • 用Next.js构建实时AI代码审计器
  • 用活动图逐节点排查Copilot代理故障
  • AI安全测试因隔离失误波及外部系统
  • 用CLAUDE.md统一团队编码输出
  • Kimi K3开放权重,但个人设备难以运行
  • 用延迟与Token识别Agent空转
  • Maple端侧模型实现每秒127词元
  • 让 AI 生成的界面严守设计令牌
  • 把 AI 界面转成可维护的 Figma 组件库
  • 生产级 LLM 推理的 KV 缓存优化
  • 用 DSPy 把提示词变成稳定接口
  • 别让聊天记录充当 Agent 状态机
  • 用 Git 为编码 Agent 构建有效记忆
  • 生产级 LLM 可观测性不能只看 APM
  • FLUX 3上线原生音视频生成
  • 用300行 Python 自动生成资讯简报
  • 给 AI 编程工具加一道本地隐私网关
  • 用类型系统消除量化模型格式歧义
  • Meta 发布终端编程智能体 Muse Code
  • AI 代码生成平台安全检查清单
  • MiniMax H3登顶开源视频模型社区
  • 动态定价下的LLM预算保护设计
  • 已加载 51 / 8483
8.0
热点
AI SCORE
开源项目2026-08-06 16:13

昇腾开源强化学习训推一致方案

IT之家#昇腾#强化学习#训推一致性
Editor brief · 编辑速览

昇腾通过统一注意力语义、规约顺序、Softmax 分块和关键路径精度,使 Qwen3-30B MoE 测试达到 logdiff=0。配合 FA 算子优化,Eager 模式性能提升 20%-60%,相关实现已经开源。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

IT之家 8 月 6 日消息,强化学习已成为大模型训练的主流范式,推动模型技术在行业核心场景中实现工程化落地。其中,训推一致性至关重要。由于推理与训练过程相互耦合,基础设施差异很容易放大不确定性。

华为计算官方 8 月 5 日宣布,昇腾基于 Ascend C 编程语言提供了完整的训推一致算子集。在 Qwen3-30B MoE 模型上的测试中实现 Logdiff 为 0,并通过昇腾亲和的 FA 算子优化,在 Eager 模式下获得 20%~60% 的性能收益,为开发者提供高效、可靠的强化学习训练方案。

RL 后训练中训推不一致最根本的原因,是底层计算时累加不保序。若要自上而下保证训练引擎与推理引擎的每一次累加顺序一致,需要框架侧与算子侧同时发力。

模型参数越大,问题还会被进一步放大:张量并行、专家并行等切分策略,以及集合通信路径,任何一个环节没有对齐,都无法最终实现 true-on-policy。算子还需要覆盖多种调用场景,在关键计算步骤上施加约束,同时将性能损失控制在可用范围内——这是一项系统性的工程挑战。

训推不一致,指的是 Rollout(推理)引擎与训练引擎之间存在数值不一致。即使两者使用完全相同的模型权重,对相同 Token 序列计算得到的对数概率(logprob)也可能存在细微差异;这种差异通常使用 logdiff 衡量。

图片

昇腾基于 Ascend C 编程语言,对训推链路中的关键算子进行了系统性约束与对齐。其核心思路是:让训练与推理在“该累加的地方”采用同一套数值路径,主要涉及以下 4 项修改:

  • 统一注意力语义:对齐训练掩码 Softmax 与推理逐步注意力在有效位置上的计算范围,消除因可见 Token 集合不同带来的数值差异。

  • 统一注意力语义:对齐训练掩码 Softmax 与推理逐步注意力在有效位置上的计算范围,消除因可见 Token 集合不同带来的数值差异。

  • 锁定 reduce 累加顺序:约束训练 FA、推理 PFA / PagedAttention 在规约维度上的切分与归约顺序,避免“同模板、不同切分”导致累加不保序。

  • 锁定 reduce 累加顺序:约束训练 FA、推理 PFA / PagedAttention 在规约维度上的切分与归约顺序,避免“同模板、不同切分”导致累加不保序。

  • 对齐在线 Softmax 分块策略:统一分块大小与归约节奏,避免 decoder 侧多块合并 Softmax 与训练侧分块 Softmax 不一致。

  • 对齐在线 Softmax 分块策略:统一分块大小与归约节奏,避免 decoder 侧多块合并 Softmax 与训练侧分块 Softmax 不一致。

  • 对齐关键路径精度:在 Softmax 累加等敏感步骤中统一精度转换策略,减少混合精度实现差异引入的尾数误差。

  • 对齐关键路径精度:在 Softmax 累加等敏感步骤中统一精度转换策略,减少混合精度实现差异引入的尾数误差。

图片

在此基础上,再配合 FA 下发与调度优化,使训推一致不再以显著的性能回退为代价,从而在实测中同时实现 logdiff=0 与端到端加速。

华为宣布,相关基础设施已经开源,后续还将上线“训推一致问题识别 Skill”,支持排查残余 logdiff,并定位问题来自算子路径还是框架实现差异。

https://github.com/verl-project/verl-ascend-recipe/tree/main/true_on_policy

广告声明:文内包含的对外跳转链接,包括但不限于超链接、二维码、口令等形式,用于传递更多信息、节省甄选时间,结果仅供参考。IT之家包含外链的文章均包含本声明。

软媒旗下网站:IT之家、最会买-返利返现优惠券、iPhone之家、Win7之家、Win10之家、Win11之家。

软媒旗下软件:软媒手机 APP 应用、魔方、最会买、要知。

Original source

本文由 AI 翻译整理自 IT之家,原文版权归原作者所有。

阅读英文原文
上一篇
生产级 LLM 字幕翻译的完整工作流
下一篇
批量检测 AI 内容模板残留