501B稀疏专家模型,23B活跃参数,推理成本仅为GLM-5.2的1/3至1/4,10月开源Apache 2.0权重。
Reflection AI 推出了 Beam,这是其首款开放权重模型。Beam 是一个稀疏的混合专家(MoE)模型,总参数规模为 501B,每个 token 活跃参数为 23B,专为代码、推理和 Agent 工作负载构建。据 Reflection AI 团队称,Beam 在推理计算量减少 3 到 4 倍的情况下,直接与 GLM 5.2 等更大的开放模型竞争。
现在能部署吗?暂时还不行。Beam 正在进行最后的红队测试,早期访问通过 Reflection 平台的等待列表开放。
Beam 是 Reflection AI 从头训练的一个通用 Agent 模型,面向企业代码和 Agent 工作负载。Reflection 将 Beam 定位于推进西方开放权重模型的前沿。研发团队坦诚地承认差距——Kimi K3 在原始能力上仍处于领先地位,所以 Beam 的卖点是推理时的高效率。
用户可以调节一个「推理 effort」参数:低设置倾向于简短回答,高设置允许在困难任务上进行更长的推理。团队可以根据任务难度和计算预算来匹配推理投入。
Beam 在 23.8 万亿个 token 上进行了预训练,来源包括网页、公共数据集和专有授权数据集。Reflection 团队表示,其筛选流程过滤掉了约 95% 的原始互联网 token,同时也保留了大约 1.8 万亿个传统过滤器会丢弃的高质量 token。
架构上采用了局部注意力与全局注意力交错,辅以细粒度路由的专家模块。负载均衡基于 DeepSeek-V3 的无辅助损失均衡,并添加了专家偏置更新的余弦衰减。预训练结束时,最繁忙的专家负载仅为平均负载的 1.04 倍。在全部 52 层中,通过基于深度的缩放 SandwichNorm、注意力门控和 FP32 残差累积,残差范数保持在有界范围内。
预训练在 6,144 块 NVIDIA GB300 NVL72 GPU 上于不到 4 周内完成。末期良好率达到了 92.3%,期间有 9 次半自动回滚。中训练阶段将有效上下文扩展到了 100 万 token。
RL 是 Beam 的核心扩展方向。本次运行动用了 10,500 块 NVIDIA GB300 GPU,持续 4 周,生成了超过 1 亿个 rollout,最大 rollout 上下文为 256K token。训练和评分消耗了约 13 亿个沙盒环境,涵盖近 100 万个代码、Agent 和 STEM 场景。
Reflection 采用全异步策略梯度进行训练。每个 token 都带有产出它的策略版本标签。新算法即便在一天陈旧度、落后当前策略 107 个权重版本的情况下,仍能保持学习稳定。团队报告称,随着 RL 算力增加,没有出现 plateau。
基础设施数字值得关注。系统平均维持了 11 万个并发 rollout。新权重到达推理集群的中位时间约 12 秒。71 次推理事故均在训练未停止的情况下得到处理。
一个可控制的生成长度惩罚机制教会 Beam 用更少的 token 解决问题。在 RL 混合中没有加入浏览任务的情况下,浏览技能也有所提升,这表明在 Agent 领域之间存在正向迁移。
Reflection 从预训练检查点开始训练了一个独立的安全和对齐教师模型,并使用多教师 on-policy 蒸馏将其与 RL 教师合并。安全训练采用了 deliberative alignment,安全评估结果将在技术报告中公布。
在 SWE-bench Verified 上,Beam 得分为 80.9,Nemotron 3 Ultra 为 70.7。在 Terminal Bench v2.1 上,Beam 得分为 80.1,接近 GLM 5.2 的 81.0。DeepSeek V4.1 Flash(90.6)和 Kimi K3(88.3)在该项上领先。这些数据来自 Reflection 的表格,其中竞品分数来源于 Artificial Analysis 和 DataCurve。
| 特性 | Reflection Beam | GLM-5.2 | Nemotron 3 Ultra | DeepSeek V4.1 Flash | Kimi K3 |
|---|---|---|---|---|---|
| 开发商 | Reflection AI(美国) | Z.ai(中国) | NVIDIA(美国) | DeepSeek(中国) | Moonshot AI(中国) |
| 总参数 | 501B | ~753B | 550B | 552B backbone + 196B Engram | 2.8T |
| 活跃参数 | 23B | ~40B | 55B | 8B prefill / 16B decode | 104B |
| 上下文 | 1M(有效) | 1M | 最高 1M | 1M | 1M |
| 输入 | 文本 | 文本 | 文本 | 文本 | 文本 + 图片 |
| 许可证 | Apache 2.0(计划中) | MIT | OpenMDW-1.1 | MIT | Kimi K3 License |
| 权重 | 2026 年 10 月下旬 | 已开放 | 已开放 | 已开放 | 已开放 |
| Terminal Bench v2.1* | 80.1 | 81.0 | 56.4 | 90.6 | 88.3 |
| 来源 | Reflection | Hugging Face | NVIDIA | Hugging Face | Hugging Face |
*分数来自 Reflection Beam 公告中的表格,2026 年 10 月 5 日验证的规格。
Beam 是这组中总参数最小的模型,23B 的活跃参数低于 GLM-5.2、Nemotron 3 Ultra 和 Kimi K3。Apache 2.0 和 MIT 是标准的宽松许可证。Kimi K3 的定制许可证对超大规模产品有署名要求。
访问 Technical details 和 Early Access 了解更多。
Asif Razzaq 是 Marktechpost AI Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于将人工智能的潜力用于社会公益。他最新的事业是推出了一个人工智能媒体平台 Marktechpost,该平台以深度报道机器学习和深度学习新闻著称,兼顾技术深度与通俗易懂,吸引了广泛读者。该平台月浏览量超过 200 万次,彰显了其在上层受众中的受欢迎程度。