501B 总参数的 MoE 模型,仅 23B 激活即可输出,RL 规模化训练超 1 亿次 rollout,推理算力节省 3-4 倍,月底 Apache 2.0 开源。
Reflection AI 刚刚发布了 Beam,首个开源权重模型。标题数字是 5010 亿参数。开发者真正应该关注的是 230 亿。
架构:稀疏混合专家(MoE)模型,总参数 5010 亿,每个 token 活跃参数约 230 亿,专为编程、推理和 Agent 工作流构建。
预训练:23.8 万亿精挑细选的 token,在 GB300 NVL72 集群上不到四周完成训练。
大规模强化学习:10.5K 块 NVIDIA GB300 GPU 运行四周,超过 1 亿次 rollout,约 13 亿个沙盒环境,以及近百万个编程、Agent 和 STEM 环境。
上下文:中期训练将有效上下文扩展至 100 万 token。
许可证和时间:现已开放早期访问。Reflection 表示,本月晚些时候将发布权重、技术报告、模型卡和微调工具,采用 Apache 2.0 许可证。
预期:更大的开源模型意味着每次回答都要消耗更多硬件和更高账单。
实际:在 MoE 模型中,每个 token 只激活部分网络。Reflection 报告 Beam 在高级推理基准测试中得分与 GLM-5.2 相当,同时推理计算量减少约 3 到 4 倍,并表示在编程和 Agent 任务上接近 Qwen 3.8-Max。(这些是公司自测基准,在根据这些结果规划路线之前,最好等待独立评估。)
想象一家有 500 名专科医生的医院。你不会因为发烧就看全部 500 名医生。分诊台会把你转介给适合的两三位医生。员工总数告诉你医院有多少知识储备,实际在场的医生告诉你这次就诊花多少钱。MoE 也是如此:总参数是知识,活跃参数是账单。
"每 token 智能"是新的规格表。 Beam 有推理 effort 设置,训练时带有长度惩罚,因此你可以在答案深度和每次请求的 token 数量之间做权衡。这是 Agent 循环的直接成本杠杆。
RL 现在是扩展轴,不是收尾步骤。 Reflection 表示,能力随着更多 RL 计算投入持续提升,"没有出现 plateau 的迹象",而且即使浏览不在 RL 组合中,浏览能力也有所改善。
开源权重加上 Apache 2.0 改变了 build-vs-buy 的算法。 如果发布如承诺的那样,团队能从美国实验室获得一个许可友好、可自托管的编程和 Agent 模型——而目前大多数顶级开源模型都来自中国实验室。
如果你的工作流涉及编程 Agent 或大量 MCP,加入早期访问列表。
权重发布后,在你的代码库任务上对 Beam 做基准测试,而不仅仅看公开排行榜。
追踪每个任务成本,而不是每 token 成本。即使单价相近,能用更少 token 解决任务的模型才是赢家。
Reflection AI,"Introducing Beam: Reflection's 501B open-weight model"(2026 年 10 月 5 日):https://reflection.ai/blog/introducing-beam
SiliconANGLE,"Reflection AI debuts open-source Beam model with 501B parameters"(2026 年 10 月 5 日):https://siliconangle.com/2026/10/05/reflection-ai-debuts-open-source-beam-model-with-501b-parameters/
Wang et al.(DeepSeek-AI),"Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts"(Reflection 引用):https://arxiv.org/abs/2408.15664
上述基准测试 claims 均为 Reflection AI 自己报告的数据。