前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9467
  • Mistral Large 4 公开预览:1万亿参数、月底开源
  • Google Gemini 免费版大幅缩限:Flash Lite 限免,Pro/Deep Think 需付费
  • 上线 LLM 功能不死机的工程检查清单
  • AI代理能识别工具失效但仍持续调用,核心问题在于判断与行为的断裂
  • 给Claude Code开发Mod插件:实现额度用量条与项目待办面板
  • LLM 访问控制与监控的实战避坑指南
  • 企业 RAG 实战:混合搜索与重排序的核心差异
  • 日本开发者给 Claude Code 的 Awwwards 级前端 prompt
  • Reflection发布Beam:非中国最强开源模型,编程推理对标GLM
  • Codex CLI vs Claude Code:相同任务实测成本公开
  • Google Docs原生支持Markdown,AI Agent协作成亮点
  • Meta、微软要求员工少用Claude节省成本
  • DeepSeek Harness:24 万 stars 的插件化 AI 工具链
  • 如何给AI编程助手提供正确上下文
  • 12GB显卡跑125B大模型:Strata引擎开源
  • AI 指令遵循失效的深层原因:语义理解≠可靠执行
  • ML 系统上线前的设计审计五问
  • 本地 AI Agent 组织化管理:带预算与汇报链的开源框架
  • LangGraph 替代指南:六大框架实际解决的不同痛点
  • llama-server 推测解码时 logprobs 为假值
  • Reflection AI 开源 Beam:23B 活跃参数的 MoE 编程模型
  • Agent CLI 真实故障:会话消失、幽灵项目、重复条目
  • 发版日 CI 暴露绿灯测试掩盖的五大问题
  • 退款重复处理:分布式事件幂等性实战分析
  • Vercel如何用AI自动化Inbound流程
  • Anthropic推出云端Cowork:AI推理全上云,本地只做文件访问
  • 自建 SearXNG 为 LLM Agent 省钱:缓存 + 限流 + 引文校验
  • GLM 5.3 登陆 Amazon Bedrock:753B 编程专家模型
  • 前端后端错误追踪关联实战:用 trace_id 串联浏览器异常与 API 失败
  • LoreConvo:为 AI 编程工具注入会话记忆,告别每次从零开始
  • DevFest 演讲实录:如何客观评估 AI 辅助开发体验
  • Together Link:一条命令让Claude Code用上Kimi K3、GLM 5.3等开源模型
  • PewDiePie用OpenAI数据微调本地模型反被封号
  • MCP协议存在Agent间恶意Prompt传播风险
  • 某MCP服务器启动前消耗18000 tokens:问题与解决方案
  • Reflection AI开源501B MoE模型Beam,专攻代码生成
  • Google展示生产级AI数据层实战:语义搜索+RAG+AlloyDB集成
  • Reflection AI发布Beam:主打企业AI工厂概念
  • Meta和微软削减Claude预算,转向自研AI工具
  • 笔记本即可运行的 AI 安全检测,效果逼近 350 亿参数模型
  • Reka 发布 Rho-1:统一处理文本/图像/视频/机器人控制的 19B 多模态模型
  • OpenAI在欧盟对ChatGPT和Codex启用文本水印
  • OpenAI文本水印欧盟强制落地,全球API用户可自主选择
  • Claude Code 登陆 AWS GovCloud,支持受监管工作负载
  • AWS SageMaker 为编程 Agent 上线 AI 推理优化技能
  • 团队引入 Agentic Coding 的实战方法论
  • 团队引入 Agentic Coding 的实战方法论
  • quota-audit:用 Claude Code 必看的额度消耗分析插件
  • quota-audit:Claude Code 额度消耗追踪插件
  • Cloudflare 发布 Clef 决策模型,实测对比 Jev
  • Claude Mythos 5.1 发布,整合 Lean 4 形式化证明编译器
  • 已加载 51 / 9467
9.0
重磅
AI SCORE
模型发布2026-10-06 11:34

Reflection AI 开源 Beam:23B 活跃参数的 MoE 编程模型

dev.to · AI#开源#MoE#AI编程
Editor brief · 编辑速览

501B 总参数的 MoE 模型,仅 23B 激活即可输出,RL 规模化训练超 1 亿次 rollout,推理算力节省 3-4 倍,月底 Apache 2.0 开源。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Reflection AI 刚刚发布了 Beam,首个开源权重模型。标题数字是 5010 亿参数。开发者真正应该关注的是 230 亿。

发布内容(2026 年 10 月 5 日)

架构:稀疏混合专家(MoE)模型,总参数 5010 亿,每个 token 活跃参数约 230 亿,专为编程、推理和 Agent 工作流构建。

预训练:23.8 万亿精挑细选的 token,在 GB300 NVL72 集群上不到四周完成训练。

大规模强化学习:10.5K 块 NVIDIA GB300 GPU 运行四周,超过 1 亿次 rollout,约 13 亿个沙盒环境,以及近百万个编程、Agent 和 STEM 环境。

上下文:中期训练将有效上下文扩展至 100 万 token。

许可证和时间:现已开放早期访问。Reflection 表示,本月晚些时候将发布权重、技术报告、模型卡和微调工具,采用 Apache 2.0 许可证。

预期 vs 实际

预期:更大的开源模型意味着每次回答都要消耗更多硬件和更高账单。

实际:在 MoE 模型中,每个 token 只激活部分网络。Reflection 报告 Beam 在高级推理基准测试中得分与 GLM-5.2 相当,同时推理计算量减少约 3 到 4 倍,并表示在编程和 Agent 任务上接近 Qwen 3.8-Max。(这些是公司自测基准,在根据这些结果规划路线之前,最好等待独立评估。)

一个直观类比

想象一家有 500 名专科医生的医院。你不会因为发烧就看全部 500 名医生。分诊台会把你转介给适合的两三位医生。员工总数告诉你医院有多少知识储备,实际在场的医生告诉你这次就诊花多少钱。MoE 也是如此:总参数是知识,活跃参数是账单。

作为开发者值得关注的三个点

"每 token 智能"是新的规格表。 Beam 有推理 effort 设置,训练时带有长度惩罚,因此你可以在答案深度和每次请求的 token 数量之间做权衡。这是 Agent 循环的直接成本杠杆。

RL 现在是扩展轴,不是收尾步骤。 Reflection 表示,能力随着更多 RL 计算投入持续提升,"没有出现 plateau 的迹象",而且即使浏览不在 RL 组合中,浏览能力也有所改善。

开源权重加上 Apache 2.0 改变了 build-vs-buy 的算法。 如果发布如承诺的那样,团队能从美国实验室获得一个许可友好、可自托管的编程和 Agent 模型——而目前大多数顶级开源模型都来自中国实验室。

我本月会做的事

如果你的工作流涉及编程 Agent 或大量 MCP,加入早期访问列表。

权重发布后,在你的代码库任务上对 Beam 做基准测试,而不仅仅看公开排行榜。

追踪每个任务成本,而不是每 token 成本。即使单价相近,能用更少 token 解决任务的模型才是赢家。

Reflection AI,"Introducing Beam: Reflection's 501B open-weight model"(2026 年 10 月 5 日):https://reflection.ai/blog/introducing-beam

SiliconANGLE,"Reflection AI debuts open-source Beam model with 501B parameters"(2026 年 10 月 5 日):https://siliconangle.com/2026/10/05/reflection-ai-debuts-open-source-beam-model-with-501b-parameters/

Wang et al.(DeepSeek-AI),"Auxiliary-Loss-Free Load Balancing Strategy for Mixture-of-Experts"(Reflection 引用):https://arxiv.org/abs/2408.15664

上述基准测试 claims 均为 Reflection AI 自己报告的数据。

Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
llama-server 推测解码时 logprobs 为假值
下一篇
Agent CLI 真实故障:会话消失、幽灵项目、重复条目