Reflection AI 宣布了 Beam。这款用于编程和智能体(agent)工作的模型拥有 5010 亿参数,但开发者目前还无法检查或运行其权重。

这家加州 AI 公司将 Beam 描述为稀疏混合专家模型:它存储 5010 亿参数,每个 token 只激活 230 亿。抢先体验需要注册,权重、许可证、模型卡、技术报告和开发者工具仍未提供。

对选择开放模型的开发者来说,这一区别很重要。开放权重模型可以在私有工作负载上测试、修改和部署,无需依赖厂商服务;公告和基准测试表目前还无法支持这些检查。

Reflection 称,它用 23.8 万亿 token 训练 Beam,随后在 10,500 张英伟达(NVIDIA)GB300 GPU 上运行了超过 1 亿次强化学习轨迹采样,持续四周。这些数字描述了一次规模异常庞大的训练,但公司尚未发布检查数据构成或评测设置所需的技术报告。

实验室自己的表格给出 Beam 在 SWE-bench Verified 上 80.9、在 Terminal-Bench 2.1 上 80.1 的得分。表格还显示,在大多数列出的测试中,Beam 落后于 Kimi K3、GLM-5.3 和 Qwen 3.8-Max。Reflection 主要比较的是效率:按自己估算的浮点运算量,公司称 Beam 以少三到四倍的推理(inference)计算量,达到与 GLM-5.2 相当的结果。

对于付费运行长时间智能体会话的团队,这一说法可能比基准测试上的小幅领先更重要。稀疏激活减少每个 token 所用的计算量,但完整模型仍需要足够的内存和基础设施,以存储和运行数千亿参数。

Reflection 称,Beam 正在接受最终安全测试。公司计划在 2026年10月晚些时候发布权重、技术报告、模型卡和开发者资源,尚未给出具体发布日期。

核实

说法标签一手来源独立核实
Reflection 宣布 Beam 并开放抢先体验注册已核实Reflection 公告公司行动无需另行核实
Beam 拥有 5010 亿总参数,每个 token 激活 230 亿参数据公司称Reflection 公告无;权重和报告尚未提供
训练使用 23.8 万亿 token,并在 10,500 张 GB300 GPU 上运行超过 1 亿次强化学习轨迹采样,持续四周据公司称Reflection 公告无
Beam 在 SWE-bench Verified 上得分 80.9,在 Terminal-Bench 2.1 上得分 80.1据公司称Reflection 公告无
Reflection 估计,Beam 用少 3–4 倍的推理计算量达到与 GLM-5.2 相当的结果据公司称Reflection 公告无
承诺在 2026年10月晚些时候发布权重、报告、模型卡和开发者资源已核实Reflection 公告所述时间安排无需另行核实