目前结论
Reflection AI 于 2026 年 10 月 5 日发布其首个前沿开源权重模型 Beam,这是一个总参数 5010 亿、激活参数 230 亿的稀疏 MoE 模型,面向编程、推理和智能体任务。新报道显示,Reflection 自行公布的基准测试中 Beam 在 DeepSWE 上得分 44.4,接近 GLM-5.2 但落后于最新的中国头部开源模型。Beam 仍在最后安全测试阶段,仅少量用户可提前使用;完整权重、技术报告和模型卡计划 2026 年 10 月晚些时候以 Apache 2.0 协议发布。训练使用 6144 块 GB300 预训练不到 4 周处理 23.8 万亿 token,再用 1.05 万块 GB300 进行 4 周强化学习,生成超过 1 亿条训练轨迹。
进展时间线
2 次实质进展- #01
Reflection 推出 Beam:一款以更低算力成本对标中国模型的开源权重 AI 模型
2026 年 10 月 5 日(周一),Reflection AI 发布了其首个前沿开源权重模型 Beam。据该公司博客介绍,Beam 是一个稀疏混合专家(MoE)模型,总参数 5010 亿、激活参数 230 亿,面向编程、推理与智能体(agentic)任务。 此次发布使一家美国实验室在编程及相关任务上,直接与 DeepSeek、月之暗面 Kimi 等低成本中国开源权重模型展开竞争,而这一领域此前由中国模型的成本水平树立标杆。 Reflection 由英伟达(Nvidia)投资,并以“AI 工厂”(AI factories)产品向企业和主权国家推销 Beam 及后续模型,允许机构用自有专有数据训练这些模型。目前公开报道中未包含独立的基准测试结果或授权条款。
来源依据:TechCrunch AI
- #02
Reflection终于交卷:501B模型Beam亮相,仍落后最新中国头部开源模型
新报道补充了 Reflection 自行公布的基准测试结果,显示 Beam 在 DeepSWE 上得分 44.4,接近 GLM-5.2(44.0),但落后于 Qwen 3.8-Max、GLM-5.3、Kimi K3 和 DeepSeek V4.1 Flash。训练方面,预训练使用 6144 块 GB300,不到 4 周处理 23.8 万亿 token;随后用 1.05 万块 GB300 进行 4 周强化学习,生成超过 1 亿条训练轨迹。Beam 仍在最后安全测试阶段,仅少量用户可提前使用;完整权重、技术报告和模型卡计划本月晚些时候以 Apache 2.0 协议发布。
此后状态:Reflection AI 于 2026 年 10 月 5 日发布其首个前沿开源权重模型 Beam,这是一个总参数 5010 亿、激活参数 230 亿的稀疏 MoE 模型,面向编程、推理和智能体任务。新报道显示,Reflection 自行公布的基准测试中 Beam 在 DeepSWE 上得分 44.4,接近 GLM-5.2 但落后于最新的中国头部开源模型。Beam 仍在最后安全测试阶段,仅少量用户可提前使用;完整权重、技术报告和模型卡计划 2026 年 10 月晚些时候以 Apache 2.0 协议发布。训练使用 6144 块 GB300 预训练不到 4 周处理 23.8 万亿 token,再用 1.05 万块 GB300 进行 4 周强化学习,生成超过 1 亿条训练轨迹。
来源依据:theblockbeats