概览
Reflection 首款开放权重模型:501B 总参数、23B 激活的稀疏 MoE,主打编程与智能体任务的推理效率。 Beam 是 Reflection 于 2026 年 10 月 5 日发布的首款开放权重模型,为稀疏混合专家架构,总参数 5010 亿、每 token 激活 230 亿,专为编程、推理与智能体工作负载打造。预训练使用 23.8 万亿 token 的网页与授权专有数据;强化学习阶段在 10,500 块 NVIDIA GB300 上训练 4 周,生成超过 1 亿条 rollout,最长上下文 256K token,训练与评分共用约 13 亿个沙箱。 官方评测(与 GLM 5.2/5.3、Kimi K3、Qwen 3.8 Max、DeepSeek V4.1 Flash 等对比):SWE-Bench Verified 80.9%、SWE-Bench Multilingual 78.0%、SWE-Bench Pro v1 65.5%、Terminal-Bench v2.1 80.1%、GPQA Diamond 90.5%、AIME 2026 97.8%、HLE(无工具)36.2%、MCP Atlas 78.7%、BrowseComp(含上下文管理)77.4%。官方定位是「西方开放权重前沿」,在编程和智能体任务上可与 GLM 5.2 等更大的开放模型竞争、接近 Qwen 3.8-Max;Kimi K3 等在绝对能力上仍领先,Beam 的优势在推理效率,在高级推理基准上与 GLM-5.2 分数相当而推理算力少 3–4 倍。 可用状态:截至 2026-10-06 仍在做最终红队测试与评估,可在官网申请早期访问;权重、技术报告、模型卡与开发者资源官方称将于本月晚些时候发布。上下文长度、API 价格尚未公布,暂不填写。来源:https://reflection.ai/blog/introducing-beam (2026-10-06 核对)
- 模态
- 文本
- 许可说明
- 开源 · 开源(开放权重,官方称本月内发布权重)
能力
- 稀疏混合专家(MoE):总参数 5010 亿,每 token 激活 230 亿
- 预训练 23.8 万亿 token,强化学习阶段生成超过 1 亿条 rollout
- SWE-Bench Verified 80.9%,SWE-Bench Pro v1 65.5%,Terminal-Bench v2.1 80.1%(官方数据)
- GPQA Diamond 90.5%,AIME 2026 97.8%,MCP Atlas 78.7%(官方数据)
- 官方称推理任务得分接近 GLM 5.2,但推理算力少 3–4 倍
- 目前为早期访问,权重、技术报告与模型卡预计 2026 年 10 月内发布
