
Reflection正式推出其首款开源权重模型Beam。这是一款专为编码、推理及智能体工作负载设计的稀疏混合专家(MoE)模型,拥有5010亿总参数和230亿激活参数。
Beam的性能得益于在预训练和强化学习(RL)上的巨额投入。模型在源自网络及专有许可数据集的23.8万亿高质量Token上进行了预训练,表现持平或优于现有同规模开源基础模型。在RL阶段,Reflection部署了10,500块NVIDIA GB300 GPU,历时四周生成了超过1亿次rollout。目前,Beam正处于最后的红队测试和评估阶段,用户可注册获取早期访问权限。公司计划于本月晚些时候正式发布模型权重、技术报告及开发者工具包。
模型性能与效率
Beam重点强化了编码和智能体能力。在相关任务上,其表现可与GLM 5.2等大型开源模型媲美,并接近Qwen 3.8-Max的水平。尽管Kimi K3等前沿模型在原始能力上仍占优势,但Beam的核心优势在于推理时的高效性。
在高级推理基准测试中,Beam取得了与GLM-5.2相当的成绩,但推理计算量减少了3-4倍。与Qwen 3.8-Max等超大参数模型相比,Beam通过更高的“智能密度”,以更低的成本提供强大的模型能力,适合企业级编码和智能体负载。
| 基准测试 | Beam | Inkling | Nemotron 3 Ultra | GLM 5.2 | GLM 5.3 | Kimi K3 | Qwen 3.8 Max | DeepSeek V4.1 Flash |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 44.4 | NR | NR | 44.0 | 61.0 | 68.0 | 51.0 | 74.2 |
| SWE Bench Pro v2-Hard | 77.2 | 56.9 | NR | NR | 84.3 | 88.2 | NR | NR |
| SWE Bench Pro v1 | 65.5 | 54.3 | 46.4 | 62.1 | NR | NR | 67.7 | NR |
| Terminal Bench v2.1 | 80.1 | 63.8 | 56.4 | 81.0 | 88.2 | 88.3 | 86.6 | 90.6 |
| SWE Atlas Codebase QnA | 34.6 | NR | NR | NR | 61.0 | 68.0 | NR | NR |
| SWEBench Multilingual | 78.0 | NR | 67.7 | NR | NR | NR | NR | NR |
| SWEBench Verified | 80.9 | 77.6 | 70.7 | NR | NR | NR | NR | NR |
* 表格数据源自原文 "Agentic Coding/Terminal" 标签页内容,NR表示未报告
高算力强化学习与基础设施
Reflection将高算力强化学习作为Beam的核心扩展轴。此次RL训练使用了10,500块NVIDIA GB300 GPU,历时四周,最大上下文长度达256K Token,并使用了约13亿个沙箱进行训练和评分。这是迄今为止开源实验室进行的规模最大之一的RL运行,且能力随计算量增加持续提升,未见停滞。
为解决大规模异步策略梯度训练中的不稳定性,Reflection开发了新算法以应对策略陈旧性和数值不匹配问题,实现了即使在从一天前生成的交互中学习也能保持稳定。此外,通过可控的长度惩罚训练,Beam学会了在更少的推理步骤中有效解决问题,用户可通过“推理力度”参数灵活权衡响应长度与性能。
泛化能力与环境扩展
Beam的RL训练使其具备了跨领域泛化能力。尽管训练中未包含浏览任务,但模型在获得网络访问权限后,有机地学会了搜索、查询其他LLM及使用OCR API阅读文档。演示显示,Beam能处理从构建实时数据仪表板到创建交互式应用等广泛任务。
为支持前沿规模的RL,Reflection构建了包含近一百万个环境的池,并通过严格的迭代筛选确保任务质量与难度。基础设施方面,平台支持平均11万次并发rollout,具备完全异步执行、灵活计算分配、快速模型更新(中位数12秒)及对推理故障的高弹性(恢复时间中位数8分钟)等特性。
预训练与安全对齐
Beam在由6,144块NVIDIA GB300 NVL72 GPU组成的集群上,耗时不到四周完成端到端预训练。数据方面,模型在23.8万亿高质量Token上训练,其中约95%的原始互联网Token被过滤,同时保留了传统方法可能遗漏的1.8万亿高质量Token。
在安全与对齐方面,Reflection采用多教师在线蒸馏(MOPD)技术,结合大规模RL教师和安全对齐教师。安全原则分为三个层级:遵守安全政策、保持准确透明、以及高效直接的互动风格。通过对抗性迭代构建的数据集和模拟对手压力测试,模型在减少过度拒绝和有害顺从之间取得了平衡。公司计划开源其内部使用的安全评估标准,供社区共同完善。
Beam是Reflection开放智能系列的首个模型。本月晚些时候,公司将以Apache 2.0许可证发布权重及完整开发堆栈,并与分销合作伙伴及开源库集成,推动开发者生态的建设。