Reflection正式推出其首款开源权重模型Beam。这是一款专为编码、推理及智能体工作负载设计的稀疏混合专家(MoE)模型,拥有5010亿总参数和230亿激活参数。

Beam的性能得益于在预训练和强化学习(RL)上的巨额投入。模型在源自网络及专有许可数据集的23.8万亿高质量Token上进行了预训练,表现持平或优于现有同规模开源基础模型。在RL阶段,Reflection部署了10,500块NVIDIA GB300 GPU,历时四周生成了超过1亿次rollout。目前,Beam正处于最后的红队测试和评估阶段,用户可注册获取早期访问权限。公司计划于本月晚些时候正式发布模型权重、技术报告及开发者工具包。

模型性能与效率

Beam重点强化了编码和智能体能力。在相关任务上,其表现可与GLM 5.2等大型开源模型媲美,并接近Qwen 3.8-Max的水平。尽管Kimi K3等前沿模型在原始能力上仍占优势,但Beam的核心优势在于推理时的高效性。

在高级推理基准测试中,Beam取得了与GLM-5.2相当的成绩,但推理计算量减少了3-4倍。与Qwen 3.8-Max等超大参数模型相比,Beam通过更高的“智能密度”,以更低的成本提供强大的模型能力,适合企业级编码和智能体负载。

基准测试BeamInklingNemotron 3 UltraGLM 5.2GLM 5.3Kimi K3Qwen 3.8 MaxDeepSeek V4.1 Flash
DeepSWE v1.144.4NRNR44.061.068.051.074.2
SWE Bench Pro v2-Hard77.256.9NRNR84.388.2NRNR
SWE Bench Pro v165.554.346.462.1NRNR67.7NR
Terminal Bench v2.180.163.856.481.088.288.386.690.6
SWE Atlas Codebase QnA34.6NRNRNR61.068.0NRNR
SWEBench Multilingual78.0NR67.7NRNRNRNRNR
SWEBench Verified80.977.670.7NRNRNRNRNR

* 表格数据源自原文 "Agentic Coding/Terminal" 标签页内容,NR表示未报告

高算力强化学习与基础设施

Reflection将高算力强化学习作为Beam的核心扩展轴。此次RL训练使用了10,500块NVIDIA GB300 GPU,历时四周,最大上下文长度达256K Token,并使用了约13亿个沙箱进行训练和评分。这是迄今为止开源实验室进行的规模最大之一的RL运行,且能力随计算量增加持续提升,未见停滞。

为解决大规模异步策略梯度训练中的不稳定性,Reflection开发了新算法以应对策略陈旧性和数值不匹配问题,实现了即使在从一天前生成的交互中学习也能保持稳定。此外,通过可控的长度惩罚训练,Beam学会了在更少的推理步骤中有效解决问题,用户可通过“推理力度”参数灵活权衡响应长度与性能。

泛化能力与环境扩展

Beam的RL训练使其具备了跨领域泛化能力。尽管训练中未包含浏览任务,但模型在获得网络访问权限后,有机地学会了搜索、查询其他LLM及使用OCR API阅读文档。演示显示,Beam能处理从构建实时数据仪表板到创建交互式应用等广泛任务。

为支持前沿规模的RL,Reflection构建了包含近一百万个环境的池,并通过严格的迭代筛选确保任务质量与难度。基础设施方面,平台支持平均11万次并发rollout,具备完全异步执行、灵活计算分配、快速模型更新(中位数12秒)及对推理故障的高弹性(恢复时间中位数8分钟)等特性。

预训练与安全对齐

Beam在由6,144块NVIDIA GB300 NVL72 GPU组成的集群上,耗时不到四周完成端到端预训练。数据方面,模型在23.8万亿高质量Token上训练,其中约95%的原始互联网Token被过滤,同时保留了传统方法可能遗漏的1.8万亿高质量Token。

在安全与对齐方面,Reflection采用多教师在线蒸馏(MOPD)技术,结合大规模RL教师和安全对齐教师。安全原则分为三个层级:遵守安全政策、保持准确透明、以及高效直接的互动风格。通过对抗性迭代构建的数据集和模拟对手压力测试,模型在减少过度拒绝和有害顺从之间取得了平衡。公司计划开源其内部使用的安全评估标准,供社区共同完善。

Beam是Reflection开放智能系列的首个模型。本月晚些时候,公司将以Apache 2.0许可证发布权重及完整开发堆栈,并与分销合作伙伴及开源库集成,推动开发者生态的建设。