总部位于西雅图的艾伦人工智能研究所(Ai2)正式发布针对大型语言模型的训练框架 Olmo-core 3。该框架显著提升了混合专家(Mixture-of-Experts, MoE)大模型的训练效率,在保持计算效率的同时降低训练成本,助力 MoE 模型参数规模突破万亿级别。

与激活整个模型的密集型 AI 模型不同,MoE 模型在生成每个词元(token)时仅调用部分专家模块进行计算。尽管其总参数量庞大,但实际计算需求较低。然而,完整模型仍需驻留于 GPU 显存中,且专家间的网络通信协调会产生额外开销。Olmo-core 3 旨在弥合密集模型与 MoE 模型间的差距,支持将专家池从 8 个扩展至 128 个,同时保持每词元仅选择 4 个专家的策略。基于相同基础设施,大语言模型可扩展至超过一万亿参数。

基准测试:吞吐率提升约 2.7 倍

基准测试显示,在搭载 Nvidia B3000 GPU 的 470 亿参数模型上,Olmo-core 3 的词元处理速度达到每秒 52,000 个。相比之下,Nvidia 成熟的 Megatron-core 训练架构最高吞吐量约为每秒 19,400 个词元。这意味着新框架的吞吐性能提升了约 2.7 倍。

Ai2 发布的白皮书指出,新架构采用专家并行技术,将专家分布到多个 GPU 上,使每张显卡仅存储完整专家池的一部分。同时,它将模型层跨 GPU 组分割,减少单卡需保留的模型比例;并通过分布式优化器,将优化器状态分布在多个 GPU 上,而非在每个 GPU 上存储完整副本。随着模型规模扩大,这种设计有效降低了内存开销。

此外,Olmo-core 3 支持 MXFP8 数据格式,通过用更少比特表示数值,进一步减少计算量及 GPU 间的数据传输量。

Ai2 表示,推出这一高效训练架构是其愿景的一部分,旨在为研究人员提供构建和训练更大规模模型的工具,打破万亿参数 AI 模型仅由国家或企业级基础设施用户触及的局面。该框架还允许研究人员将 MoE 训练适配到不同硬件上,探索路由、并行性及系统组件,以构建新的生态系统。目前,该项目及相关系统已在 GitHub 向开发者和开源社区开放。