
Meta AI研究人员发布了首个统一大语言模型两大效率技术——循环回路权重共享与混合专家(MoE)稀疏路由的数学框架。这篇于9月30日上传至arXiv的论文提出“循环扩展定律”,其核心发现表明:在训练算力匹配的情况下,基于该定律构建的循环混合专家模型(LMoE),在推理基准测试中的表现可媲美参数量约为其两倍的常规MoE模型。
此前,结合循环与稀疏性的工程师缺乏原则性方法来决定循环次数、稀疏程度及预期性能。Meta AI团队提供的这套“配方”,旨在帮助从业者从每个存储参数中榨取最大推理性能,填补了扩展定律研究在这一新架构领域的空白。
统一两种效率范式
混合专家(MoE)通过仅激活少量“专家”子网络,实现了总参数量与活跃计算量的解耦,成为DeepSeek、Mixtral和GPT-4等主流模型的核心架构。而循环Transformer则通过重复应用同一组紧凑层,在不增加内存成本的前提下提升模型深度,Huginn和IQuest Research的Loopie系列已在此方向展开探索。
过往研究往往孤立看待这两种机制:MoE扩展定律忽略循环,循环研究忽略稀疏性。Meta AI的新框架首次将二者联合形式化,回答了“在给定算力预算下,应运行多少循环、设置何种稀疏度”的关键工程问题。
路由发散带来超加性增益
论文核心引入了“有界、稀疏条件递归映射”这一数学对象,量化循环带来的有效参数增益。关键在于“有界”特性:循环回报存在边际递减效应,框架能精确表征饱和点,避免算力浪费。
循环与稀疏性的结合产生了超加性(superadditive)效率增益,其机制源于“路由发散”。在MoE模块中,令牌根据当前表示被路由至特定专家。当同一模块在第二次循环中应用时,由于令牌表示已被转换,路由器会选择一组不同的专家。这意味着每次循环都是计算上独特的操作,而非冗余重复。相比之下,密集循环模型因缺乏这种差异性,无法产生同样的增益。
数据验证与行业印证
实验数据显示,仅使用稀疏性可使活跃参数效率提升约三倍;仅使用循环可使总参数效率提升约两倍,且在需要多步深思的推理任务中表现显著。组合使用并遵循循环扩展定律优化后,LMoE在匹配算力下的推理性能可达参数量两倍常规MoE的水平。例如,100亿参数的LMoE可实现200亿参数非循环MoE的基准分数,同时降低内存与服务成本。
此外,循环次数作为推理时可调节参数,允许单个模型针对不同难度查询动态调整计算深度,实现无需重新训练的测试时扩展。
这一方向正获得行业广泛验证。清华大学与字节跳动Seed团队的SMELT研究报告称,MoE循环Transformer可节省6.8%至18%算力;IQuest Research在生产环境部署的Loopie模型证实,在该规模下两个循环为计算最优解,与Meta的预测一致。
局限性与战略意义
尽管结果令人信服,但研究仍存在局限。万亿token的验证使用了专有数据,限制了与公开模型的直接比较;且底层拟合基于经验幂律,不同架构细节可能需要重新校准。此外,推理增益主要集中在强迭代推理任务,标准语言建模上的增益较为温和。
从历史视角看,正如Chinchilla定律重塑了密集Transformer的训练决策,循环扩展定律有望成为LMoE架构的基础设施。它为从业者在参数量、稀疏度和循环深度之间分配算力预算提供了原则性导航图,标志着AI效率优化进入了一个可预测、可权衡的新阶段。