
Vambo AI正式发布MORENA,这是一款拥有15亿参数的语言模型,专门针对非洲语言构建,涵盖尼日利亚皮钦语、伊博语、约鲁巴语、豪萨语、斯瓦希里语、齐切瓦语、祖鲁语、科萨语、卢旺达语、茨瓦纳语、南非荷兰语和恩德贝勒语等12种非洲语言,同时支持英语、法语及代码。
从零训练,性能超越主流大厂模型
与大多数基于Llama变体微调、受限于英文词表的项目不同,MORENA完全从零开始训练。开发者在预训练前即确定了分词器、数据混合比例和语言列表,并针对成本与效率优化了词表大小。
基准测试显示,MORENA在非洲语言建模和翻译任务上表现优异。其关键指标bits per byte (bpb) 达到1.408,在参与测试的26个模型中排名第一。相比之下,参数量为其五倍以上的最接近竞争对手得分仅为1.423 bpb。在12种测试语言中,MORENA在8种语言上击败了近期竞品Lugha-Llama-8B。
效率方面,MORENA处理非洲文本所需的Token数量显著少于主流模型。在相同文本段落中,其Token消耗量比Gemma 3少1.39倍,比Llama 3.2少1.53倍。尽管非洲文本每字节仍消耗0.249个Token(略高于英语的0.234),但其整体体积最多可缩小8倍。拥有120亿参数的Gemma系统算力消耗约为MORENA的11倍,但得分反而较弱。
经过聊天微调的指令版本得分为1.441 bpb,虽整体略逊于Lugha-Llama-8B,但在5种共享语言中处于领先地位,且参数量仅为后者的20%。在少样本翻译测试中,该模型在看到三个示例后,将英语翻译成五种非洲语言的chrF++分数达到45.8,统计水平上与专用翻译系统持平,远超同类规模通用模型(通常得分9-14)。
低成本构建多尺寸模型家族
MORENA的训练资源门槛相对较低。预训练阶段使用2517亿Token,中训练阶段使用630亿Token,累计消耗超过22,000小时的A100 GPU算力,相关计算资源价值约4万美元。该项目获得了联合国开发计划署(UNDP)、AIHub4SD和CINECA的计算资源及技术支持。
除15亿参数的主模型外,Vambo AI还推出了5亿和2亿参数的版本,以满足不同场景需求。其中,5亿参数变体在12种语言中的11种上超越了所有测试的外部系统。2亿参数的“纳米版”专为语音识别重评分、键盘应用和文本规范化设计,其每字节处理成本仅为Lugha-Llama-8B的1/58,在单张A100 GPU上每秒可生成104个Token。
此外,MORENA提供CPU兼容版本,支持在笔记本电脑上离线运行,适用于缺乏稳定GPU访问的环境。通过指令微调版本,该模型还可应用于对话系统及与其他AI工具的集成。