
法国AI初创公司Mistral本周正式发布拥有万亿参数的混合专家模型Large 4(简称ML4),宣称其推动了开放权重模型的性能前沿。独立基准测试机构Artificial Analysis(AA)数据显示,ML4在智能指数中得分38分,被评为“美国和中国之外最智能的模型”。然而,包括小米MiMo-V2.6-Pro、智谱GLM-5.3系列及月之暗面Kimi K3在内的至少五款中国开源模型在该指数上得分更高,最高达46分。
性能与成本:网安特长明显,综合性价比待考
尽管在综合智能指数上略逊于头部中国开源模型,ML4在特定领域表现出显著优势。在AA的CyberGym-E2E-AA端到端网络安全指标中,ML4取得了81.7%的高分,被Mistral称为“所有模型中最高”,并击败了OpenAI的GPT-6 Luna(max)。相比之下,得分较高的GLM-5.3-Flash在该项得分为74%。不过,ML4在Cyber Index的另外两项测试DeepsecBench-AA(16%)和CWE-Bench-AA(51%)中表现平平,拉低了其网络安全综合排名。
成本是ML4面临的主要挑战。AA数据显示,ML4每项任务的成本为1.13美元,即便享受50%的首发折扣后仍为0.57美元。相比之下,表现更优的小米MiMo-V2.6-Pro成本仅为0.13美元,GLM-5.3-Flash为0.25美元。AA图表显示,ML4位于帕累托线之下,略低于“最具吸引力象限”。值得注意的是,虽然ML4在CyberGym-E2E-AA上击败了GPT-6 Luna,但后者以约0.07美元的极低任务成本在综合指数上与ML4持平。
技术细节与基础设施
ML4基于Nvidia Grace Blackwell GPU训练,总参数量约1.05T,激活参数量为49B–52B。Mistral表示,该模型在欧洲自有数据中心使用3,800块Grace Blackwell GPU从头训练,历时约两个月。这一规模超过了去年发布的Large 3(使用3,000块H200 GPU)。在推理速度方面,ML4每秒生成116.1个令牌,首令牌延迟1.46秒,比同类模型中位数快约33%。
Mistral首席执行官Arthur Mensch表示,ML4在网络安全、金融和法律等企业工作负载中处于开源模型顶尖水平,并在视觉定位方面凭借16亿参数的视觉编码器超越部分前沿封闭模型。此外,ML4在Coding Agent Index上也击败了DeepSeek V4 Pro和Qwen3.8 Max。
开源计划与融资背景
目前,ML4尚未开放权重。Mistral承诺将在10月底前发布模型权重、架构细节及更多基准测试结果。在此之前,开发者可通过API以折扣价格试用。一旦权重公开,AA预计ML4将跻身网络安全开源模型前三。
此次发布背后是Mistral强劲的资本支持。该公司近期完成系列D轮融资,总额达30亿欧元,创下欧洲科技公司股权融资纪录。Mistral计划部署18,000块Grace Blackwell芯片,大幅扩充欧洲自有数据中心算力,并将ML4作为新一代专用优化模型的基础。