法国人工智能公司 Mistral AI 正式推出 Mistral Large 4(内部代号 ML4,公开名“Le Chonk”)的公开预览版。这是一款拥有 1 万亿参数、490 亿活跃参数的原生多模态模型,直指编程、智能体工作流、网络安全及多模态任务等核心赛道。

目前,开发者可通过预览 API 体验该模型。Mistral 表示,模型权重将于 10 月底前正式发布,届时将披露更多架构细节、基准测试数据及后训练方法。

硬核算力:欧洲本土训练

ML4 在 Mistral 位于欧洲的数据中心内从零开始训练,耗时动用 3,800 块 NVIDIA Grace Blackwell GPU。公司强调,当前服务于公众预览的基础设施与训练阶段保持一致。作为 Mistral 迄今为止最大的模型,ML4 专为处理复杂场景而设计,涵盖网络安全、金融分析及法律工作等领域。

网络安全:突破闭源模型限制

网络安全是 ML4 对标闭源 AI 模型的关键战场。在 Artificial Analysis 网络安全指数中,ML4 跻身全球前五。其在复现和修补开源软件真实漏洞的测试中得分 82%,Cybench 测试得分高达 93%。

Mistral 指出,包括 Claude Opus 5.5 和 GPT-6 Astra 在内的多款领先闭源模型,因安全策略拒绝执行相关任务,导致在同一测试中得分接近于零。Mistral 认为,这种拒绝机制可能阻碍合法的漏洞研究和事件响应,而 ML4 可部署于私有云或本地基础设施,赋予组织对安全运营的完全控制权。

编程与智能体:性能领跑开源阵营

在编程能力方面,ML4 表现强劲。其在 DeepSWE v1.1、SWE-Atlas-QnA 和 Terminal-Bench 4 上的得分分别为 61.7%、59.4% 和 28.3%。综合编程智能体指数得分为 49.8%,超越 DeepSeek V4 Pro 0813 和 Qwen 3.8-Max。

Surge AI 的盲测评估显示,ML4 在编码质量排名中位列第二(3.74/5),仅次于 Claude Opus 5(4.22/5),但优于 Kimi K3、GLM-5.3 和 GLM-5.2。此外,在评估 Gmail、Slack 等应用业务流程的 AutomationBench 中,ML4 得分 59.9%;在长周期知识工作基准 AA-Briefcase 中,其 Elo 分达到 1,393 分。

多模态与科学计算

ML4 具备处理图像、文档、图表及自然场景的能力,可将视觉理解与智能体能力结合,用于分析工程图纸、从 PDF 提取证据及检查卫星图像等任务。在 Dense 200 视觉定位基准测试中,ML4 得分 42%,略高于 GPT-6 Astra 的 41%。

针对科学计算负载,ML4 在 SciCode-Verified 基准测试中处于开放权重模型的最先进水平,能够胜任数据分析、建模和科学模拟等任务。

开放权重与商业化路径

Mistral 将 ML4 定位为支持开放权重和自主部署的模型,以满足企业对 AI 系统控制权的需求。该模型将在多个地区提供,包括依据欧洲法律运营的欧洲部署版本。训练数据覆盖超过 160 种语言,包含所有欧盟官方语言。

ML4 是与金融、工程、制造、制药及公共部门等企业合作开发的,其定制环境基于 Mistral Forge 系统。这一研发路线图由 Mistral 完成的 30 亿欧元 D 轮融资支持,这是欧洲科技公司史上最大规模的股权融资。

目前,ML4 仍在进行强化学习训练。在约 3,000 块 GPU 的规模下,单次训练运行每天可产生约 330 亿个令牌,其中包含约 160 亿个经过滤和掩码处理的可训练完成令牌。