
MLCommons于2026年9月16日发布MLPerf Inference v6.1基准测试结果。相比英伟达下一代硬件的性能数据,更具行业参考价值的发现在于软件优化的显著成效:仅通过软件调优,现有部署硬件在短短五个月内即可实现8%至36%的吞吐量提升。这一结果为依赖基准测试分数进行数百万美元基础设施决策的市场,提供了来自中立联盟的可衡量依据。
Vera Rubin NVL72首获独立验证
v6.1首次提供了英伟达Vera Rubin NVL72平台经同行评审、独立验证的性能数据。这与英伟达AI基础设施峰会上发布的、基于早期硅片且由其自身基础设施托管的AgentX结果不同。MLPerf结果由拥有130名成员的中立联盟MLCommons验证,其章程旨在防止单一供应商控制结果,对采购决策具有更高的证据权重。
在预览类别中,Vera Rubin NVL72表现出强劲性能。在阿里巴巴Qwen3-VL模型上,其离线、服务器和交互场景吞吐量较当前一代GB300 NVL72提升高达3.7倍;在DeepSeek-R1模型上,吞吐量提升高达2.5倍。作为参考,GB300 NVL72在扩展至四机架配置时展现了99%的缩放效率,表明多机架通信瓶颈已得到显著缓解。
软件优化释放现有硬件潜力
数据显示,六个月前部署Blackwell系列GPU但未进行软件栈优化的企业,正在浪费部分硬件容量。三家独立提交方证实了这一现象:
- CoreWeave在相同的GB200 NVL72硬件上,通过软件优化使DeepSeek-R1单GPU吞吐量提升19.8%。
- Lambda在相同的Blackwell Ultra硬件上,服务器场景性能提升8.85%,期间无硅片变更。
- 英特尔Arc Pro B70四GPU节点在相同硬件上,GPT-OSS-120B服务器场景性能提升36%,离线场景提升27%。
Lambda的分析指出,收益源自TensorRT的一系列软件优化,包括操作融合、分段CUDA图捕获及KV缓存调整等,无需新增硬件投入。这意味着企业在考虑升级Vera Rubin前,应首先评估当前Blackwell硬件的软件栈状态,潜在的性能增益可能无需额外资本支出即可实现。
基准测试结构性变革:拥抱真实工作负载
v6.1引入了两个新基准类别,标志着行业对AI工作负载认知的转变:
端到端检索增强生成(E2E-RAG):针对生产环境中常见的多组件流水线,测试从文档摄取到实时查询回答的全过程。该基准承认,现代企业AI系统已不再是孤立处理固定提示词的单个模型,而是涉及嵌入、检索、重排序和大语言模型的复杂协作。
边缘智能体推理(Edge Agentic Inference):针对在受限硬件上运行的智能体工作负载,强调低延迟和单会话服务能力,而非云端的批量吞吐量。英伟达提交了Jetson AGX Thor结果,而Lambda则在数据中心硬件上首次部署了万亿参数模型Kimi K2.6进行智能体任务测试。
市场参与度创历史新高
v6.1周期吸引了30家组织提交数据,产生486项测试结果,创下MLPerf历史最高参与度。六家组织首次提交,包括Atlas Inference、Crusoe等。本轮还记录了最大规模提交系统——Crusoe基于AMD Instinct MI355X GPU组成的512加速器集群,以及多种新颖的异构配置。
在排行榜方面,CoreWeave在GB300 NVL72机架上实现了v6.1数据中心封闭提交中最高的每GPU吞吐量。AMD将其提交扩展至六个模型家族,英特尔则增加了Xeon 6服务器的SKU数量,使其成为唯一提交独立服务器CPU推理结果的厂商。
未来展望:API中心夹具成为主流
超过半数v6.1提交者采用了新的API中心测试夹具,这种客户端/服务器架构更准确反映生产环境。MLCommons确认,基于此构建的MLPerf Endpoints最终将取代当前的Inference套件用于数据中心测量。对于企业而言,关注提交者所使用的夹具类型已成为比较性能数据的关键细节。