跳到正文
原文
NVIDIA Blog· Zhihan Jiang·· 23 天前精选AI 评分60

NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次亮相,吞吐量最高达 GB300 的 3.7 倍

NVIDIA Vera Rubin NVL72 Delivers Leading Performance in MLPerf Inference v6.1 Debut

AI 导读

NVIDIA Vera Rubin NVL72 首次提交 MLPerf Inference v6.1 评测,在 Qwen3-VL 上吞吐量最高可达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上提升达 2.5 倍。GB300 NVL72 四机架扩展效率达 99%,软件优化较 v6.0 提升最高 1.6 倍。

推荐理由

原文给出了 Vera Rubin 在 MLPerf 上相对 GB300 的具体吞吐提升倍数和扩展效率,读者可据此评估新一代平台在推理经济性上的实际价值。

正文 · AI 翻译

系统性能、高效的基础设施扩展和持续的软件优化是决定AI推理经济性的关键杠杆。更高的系统性能意味着生成更多token,从而带来更高收入。高效扩展意味着随着硬件的增加,吞吐量按比例增长,从而以更少的资源服务大规模用户。持续优化意味着从基础设施投资中产生更多价值。 

支撑这三者的是平台的可互换性:同一基础设施可运行任何模型、任何工作负载,从训练到推理,从推荐系统到推理系统,从语言到视频,保持高利用率。

NVIDIA平台正是为全面优化这些方面而构建,正如今天发布的MLPerf Inference v6.1结果所强调的:

  • NVIDIA Vera Rubin NVL72系统首发即展现领先性能:在首次MLPerf Inference预览提交中,NVIDIA Vera Rubin NVL72的吞吐量比GB300 NVL72提升高达3.7倍。
  • NVIDIA GB300 NVL72以领先效率扩展:在四个GB300 NVL72机架上的288-GPU提交实现了99%的扩展效率,吞吐量从单机架基线近乎线性增长。
  • 持续软件优化推动性能提升:NVIDIA在MLPerf Inference v6.1提交中的软件优化相比v6.0实现了高达1.6倍的性能提升。在v6.1提交后优化仍在继续,带来进一步性能提升。

对于做出AI基础设施决策的组织而言,性能、扩展效率和软件迭代速度是决定长期推理经济性的重要考量因素。 

Vera Rubin NVL72在MLPerf Inference首秀中展现领先性能

NVIDIA在MLPerf Inference v6.1套件中两个最具挑战性的基准上提交了Vera Rubin NVL72的预览结果:DeepSeek-R1和Qwen3-VL。 

在离线、服务器和交互场景中,使用vLLM配合NVIDIA Dynamo开源推理框架,Vera Rubin NVL72在Qwen3-VL上的吞吐量比GB300 NVL72提升高达3.7倍。在DeepSeek-R1上,使用NVIDIA TensorRT-LLM库,吞吐量比GB300 NVL72提升高达2.5倍。这些早期结果展示了NVIDIA加速创新的步伐,以及性能如何通过持续软件优化得到改善。 

MLPerf Inference v6.1,封闭组。结果于2026年9月16日从www.mlcommons.org获取。NVIDIA平台结果来自以下条目:6.1-0106和6.1-0074。MLPerf名称和标志是MLCommons协会在美国和其他国家的注册及未注册商标。保留所有权利。严禁未经授权使用。更多信息请参见www.mlcommons.org。

这一性能意味着每个Vera Rubin NVL72机架相比GB300 NVL72机架能生成显著更多的token,服务更多用户,并在降低每token成本的同时创造更多收入。

这些结果反映了硬件和软件的全栈协同设计。Vera Rubin增强的Tensor Core和Transformer Engine加速了推理的预填充和解码阶段,而NVFP4精度减少了模型权重、注意力和KV缓存的内存占用——在输出质量损失极小的情况下提高吞吐量。 

Vera Rubin 的提交大量使用了分离式服务,将预填充和解码分开,并结合大规模专家并行,以在支撑 DeepSeek-R1 和 Qwen3-VL 等模型的混合专家层上实现最大效率。 

NVL72 扩展域——由第六代 NVIDIA NVLink 和 NVLink Switch 驱动,提供比现成以太网高 10 倍的数据包速率和低 3 倍的延迟——为这些技术在机架规模上有效应用提供了互连基础。 

这种协同设计延伸到了 NVIDIA 的合作伙伴生态系统:Nebius 也提交了 Vera Rubin NVL72 预览结果,并展现了出色的性能。

AI 智能体能够跨多个步骤进行推理、规划和行动,正在重塑推理性能的衡量方式。在旨在捕捉这一转变的基准测试中(如 SemiAnalysis AgentX),Vera Rubin NVL72 在预览测试中比 GB300 NVL72 提供了 30x 倍的性能提升。此外,即将推出的 MLPerf Endpoints 基准测试将为智能体推理工作负载带来标准化测量,超越传统吞吐量基准所能捕捉的范围。

NVIDIA GB300 NVL72 以领先效率实现扩展

扩展效率——额外的 GPU 如何有效转化为吞吐量提升——是衡量 AI 基础设施生产力的关键指标。NVIDIA 通过每个机架内的高带宽、低延迟扩展互连、机架间的高带宽网络以及跨节点的高效请求编排来实现这一点。

NVIDIA 的 DeepSeek-R1 (DSR1) 提交从单个 GB300 NVL72 机架(72 个 GPU)扩展到四个机架(288 个 GPU),在离线场景中实现了 99% 的扩展效率。吞吐量几乎与所添加的硬件成比例增长。

MLPerf Inference v6.1,封闭组。结果于 2026 年 9 月 16 日从 www.mlcommons.org 检索。NVIDIA 平台结果来自以下条目:6.1-0073 和 6.1-0074。MLPerf 名称和标志是 MLCommons Association 在美国和其他国家的注册和未注册商标。保留所有权利。严禁未经授权使用。更多信息请参阅 www.mlcommons.org。

扩展效率至关重要,因为更多 GPU 并不自动意味着吞吐量成比例增加。如果 GPU 数量增加近一倍而吞吐量仅提升个位数百分比,基础设施成本将远超性能回报。架构、互连和软件必须共同扩展。

GB300 NVL72 还在 WAN 2.2 文生视频基准测试中展示了机架级效率,达到每秒 0.65 个 720p 视频,每个视频 5.7 秒——比单节点吞吐量高 9 倍,延迟低 7.5 倍。

软件优化驱动持续提升

NVIDIA 平台持续进行软件开发,提供性能和功能改进。 

在 v6.1 中,GB300 NVL72 在 Qwen3-VL 上的性能相比 v6.0 结果提升了高达 1.6 倍。这些提升源于更低的 KV 缓存精度、额外的内核融合、更好的内核以及使用 vLLM 和 NVIDIA Dynamo 的分离式服务。 

软件优化在v6.1提交截止日期之后仍在继续。提交后的结果(尚未经过MLCommons验证)显示,GPT-OSS-120B和DLRMv3进一步提升了性能。 

全面覆盖的AI推理

除了NVIDIA Grace Blackwell和Vera Rubin NVL72平台的结果外,NVIDIA还使用NVIDIA TensorRT Edge-LLM,在新推出的Edge-Agentic基准测试(采用Qwen3.6-27B)上提交了Jetson AGX Thor的结果。

NVIDIA合作伙伴生态广泛参与,共有19家合作伙伴(其中8家基于多节点Blackwell NVL72系统)展示了卓越性能。这包括华硕、Azure、思科、CoreWeave、Crusoe、戴尔科技、富士通、技嘉科技、HPE、英业达、Lambda、MiTAC Computing、Nebius、Oracle云基础设施、Quanta Cloud Technology、Red Hat、ScitiX、超微和Wiwynn。

从紧凑的边缘设备到最大的AI工厂,NVIDIA继续以年度平台架构迭代、持续改进的软件以及可大规模交付的生态系统,推动整个技术栈的进步。

了解更多关于NVIDIA Vera Rubin平台的信息。

来源:NVIDIA Blog · blogs.nvidia.com