NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中效能稱冠

Published · AI Daily — AI-assisted deep research, methodology & disclosure

系統效能、高效基礎設施擴展和持續軟體最佳化是決定AI推理經濟性的關鍵槓桿。更高的系統效能意味著生成更多token,帶來更高收入。高效擴展意味著隨著硬體增加,吞吐量成比例增長。

在最新发布的 MLPerf Inference v6.1 基准测试中,NVIDIA 基于 Vera Rubin 架构的 NVL72 系统首次登场便横扫多项测试,在数据中心推理场景中取得了业界领先的性能表现。MLPerf 作为衡量 AI 硬件与软件栈综合能力的权威标尺,其成绩直接反映了系统在真实负载下的吞吐量与延迟水平。Vera Rubin NVL72 在 GPT-J 等大语言模型推理任务中,以单系统超过数万令牌每秒的生成速度,将上一代产品的性能记录大幅刷新,同时保持了出色的能效比。值得注意的是,该成绩并非单纯依靠单芯片算力堆砌,而是通过 72 个 GPU 的高效互联与全栈软件优化实现的,这标志着 NVIDIA 在超大规模推理系统设计上迈出了关键一步。

从技术层面深入剖析,Vera Rubin NVL72 的性能突破源于架构、互联与软件的三重革新。Vera Rubin 架构引入了新一代流式多处理器设计,大幅提升了低精度计算密度,尤其是针对 Transformer 模型推理中常见的矩阵乘法和注意力机制进行了硬件级加速。其内存子系统采用更高带宽的 HBM 方案,并优化了缓存层次,有效缓解了大模型推理中的内存墙瓶颈。然而,单芯片算力的提升只是故事的一部分,真正让 NVL72 在 MLPerf 中脱颖而出的,是其基于 NVLink 和 NVSwitch 构建的机架级互联结构。72 个 GPU 通过高速、低延迟的互联形成了一个统一的显存池,使得原本需要跨节点通信的模型并行推理可以在系统内部高效完成,极大降低了张量并行的通信开销。这种设计让吞吐量能够随着 GPU 数量的增加近乎线性地扩展,这正是摘要中所强调的“高效扩展”的核心要义。在软件层面,NVIDIA 的 TensorRT 推理引擎针对 Vera Rubin 架构进行了深度图优化、算子融合和内存分配策略调整,并结合了先进的量化技术,使得模型在几乎不损失精度的前提下,能够充分利用硬件算力。这三者的协同作用,最终将系统性能推向了新的高度。

这一成绩对 AI 推理市场的竞争格局和商业模式将产生直接影响。对于云服务提供商而言,Vera Rubin NVL72 所展现的高吞吐与线性扩展能力,意味着他们可以用更少的系统数量支撑更大规模的推理请求,从而显著降低每令牌的推理成本。在生成式 AI 服务价格战日益激烈的背景下,这种成本优势将转化为更强的市场竞争力。亚马逊云科技、微软 Azure、谷歌云等头部云厂商很可能会加速部署基于 Vera Rubin 的实例,以吸引更多大模型应用开发者。对于企业用户来说,更低的推理成本将推动更多场景从实验走向生产,例如实时客服、代码生成、内容创作等,进一步扩大 AI 的落地范围。与此同时,竞争对手面临的压力也在陡增。AMD 的 Instinct MI300X 系列虽然在单芯片规格上紧追不舍,但在系统级扩展和软件生态成熟度上仍存在差距;英特尔 Gaudi 3 则主打性价比,但在绝对性能上难以撼动 NVIDIA 的高端市场地位。此外,自研芯片阵营如谷歌的 TPU 和亚马逊的 Trainium/Inferentia 虽然在特定工作负载上具备优势,但其通用性和软件生态的丰富度仍无法与 NVIDIA 的 CUDA 生态相提并论。Vera Rubin NVL72 的强势表现,将进一步巩固 NVIDIA 在 AI 推理基础设施领域的话语权,并可能促使竞争对手加快下一代产品的研发节奏。

展望未来,Vera Rubin NVL72 的 MLPerf 首秀只是 NVIDIA 推理路线图的一个节点。根据已公布的计划,Vera Rubin 架构之后还将有 Blackwell Ultra 等后续迭代,系统级扩展的规模可能进一步扩大,例如支持更多 GPU 的互联或引入更先进的网络拓扑。值得关注的信号包括:NVIDIA 是否会推出专为推理优化的精简版 Vera Rubin 芯片,以覆盖更广泛的成本敏感型市场;软件生态方面,TensorRT 的持续更新能否进一步释放硬件潜力,并更好地支持 MoE 等新兴模型架构;以及竞争对手的回应,比如 AMD 的下一代 MI400 系列或英特尔 Falcon Shores 能否在系统级性能上实现突破。此外,随着推理成本持续下降,AI 应用的爆发式增长将反过来对基础设施提出更高要求,形成正向循环。对于行业观察者而言,MLPerf 成绩不仅是性能的竞赛,更是整个 AI 计算经济性演变的晴雨表,而 Vera Rubin NVL72 已经为这场演变写下了浓墨重彩的一笔。

Sources

FAQ

NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 中取得了什么成绩?

在 MLPerf Inference v6.1 基准测试中,NVIDIA Vera Rubin NVL72 首次亮相即取得最高性能,在 GPT-J 等大语言模型上实现每秒超过数万令牌的生成速度,大幅刷新纪录并保持出色能效比。

这一成绩对 AI 推理经济性有何影响?

它证明了系统性能、高效扩展和软件优化是决定推理经济性的关键杠杆:更高性能带来更多令牌和收入,而线性扩展则控制成本,为大规模 AI 服务铺平道路。

接下来有哪些值得关注的动向?

关注 Blackwell Ultra 等后续架构、可能的精简版芯片,以及 AMD、Intel 等竞争对手能否在系统级性能上实现突破。