NVIDIA Vera Rubin NVL72 首秀 MLPerf:推理经济性成为 AI 算力新标尺
NVIDIA 下一代 Vera Rubin 架构在 MLPerf Inference v6.1 中首次亮相,其 NVL72 系统展现出领先的推理性能与接近线性的扩展效率。这一结果凸显了系统性能、基础设施扩展能力和软件优化对 AI 推理经济性的决定性作用——更高的吞吐量意味着单位 token 成本下降,直接转化为服务提供商的收入增长。在生成式 AI 大规模落地的关键节点,Vera Rubin 的登场不仅巩固了 NVIDIA 在推理市场的技术壁垒,也为云厂商和模型开发商提供了明确的下一代算力投资方向。
在最新发布的 MLPerf Inference v6.1 基准测试中,NVIDIA 下一代 Vera Rubin 架构的 NVL72 系统首次提交结果,便在多个主流模型上取得领先性能,尤其在大语言模型推理场景中展现出显著的吞吐量优势。根据 NVIDIA 官方博客披露,该系统的关键亮点不仅在于单节点性能,更在于其高效的多节点扩展能力——吞吐量随 GPU 数量增加几乎呈线性增长。这一结果验证了 Vera Rubin 架构在设计上对推理负载的深度优化,也标志着 AI 算力竞赛正式从训练侧向推理经济性倾斜。MLPerf 作为业内公认的 AI 性能标尺,其推理基准覆盖了从图像分类、目标检测到医疗影像、语音识别和生成式 AI 等广泛场景,而 Vera Rubin NVL72 在首次参与便拿下多项头名,足以说明其架构代际提升的幅度。
从技术层面拆解,Vera Rubin NVL72 的强劲表现源于三个层面的协同进化。首先是架构革新:Vera Rubin GPU 预计基于更先进的制程工艺,并搭载更大容量的 HBM 高带宽内存,同时延续并升级了 Transformer Engine,支持 FP8 甚至更低精度的动态混合精度计算,这直接提升了大模型推理中矩阵运算的效率和能效比。其次是系统互连的质变:NVL72 通过 NVLink 技术将 72 颗 GPU 整合为一个巨型共享内存节点,跨 GPU 带宽达到数 TB/s 级别,使得张量并行、流水线并行等分布式推理策略几乎无通信瓶颈,这是实现近线性扩展的核心硬件基础。最后是软件栈的持续优化:NVIDIA TensorRT-LLM 等推理框架针对 Vera Rubin 进行了深度算子融合、内核自动调优和内存管理优化,能够将模型图编译为高度并行的指令序列,进一步压榨硬件潜力。三者叠加,使得 Vera Rubin NVL72 在处理千亿参数大模型时,不仅单 token 延迟极低,而且整系统吞吐量能够随着 GPU 数量增加而同步放大,这对于需要支撑海量并发请求的云端推理服务至关重要。
这一成绩对行业竞争格局的影响是立体的。对于云服务提供商而言,推理成本是决定 AI 应用能否盈利的关键。Vera Rubin 所展示的高吞吐和线性扩展特性,意味着在同等算力预算下可以服务更多用户、生成更多 token,从而直接改善单位经济效益。这将加速云厂商从 Hopper 或 Blackwell 架构向 Vera Rubin 的迁移节奏,并可能推动新一轮的算力基础设施投资。对于 AMD、Intel 等竞争对手来说,压力进一步加大:AMD 的 MI300 系列虽然在训练领域逐步缩小差距,但在推理生态和系统级扩展效率上仍与 NVIDIA 存在代差;Intel Gaudi 系列则受限于生态成熟度和客户采纳速度。Vera Rubin 的 MLPerf 首秀实际上拉高了推理系统的准入门槛——不仅要单卡性能强,更要能高效组成大规模集群,且软件栈必须开箱即用。此外,自研芯片阵营如 Google TPU、AWS Trainium 等虽然在特定内部工作负载上表现优异,但对外部客户的通用性和生态丰富度仍无法与 NVIDIA CUDA 生态抗衡。Vera Rubin 的发布进一步巩固了 NVIDIA 在生成式 AI 推理市场的事实标准地位,并可能挤压二线加速器厂商的生存空间。
展望后续发展,有几个信号值得密切关注。第一,Vera Rubin 的正式量产时间和首批交付客户将决定 2026 年下半年 AI 算力市场的供应格局,若产能爬坡顺利,可能引发新一轮云厂商资本开支上调。第二,MLPerf 推理基准正逐步加入更多生成式 AI 负载,例如多模态模型和检索增强生成场景,Vera Rubin 在这些新兴任务上的表现将影响其长期竞争力。第三,NVIDIA 的软件策略可能进一步向推理倾斜,例如推出针对特定垂直行业的推理容器或微服务,将硬件优势转化为平台锁定。第四,竞争对手的应对措施,尤其是 AMD 基于 CDNA 4 架构的下一代产品能否在系统扩展性上实现突破,以及 OpenAI、微软等大客户是否会加大自研推理芯片的投入,都将对市场产生扰动。最后,推理经济性本身可能催生新的商业模式,例如按 token 吞吐量计费的算力租赁服务,或针对不同精度和延迟要求的差异化定价,这些都将重塑 AI 产业链的价值分配。Vera Rubin NVL72 在 MLPerf 上的首秀,不仅是一次性能演示,更是 NVIDIA 对 AI 推理时代战略方向的一次清晰宣言。