NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中展現領先效能
系統效能、高效基礎設施擴展和持續軟體優化是決定AI推理經濟性的關鍵槓桿。更高的系統效能意味著生成更多令牌,帶來更高收入。高效擴展意味著吞吐量隨硬體增加而成比例增長。
在最新发布的 MLPerf Inference v6.1 基准测试中,NVIDIA 下一代 Vera Rubin 架构的 NVL72 系统首次提交结果,便在多个主流模型上取得领先性能,尤其在大语言模型推理场景中展现出显著的吞吐量优势。根据 NVIDIA 官方博客披露,该系统的关键亮点不仅在于单节点性能,更在于其高效的多节点扩展能力——吞吐量随 GPU 数量增加几乎呈线性增长。这一结果验证了 Vera Rubin 架构在设计上对推理负载的深度优化,也标志着 AI 算力竞赛正式从训练侧向推理经济性倾斜。MLPerf 作为业内公认的 AI 性能标尺,其推理基准覆盖了从图像分类、目标检测到医疗影像、语音识别和生成式 AI 等广泛场景,而 Vera Rubin NVL72 在首次参与便拿下多项头名,足以说明其架构代际提升的幅度。
从技术层面拆解,Vera Rubin NVL72 的强劲表现源于三个层面的协同进化。首先是架构革新:Vera Rubin GPU 预计基于更先进的制程工艺,并搭载更大容量的 HBM 高带宽内存,同时延续并升级了 Transformer Engine,支持 FP8 甚至更低精度的动态混合精度计算,这直接提升了大模型推理中矩阵运算的效率和能效比。其次是系统互连的质变:NVL72 通过 NVLink 技术将 72 颗 GPU 整合为一个巨型共享内存节点,跨 GPU 带宽达到数 TB/s 级别,使得张量并行、流水线并行等分布式推理策略几乎无通信瓶颈,这是实现近线性扩展的核心硬件基础。最后是软件栈的持续优化:NVIDIA TensorRT-LLM 等推理框架针对 Vera Rubin 进行了深度算子融合、内核自动调优和内存管理优化,能够将模型图编译为高度并行的指令序列,进一步压榨硬件潜力。三者叠加,使得 Vera Rubin NVL72 在处理千亿参数大模型时,不仅单 token 延迟极低,而且整系统吞吐量能够随着 GPU 数量增加而同步放大,这对于需要支撑海量并发请求的云端推理服务至关重要。
这一成绩对行业竞争格局的影响是立体的。对于云服务提供商而言,推理成本是决定 AI 应用能否盈利的关键。Vera Rubin 所展示的高吞吐和线性扩展特性,意味着在同等算力预算下可以服务更多用户、生成更多 token,从而直接改善单位经济效益。这将加速云厂商从 Hopper 或 Blackwell 架构向 Vera Rubin 的迁移节奏,并可能推动新一轮的算力基础设施投资。对于 AMD、Intel 等竞争对手来说,压力进一步加大:AMD 的 MI300 系列虽然在训练领域逐步缩小差距,但在推理生态和系统级扩展效率上仍与 NVIDIA 存在代差;Intel Gaudi 系列则受限于生态成熟度和客户采纳速度。Vera Rubin 的 MLPerf 首秀实际上拉高了推理系统的准入门槛——不仅要单卡性能强,更要能高效组成大规模集群,且软件栈必须开箱即用。此外,自研芯片阵营如 Google TPU、AWS Trainium 等虽然在特定内部工作负载上表现优异,但对外部客户的通用性和生态丰富度仍无法与 NVIDIA CUDA 生态抗衡。Vera Rubin 的发布进一步巩固了 NVIDIA 在生成式 AI 推理市场的事实标准地位,并可能挤压二线加速器厂商的生存空间。
展望后续发展,有几个信号值得密切关注。第一,Vera Rubin 的正式量产时间和首批交付客户将决定 2026 年下半年 AI 算力市场的供应格局,若产能爬坡顺利,可能引发新一轮云厂商资本开支上调。第二,MLPerf 推理基准正逐步加入更多生成式 AI 负载,例如多模态模型和检索增强生成场景,Vera Rubin 在这些新兴任务上的表现将影响其长期竞争力。第三,NVIDIA 的软件策略可能进一步向推理倾斜,例如推出针对特定垂直行业的推理容器或微服务,将硬件优势转化为平台锁定。第四,竞争对手的应对措施,尤其是 AMD 基于 CDNA 4 架构的下一代产品能否在系统扩展性上实现突破,以及 OpenAI、微软等大客户是否会加大自研推理芯片的投入,都将对市场产生扰动。最后,推理经济性本身可能催生新的商业模式,例如按 token 吞吐量计费的算力租赁服务,或针对不同精度和延迟要求的差异化定价,这些都将重塑 AI 产业链的价值分配。Vera Rubin NVL72 在 MLPerf 上的首秀,不仅是一次性能演示,更是 NVIDIA 对 AI 推理时代战略方向的一次清晰宣言。