英伟达 Vera Rubin NVL72 登顶 MLPerf Inference v6.1 推理性能

Published · AI Daily — AI-assisted deep research, methodology & disclosure

英伟达 Vera Rubin NVL72 数据中心推理平台在 MLPerf Inference v6.1 基准测试中首次亮相即登顶推理性能榜首。系统性能、高效基础设施扩展与持续软件优化,成为决定 AI 推理经济性的三大杠杆:更高的系统性能带来更多 token 生成与营收,而高效扩展则让吞吐量随硬件规模同步增长。这一结果标志着以 Vera Rubin 架构为核心的新一代推理基础设施,正在将大模型推理从算力堆叠推向经济性竞争的新阶段,也为英伟达在数据中心市场的持续主导提供了关键实证。

英伟达官方博客近日披露,其基于 Vera Rubin 架构的 NVL72 系统在 MLPerf Inference v6.1 基准测试中首次登场便登顶推理性能榜首。MLPerf Inference 是由 MLCommons 维护的行业权威基准,长期被用作衡量大模型推理系统真实吞吐与延迟表现的标尺,其测试结果对数据中心采购与算力部署具有直接参考价值。此次 NVL72 以全新平台的身份参赛,意味着英伟达将其下一代数据中心推理架构直接推上公开竞技场,用实测数据向市场宣告新一代硬件的性能水位。从时间线看,Vera Rubin 是英伟达面向数据中心推出的新一代平台,NVL72 则是将其整合为单机柜级推理系统的完整方案,将大量 GPU 与配套 CPU、内存、网络与散热单元集成到一个可快速部署的机柜单元中,从而降低大规模部署的工程复杂度。这一结果不仅是一次性能排名,更是英伟达向客户与竞争对手传递的信号:其推理硬件的竞争力已经建立在系统级而非单芯片层面。

要理解这一结果的分量,需要拆解 AI 推理经济的底层逻辑。与训练追求峰值算力不同,推理的核心矛盾在于如何在保证延迟与服务质量的前提下,最大化单位时间内的 token 生成量,并让这种吞吐能力随硬件规模线性扩张。英伟达在此明确提出了决定推理经济性的三大杠杆:系统性能、基础设施的高效扩展,以及持续的软件优化。系统性能直接决定单次请求的处理效率,更高的系统性能意味着同样的硬件能生成更多 token,从而在按 token 或按调用计费的商业模式下转化为直接营收。基础设施的高效扩展则关乎规模化后的边际成本,理想状态下吞吐量应随硬件规模同步增长,而非因网络拥塞、内存带宽瓶颈或调度开销而大幅折损。软件优化是贯穿始终的隐性杠杆,包括推理运行时、算子融合、量化与显存管理等,它决定了硬件潜力能否被充分释放。NVL72 将 GPU、CPU、网络与散热整合进单一机柜,本质上正是为了同时优化这三条杠杆:减少跨节点通信损耗以提升系统性能,统一架构以降低扩展复杂度,并为软件栈提供稳定一致的运行环境。这种系统级思路,正是英伟达区别于单纯售卖芯片厂商的关键所在。

从行业影响与竞争格局看,这一结果的影响是多层面的。对云厂商与大模型服务商而言,推理成本已成为制约模型规模化商用与定价策略的核心变量,谁能以更低的单 token 成本提供稳定服务,谁就能在推理市场中占据主动,NVL72 这类高吞吐系统直接关系其成本结构与产品竞争力。对英伟达自身而言,这进一步巩固了其在数据中心市场的主导地位,将其竞争壁垒从芯片性能扩展到整个系统架构与软件生态,使竞争对手难以仅凭单一硬件参数实现超越。对 AMD、英特尔等芯片厂商而言,竞争维度已被抬高到系统级与软件栈层面,单纯在芯片规格上追赶的难度显著增加。对开发者与普通用户而言,推理基础设施的进步最终会传导为更低的使用成本、更快的响应速度与更强的模型能力,是整条 AI 应用产业链的底层支撑。需要指出的是,NVL72 代表的是面向数据中心的规模化方案,其经济性红利目前主要被头部云服务商与大型模型厂商享有,中小企业的获取门槛仍然较高。

展望未来,值得关注的信号有多个方向。其一,MLPerf 基准的测试负载会持续演进,随着新模型架构与新推理场景的加入,性能排名可能随之变动,NVL72 的领先能维持多久值得观察。其二,软件栈的优化速度将成为关键变量,硬件性能的上限相对固定,而推理运行时、算子优化与量化技术的持续进步,往往能不断推高实际吞吐,这是英伟达需要长期投入的领域。其三,竞争对手的应对节奏,尤其是其他芯片厂商在系统级推理方案上的进展,将直接影响整个赛道的竞争格局。其四,推理经济性是否会从头部云厂商向更广泛的企业客户下沉,决定了这套大规模基础设施的商业化广度。综合来看,英伟达通过 Vera Rubin NVL72 在 MLPerf Inference v6.1 的登顶,不仅证明了自己新一代推理硬件的性能实力,更标志着大模型推理竞争正从单纯的算力堆叠,转向系统性能、扩展效率与软件优化共同决定的经济性竞争。这一转向将深刻影响数据中心市场的权力结构与整条 AI 产业链的成本曲线,其后续演进值得持续跟踪。

Sources

FAQ

英伟达 Vera Rubin NVL72 在 MLPerf Inference v6.1 中取得了什么成绩?

英伟达官方博客披露,基于 Vera Rubin 架构的 NVL72 系统在 MLPerf Inference v6.1 基准测试中首次登场便登顶推理性能榜首。NVL72 将大量 GPU、CPU、内存、网络与散热整合进单机柜单元。

为什么这个结果对 AI 推理行业很重要?

它标志着 AI 推理竞争从单纯算力堆叠转向经济性竞争。系统性能、基础设施扩展与软件优化是三大杠杆,更低的单 token 成本将惠及云厂商、模型商与普通用户。

接下来有哪些值得关注的信号?

关注 MLPerf 测试负载演进后排名是否变动、软件栈优化速度、AMD 等对手的系统级应对节奏,以及推理经济性能否从头部云厂商向更多企业下沉。