每瓦性能最高提升30倍:NVIDIA Vera Rubin NVL72 为 AI 智能体树立全新能效标准
据 OpenRouter 数据,Agentic AI 工作负载的 token 消耗是普通对话请求的 15 倍以上。当 AI 智能体为投资决策调研一家公司时,它会查询金融数据库、检索新闻与公告,并调用子智能体进行同行对比分析,从而产生远超传统交互的算力需求。NVIDIA Vera Rubin NVL72 正是面向此类高负载场景打造,实现每瓦性能最高提升 30 倍,为大规模 AI 智能体部署树立全新能效标杆。
NVIDIA 在其官方博客中正式披露了 Vera Rubin NVL72 数据中心架构在 Agentic AI 高负载场景下的能效表现,核心指标是每瓦性能最高提升 30 倍。这一数据的背后是一个正在快速变化的工作负载图景:据 OpenRouter 统计,Agentic AI 工作负载的 token 消耗是普通对话请求的 15 倍以上。传统的大模型交互往往是一次提问、一次回答,用户与模型之间是点对点的简单往返;而智能体(Agent)的运行逻辑完全不同,它需要在一次任务中持续地调用工具、检索外部数据、执行多步推理,并在多个子智能体之间协调分工。以投资决策为例,一个智能体在调研一家公司时,会先查询金融数据库获取财报与估值数据,再扫描相关新闻与监管公告,随后可能调用专门的子智能体对同行业竞争对手进行横向对比,最后汇总形成结论。这一过程中产生的算力与数据吞吐,是单次问答无法比拟的。NVIDIA 正是抓住了这一结构性变化,将 Vera Rubin NVL72 定位为面向智能体高负载场景的基础设施,而非单纯追求训练算力的堆叠。
从技术与商业逻辑上看,这一架构的意义在于它把能效(每瓦性能)作为了核心设计目标,而非仅仅关注峰值算力。在 Agentic AI 场景下,负载具有明显的碎片化和长尾特征:一次完整的智能体任务可能包含数十次甚至上百次工具调用,每次调用的计算量并不大,但累积起来对内存带宽、网络吞吐和功耗管理提出了极高要求。如果系统在每个环节都存在能耗浪费,大规模部署的成本就会失控。Vera Rubin NVL72 通过整体架构层面的优化,把单位功耗下的有效工作量提升到原来的 30 倍,这意味着数据中心在相同电力预算下可以支撑更多的智能体并发任务。从商业模式角度,这对云服务商和 AI 基础设施提供商意味着推理成本的显著下降,进而让智能体应用的定价更具竞争力,也加速了智能体从实验场景走向规模化商用。
这一变化对行业格局的影响是多层面的。对于 AI 智能体的开发者与应用方而言,更高效的推理基础设施直接降低了调用成本,使得原本因算力昂贵而难以落地的复杂任务变得可行,尤其利好金融分析、投研、自动化运维等对多步推理依赖较高的垂直领域。对于 NVIDIA 自身,Vera Rubin NVL72 进一步巩固了其在数据中心硬件领域的主导地位,并将竞争维度从单纯的算力参数转向能效与系统级优化,这在一定程度上抬高了竞争对手的门槛。对于数据中心运营方,电力和散热一直是制约规模扩张的关键约束,每瓦性能的提升意味着在既有电力容量下可以部署更多算力,缓解了数据中心建设的瓶颈。值得注意的是,OpenRouter 作为开放模型路由平台,其提供的 token 消耗数据为行业量化智能体负载提供了参考基准,这类第三方数据有助于整个生态更清晰地理解工作负载的真实特征,从而推动硬件设计与软件优化的协同演进。
展望未来,值得关注的信号有几个方面。其一,Agentic AI 是否真正从概念走向大规模商用,将直接决定这类高能效基础设施的需求量级,OpenRouter 的 token 消耗数据可以作为观察这一趋势的重要指标。其二,NVIDIA 后续是否会在 Vera Rubin 系列中进一步细化面向不同负载的SKU,以及生态伙伴如何围绕该架构优化推理框架与调度策略,将影响能效优势能否真正转化为用户可感知的成本下降。其三,随着智能体任务的复杂化,内存带宽、网络互联和功耗管理可能成为新的竞争焦点,系统级优化的重要性或将超过单一芯片的性能提升。总体而言,NVIDIA Vera Rubin NVL72 的发布标志着 AI 基础设施的竞争重心正从训练算力向推理能效转移,而 Agentic AI 的崛起则为这一转变提供了明确的驱动力量,谁能在单位功耗下提供更强的有效算力,谁就能在下一轮智能体竞赛中占据主动。
Sources
FAQ
NVIDIA Vera Rubin NVL72是什么?
NVIDIA正式披露的 Vera Rubin NVL72 数据中心架构,专为 Agentic AI 高负载场景设计,可实现每瓦性能最高提升 30 倍。
Vera Rubin NVL72对行业意味着什么?
它将能效作为核心设计目标,把单位功耗下的有效工作量提升到 30 倍,显著降低推理成本,利好金融分析、投研等依赖多步推理的垂直领域,并巩固 NVIDIA 在数据中心硬件的主导地位。
未来值得关注哪些信号?
一是 Agentic AI 能否真正走向大规模商用;二是 NVIDIA 是否细化面向不同负载的 SKU;三是内存带宽、网络互联与功耗管理等系统级优化或成为新一轮竞争焦点。