NVIDIA 扩展 NVLink Fusion,推出定制 NVHBM 高带宽内存

Published 2026-08-26 · AI Daily — AI-assisted deep research, methodology & disclosure

新一轮 AI 浪潮对基础设施提出新要求。随着 AI 智能体和万亿参数负载走向主流,AI 基础设施的性能不再仅取决于算力,更取决于如何将算力、内存、存储、网络与软件作为统一系统进行一体化设计。NVIDIA 今日官方博客宣布扩展 NVLink Fusion 能力,推出定制 NVHBM 高带宽内存,将 GPU 互联从单纯的算力通道升级为覆盖内存层的统一架构。这标志着 AI 硬件竞争正从单点性能比拼,转向系统级协同设计的深水区。

NVIDIA 通过官方博客宣布对 NVLink Fusion 架构进行重要扩展,正式推出定制化的 NVHBM 高带宽内存方案。这一动作发生在 AI 基础设施需求急剧演变的节点上:随着 AI 智能体(agent)和万亿参数级负载逐步走向主流,模型运行时的内存吞吐瓶颈日益凸显。NVIDIA 将此次扩展定位为应对新一代工作负载的关键举措,强调 AI 基础设施的性能不再仅仅取决于算力本身,而是取决于能否将算力、内存、存储、网络与软件作为一个统一的系统进行一体化设计。NVLink Fusion 原本主要是 GPU 之间的互联总线,用于在多卡、多节点之间高速搬运数据,如今被进一步延伸到内存层,形成覆盖计算与存储的统一架构。这一变化的核心在于,它试图解决大模型推理和智能体推理过程中反复出现的内存墙问题——即数据在计算单元与内存之间搬运的延迟和带宽消耗,正在成为制约整体效率的主要障碍。

从技术层面拆解,NVHBM 本身并非全新概念,高带宽内存早已在高端 GPU 中广泛使用,其通过堆叠封装的方式在物理上紧贴计算芯片,从而获得远超传统内存的传输速率。NVIDIA 此次的关键创新在于「定制」二字与「Fusion」的整合思路。定制意味着 NVHBM 不再是通用内存颗粒的简单堆砌,而是根据特定负载的访问模式、容量需求和时序特征进行专门设计,使内存的行为更贴合 AI 推理的实际消耗。而 Fusion 的意义在于,它将原本相对独立的内存通道纳入到 NVLink 的统一互联框架之中,让 GPU 之间、GPU 与内存之间的数据流动能够被更协调地调度和管理。这种设计直接回应了智能体负载的典型特征:智能体往往需要持续地访问外部知识、维护对话状态、在多轮推理中反复读写上下文,这类工作负载对内存带宽和容量的敏感度,甚至高于对纯算力的需求。因此,把内存纳入统一系统设计的范畴,是 NVIDIA 从架构层面为下一代 AI 应用提前布局的一步棋。

从行业影响和竞争格局来看,这一举措的影响远超单一产品的发布。过去几年,AI 硬件市场的竞争主要集中在算力的绝对数值上,各家厂商比拼的是单芯片的浮点运算能力和集群的总算力规模。但当万亿参数模型和智能体成为主流,竞争的焦点正在向系统整体的协同效率转移。谁能把算力、内存、存储、网络更紧密地整合在一起,谁就能在实际部署中提供更低的延迟、更高的吞吐和更好的成本效益。NVIDIA 通过 NVLink Fusion 和 NVHBM 的组合,实际上是在巩固自己在 AI 基础设施领域的全栈优势——从芯片、互联、内存到软件和系统,形成了一条竞争对手难以在短期内完整复制的链条。对于云服务商和大型 AI 实验室而言,这意味着它们的算力采购和架构选型将进一步向 NVIDIA 的生态靠拢,独立芯片厂商想要在系统级体验上与之正面竞争,难度显著增加。对于整个赛道来说,这也释放出一个明确信号:内存和互联的地位正在上升,未来 AI 硬件的创新热点可能会从单纯的算力提升,部分转向内存带宽、互联带宽和系统级优化。

展望未来,值得关注的信号有几个方面。首先是 NVHBM 的定制方案会如何落地,它会以何种形态与现有的 GPU 产品线结合,覆盖哪些具体的负载场景,这将直接决定其对市场竞争格局的实际冲击。其次是 NVIDIA 是否会进一步将存储和网络也纳入 NVLink Fusion 的统一框架,如果它真的实现算力、内存、存储、网络的全面整合,那么「系统级 AI」这一概念将从理念走向可工程化的现实。再者,竞争对手的反应也值得关注,无论是内存厂商、互联标准组织还是其他芯片设计商,都可能针对这一趋势做出回应,进而推动整个行业在内存和互联层面的创新节奏。对关注这一领域的人来说,NVIDIA 此次扩展的真正意义,或许不在于某一款产品的参数,而在于它再次明确了 AI 基础设施竞争的下一个战场——不再是单点性能的较量,而是统一系统设计的综合实力。这场从算力到系统的范式转移,才刚刚开始。

Sources

FAQ

NVIDIA 这次对 NVLink Fusion 做了什么?

NVIDIA 通过官方博客宣布扩展 NVLink Fusion 架构,推出定制的 NVHBM 高带宽内存,把 GPU 互联从算力通道延伸到内存层,形成覆盖计算与存储的统一架构。

为什么这次扩展很重要?

随着 AI 智能体和万亿参数负载成为主流,推理时的内存吞吐瓶颈凸显。把算力、内存、存储、网络与软件统一设计,能降低延迟、提高吞吐,缓解“内存墙”问题。

接下来值得关注什么?

值得关注 NVHBM 定制方案以何种形态落地、覆盖哪些负载;NVIDIA 是否会进一步把存储和网络纳入 NVLink Fusion;以及内存厂商等竞争对手的反应。