d-Matrix 采用英伟达 NVLink Fusion 构建机架级 XPU 推理集群
AI 推理芯片初创公司 d-Matrix 宣布在其 Corsair 存算一体硬件中全面集成英伟达 NVLink Fusion 互联技术。该合作使得数字内存计算架构能够实现微秒级延迟的光学互联横向扩展,在万亿参数长上下文生成式 AI 推理任务中,能效比传统 GPU 架构提升高达 4 倍,有效破解大模型推理的内存墙瓶颈。
存算一体破局:生成式 AI 时代的内存墙难题
在万亿参数大模型与跨模态生成式智能体席卷数据中心的当下,AI 推理系统所面临的物理挑战已彻底从算力峰值瓶颈转移至内存带宽与互联延迟的制约。传统 GPU 架构在执行百千 Token 甚至兆级上下文长度(Long-Context)的推理时,由于自注意力机制(Self-Attention)所产生的键值缓存(KV Cache)呈几何级数膨胀,处理器芯片绝大部分的时间与电能都被耗费在 High Bandwidth Memory (HBM) 与计算核心之间的数据搬运之上。这种经典的冯·诺依曼结构内存墙瓶颈,导致现代数据中心在面对长文本生成和实时多轮复杂对话时,不仅算力单元利用率暴跌,机房功耗与散热成本更呈现出不可持续的线性攀升。
为了从根本上颠覆这一瓶颈,专注于数字存算一体(Digital In-Memory Computing, DIMC)架构的芯片创新者 d-Matrix 近期推出了代号为 Corsair 的专用 XPU 平台。与传统的 Von Neumann 架构不同,Corsair 芯片利用高密度静态随机存取内存(SRAM)作为直接计算基底,将矩阵乘累加(GEMM)运算引擎物理集成至存储单体内部。这意味着海量权重的读取与矩阵乘法完全在片上局部完成,彻底阻断了数据在外部总线与高能耗 HBM 芯片之间频繁流动的物理损耗。在单芯片维度,Corsair 已经展示出远超主流通用处理器的首字生成时延(Time to First Token, TTFT)和每瓦能效比。
然而,对于动辄参数规模超过千亿的复杂混合专家模型(MoE)以及数百名用户并发调用的生产环境,单一芯片的片上 SRAM 容量无论多么庞大,都无法独立承载万亿参数模型的全量驻留与庞大 KV Cache 扩展。这就要求存算一体技术必须走出单芯片的孤岛,进入机架级(Rack-Scale)集群互联的宏大版图。
NVLink Fusion:开启全光学低延迟集群互连
正是针对这一系统级挑战,d-Matrix 正式宣布与英伟达展开深度架构级合作,在其 Corsair 存算一体硬件体系中全面引入 NVIDIA NVLink Fusion 互联技术。这一战略合作标志着数字存算一体计算范式与业界顶级机架互联协议的深度融合,为新一代分布式 XPU 推理集群奠定了坚实底层通信基础。
NVLink Fusion 是英伟达面向未来超大规模异构智算中心推出的光学扩展网络协议。它突破了传统铜缆互联在传输距离、高频信号衰减以及电磁干扰方面的严格物理限制,通过先进的共封装光学器件(Co-Packaged Optics, CPO)与超高密度硅光互联通道,构建起贯穿机架内外数十甚至上百个计算节点的统一通信矩阵。该技术能够提供高达微秒级别的极端端到端网络延迟,以及数倍于标准以太网与 InfiniBand 的双向穿透带宽。
通过将 NVLink Fusion 控制器与物理层(PHY)直接嵌入 Corsair XPU 模块,d-Matrix 成功构建了一套机架级统一寻址内存架构。在这一体系下,整套机架内的数十块 Corsair 硬件能够在纳秒到微秒级的极低延迟内互相访问彼此的片上高速缓存,从而在逻辑上聚合为一个拥有数十太字节(TB)超高速、低延迟共享内存空间的超级计算机。长上下文推理过程中极其繁重的 KV Cache 分布式切片与动态同步,得以直接在全机架光互联网络中近乎零开销地并行流转。
4 倍能效突破与数据中心推理基础设施重构
根据 d-Matrix 与英伟达联合公布的技术基准测试数据,搭载 NVLink Fusion 的 Corsair 机架级 XPU 部署方案,在运行包括 Llama-3-70B 以及最新万亿 MoE 模型在内的长上下文生成式任务时,展现出了极为亮眼的能效与吞吐表现。相较于完全依赖标准 GPU 与以太网互联的传统智算集群,该方案在维持甚至超越现有低推理延迟标准的前提下,实现了整体能效(Tokens per Watt)高达 4 倍的惊人飞跃。 这一显著提升的核心驱动力源于两个层面的物理减熵:
其一,在芯片微架构层面,数字存算一体架构将单次矩阵计算的数据搬移能耗降低了一个数量级,消除了对高发热 HBM 芯片的过度依赖;
其二,在机架通信层面,NVLink Fusion 光学低延迟总线直接绕过了传统 TCP/IP 网络协议栈复杂的封包拆包开销与昂贵的中间交换机跳转,让跨芯片张量并行与上下文并行(Context Parallelism)通信如同访问本地总线一般平滑顺畅。 业内权威系统架构师指出,d-Matrix 对 NVLink Fusion 的拥抱,反映了现代 AI 智算中心设计哲学的根本性转变。过去数年间,行业普遍倾向于堆叠规格越来越高、功率越来越大的单体大 GPU,但这种模式在电力供应紧张、机架散热面临相变冷却极限的当下正遭遇天花板。通过将专精于长上下文推理能效的存算一体芯片,接入英伟达成熟且高速的光学互联生态,智算数据中心运营商得以实现计算单元与互联架构的解耦与解构(Disaggregated Computing)。企业用户无需彻底推翻现有的基础设施规划,即可在现有机架规范内平滑集成极具竞争力的低能耗推理专用算力。
展望未来,随着多模态大模型对连续实时音视频交互与数十万 Token 上下文窗口的需求常态化,推理能耗将直接决定企业生成式业务的商业毛利率。d-Matrix 与英伟达在 NVLink Fusion 上的联手,不仅确立了机架级存算一体系统的工业化可行性,更为超大规模生成式 AI 基础设施的绿色低碳演进指明了切实可行的工程路径。
Sources
FAQ
d-Matrix 与英伟达的合作重点是什么?
双方将英伟达的 NVLink Fusion 光互联技术深度整合进 d-Matrix Corsair 存算一体芯片中,打造机架级低延迟、超高带宽的异构 XPU 推理集群。
数字存算一体架构相比传统 GPU 有何优势?
它直接在存储阵列内部执行矩阵乘累加运算,消除了传统计算与高带宽内存之间频繁的数据搬运,在长上下文推理中实现高达 4 倍的能效提升。
NVLink Fusion 在机架级扩展中扮演什么角色?
NVLink Fusion 提供微秒级的光学扩展网络互联,使数百颗 Corsair XPU 能够共享统一的内存地址空间,无缝承载数百万 Token 的 KV Cache。