NVIDIA Vera Rubin NVL72, MLPerf Inference v6.1 데뷔에서 선도적 성능 제공
시스템 성능, 효율적인 인프라 확장 및 지속적인 소프트웨어 최적화는 AI 추론 경제성을 결정하는 핵심 레버입니다. 시스템 성능이 높을수록 더 많은 토큰이 생성되어 더 높은 수익으로 이어집니다. 효율적인 확장은 하드웨어가 추가됨에 따라 처리량이 비례적으로 증가하는 것을 의미합니다.
배경
NVIDIA의 차세대 Vera Rubin 아키텍처가 MLPerf Inference v6.1 벤치마크에서 NVL72 시스템을 통해 처음으로 모습을 드러냈다. 공식 블로그에 따르면, 이 시스템은 대규모 언어 모델(LLM) 추론에서 압도적인 처리량 우위를 보여주며 여러 부문에서 선두를 차지했다. MLPerf는 업계에서 가장 권위 있는 AI 성능 평가 기준으로, 이미지 분류부터 생성형 AI까지 다양한 작업을 포괄한다. 이번 결과는 단순한 성능 과시를 넘어, 업계의 관심이 학습 중심에서 추론 경제성으로 이동하고 있음을 시사한다.
NVL72 시스템의 핵심은 단일 노드 성능뿐 아니라 효율적인 다중 노드 확장성에 있다. GPU를 추가할수록 처리량이 거의 선형적으로 증가하는데, 이는 클라우드 추론 서비스의 토큰당 비용을 직접적으로 낮춘다. 이러한 근선형 확장성은 하드웨어 추가에 비례하여 시스템 전체 처리량이 증가함을 의미하며, AI 배포의 총소유비용(TCO)을 결정하는 데 있어 인프라 확장 효율성이 칩 성능만큼 중요해졌음을 보여준다.
심층 분석
Vera Rubin NVL72의 성능은 세 가지 계층의 공진화에서 비롯된다. 아키텍처 측면에서 Vera Rubin GPU는 더 진보된 공정과 대용량 HBM 고대역폭 메모리를 탑재할 것으로 예상된다. 또한 Transformer Engine을 계승·업그레이드하여 FP8 이하의 동적 혼합 정밀도 연산을 지원함으로써, 대형 모델의 행렬 연산을 가속화하고 에너지 효율을 개선한다.
시스템 인터커넥트는 질적 도약을 이뤘다. NVL72는 NVLink를 통해 72개의 GPU를 하나의 거대한 공유 메모리 노드로 통합하며, GPU 간 대역폭은 초당 수 테라바이트에 달한다. 이는 텐서 병렬화나 파이프라인 병렬화 같은 분산 추론 전략에서 통신 병목을 사실상 제거하여 근선형 확장의 하드웨어 기반을 제공한다. 이처럼 긴밀하게 결합된 설계 덕분에 GPU 추가 시 처리량이 비례적으로 증가한다.
소프트웨어 측면에서는 NVIDIA의 TensorRT-LLM 추론 프레임워크가 Vera Rubin에 맞춰 심층 최적화되었다. 연산자 융합, 자동 커널 튜닝, 고급 메모리 관리 기법을 통해 모델 그래프를 고도로 병렬화된 명령어 시퀀스로 컴파일하여 하드웨어 잠재력을 극대화한다. 이 세 계층의 결합으로 NVL72는 천억 개 매개변수 모델을 극히 낮은 단일 토큰 지연 시간으로 처리하면서, GPU 수에 따라 시스템 처리량을 매끄럽게 확장할 수 있다.
산업 영향
클라우드 서비스 제공업체에게 추론 비용은 AI 애플리케이션 수익성의 핵심이다. Vera Rubin의 높은 처리량과 선형 확장성은 동일한 자본 지출로 더 많은 사용자에게 서비스를 제공하고 더 많은 토큰을 생성할 수 있게 하여 단위 경제성을 직접 개선한다. 이는 Hopper나 Blackwell 아키텍처에서 Vera Rubin으로의 이전을 가속화하고, 인프라 투자의 새로운 물결을 촉발할 가능성이 크다.
AMD와 Intel에 대한 경쟁 압력은 더욱 거세진다. AMD의 MI300 시리즈는 학습 분야에서 격차를 좁혔지만, 추론 생태계 성숙도와 시스템 수준 확장 효율성에서는 여전히 뒤처져 있다. Intel Gaudi 라인은 소프트웨어 스택 미성숙과 고객 도입 속도 저하로 제약을 받는다. Vera Rubin의 MLPerf 데뷔는 경쟁자들에게 단일 칩 성능뿐 아니라 생산 준비가 완료된 소프트웨어와 함께 효율적인 대규모 클러스터 확장을 요구하는 새로운 기준을 제시했다. Google TPU나 AWS Trainium 같은 자체 칩은 특정 워크로드에 강점을 보이지만, NVIDIA CUDA 생태계의 범용성에는 못 미쳐 생성형 AI 추론 시장에서 NVIDIA의 표준 지위를 공고히 한다.
전망
몇 가지 주목할 만한 신호가 있다. 첫째, Vera Rubin의 공식 생산 일정과 초기 고객 인도 시점이 2026년 하반기 AI 컴퓨팅 공급 구도를 결정할 것이다. 생산 능력이 순조롭게 확대되면 클라우드 제공업체들이 자본 지출을 상향 조정할 수 있다. 둘째, MLPerf 추론 벤치마크에 멀티모달 모델이나 검색 증강 생성(RAG) 등 생성형 AI 워크로드가 점차 추가되고 있으며, 이러한 신규 작업에서 Vera Rubin의 성능이 장기 경쟁력을 좌우할 것이다.
NVIDIA의 소프트웨어 전략은 추론에 더욱 기울어질 수 있다. 특정 수직 산업을 위한 추론 컨테이너나 마이크로서비스를 제공하여 하드웨어 우위를 플랫폼 종속으로 전환할 가능성이 있다. AMD의 CDNA 4 아키텍처가 확장성에서 돌파구를 마련하거나, OpenAI 등이 자체 추론 칩 투자를 늘리면 시장에 변동이 생길 수 있다. 추론 경제성은 토큰 처리량 기반 임대나 차등 가격 같은 새 비즈니스 모델을 낳아 AI 공급망 가치 분배를 재편할 것이다. Vera Rubin NVL72의 MLPerf 데뷔는 추론 시대를 향한 NVIDIA의 전략적 선언이다.