NVIDIA Vera Rubin NVL72, MLPerf Inference v6.1 데뷔에서 최고 성능 달성

Published · AI Daily — AI-assisted deep research, methodology & disclosure

시스템 성능, 효율적인 인프라 확장 및 지속적인 소프트웨어 최적화는 AI 추론 경제성을 결정하는 핵심 요소입니다. 시스템 성능이 높을수록 더 많은 토큰이 생성되어 더 높은 수익으로 이어집니다. 효율적인 확장은 하드웨어가 추가됨에 따라 처리량이 비례하여 증가하는 것을 의미합니다.

\n\n

배경\n\n2026년

9월 16일, MLPerf Inference v6.1 결과가 공개되며 NVIDIA의 차세대 Vera Rubin NVL72 시스템이 처음으로 등장했다. 72개의 GPU를 탑재한 이 플랫폼은 Llama 2 70B, GPT-J 등 주요 대규모 언어 모델 추론 작업에서 최고 처리량을 기록했으며, 서버 지연 시간 시나리오에서도 뚜렷한 우위를 보였다. MLPerf는 업계에서 공인된 AI 성능 벤치마크로, 오프라인 처리량과 서버 모드 테스트를 통해 실제 배포 환경의 성능을 반영한다.\n\nVera Rubin NVL72는 Blackwell 아키텍처의 후속 제품으로, NVLink Switch 기술을 활용해 72개의 GPU를 단일 거대 가속기로 긴밀하게 결합한다. 이번 첫 제출로 정상에 오른 것은 NVIDIA의 추론 분야 세대 도약이 문서상의 사양에서 측정된 현실로 전환되었음을 의미한다.\n\n

심층

분석\n\n이러한 선도적 성능은 단순한 원시 연산 능력의 결과가 아니라 시스템 수준의 공동 설계에서 비롯된다. 추론 경제성은 시스템 성능, 인프라 확장 효율성, 지속적인 소프트웨어 최적화라는 세 가지 핵심 지렛대에 의해 결정된다. Vera Rubin은 메모리 대역폭과 용량을 높여 700억 파라미터 모델을 단일 GPU HBM에 상주시켜 칩 간 병목을 없앤다. 대형 모델은 NVLink 도메인으로 72 GPU를 통합 메모리로 묶고 5세대 NVSwitch로 텐서·파이프라인 병렬을 더 효율화한다.\n\n확장 효율성은 주목할 만한 지표로, 테스트 데이터는 GPU 수가 증가함에 따라 처리량이 거의 선형적으로 증가함을 보여준다. 이는 클라우드 제공업체가 하드웨어를 추가할 때 한계 수익 체감을 겪지 않으며, 단위 컴퓨팅 비용이 지속적으로 하락함을 의미한다. TensorRT-LLM은 Vera Rubin의 새 명령어 세트와 희소 컴퓨팅 유닛에 최적화됐다. FP8 양자화와 동적 배치로 하드웨어 활용을 극대화했고, MLPerf 규칙 하에 검증됐다.\n\n비즈니스 관점에서, 더 높은 시스템 처리량은 더 많은 토큰 생성 능력으로 직접 이어진다. 토큰당 과금하는 API 서비스의 경우, 동일한 하드웨어 투자로 더 높은 수익 흐름을 창출할 수 있다. 선형 확장 특성은 인프라 투자 수익률 모델을 더 명확하고 통제 가능하게 만들어, AI 추론의 배포 경제성을 근본적으로 변화시킨다. 이는 단순한 성능 승리가 아니라, 업계 전반의 조달 결정에 영향을 미칠 구조적 비용 변화를 나타낸다.\n\n

산업

영향\n\nVera Rubin NVL72의 압도적인 MLPerf 성능은 AI 추론 시장의 경쟁 구도를 재편할 것이다. 클라우드 사업자는 이 플랫폼으로 비용 효율적 추론 서비스를 제공해 가격 민감 고객을 유치하고 대규모 AI 네이티브 앱을 지원할 수 있다. 모델 개발자와 스타트업은 추론 비용 하락으로 복잡한 추론 체인, 긴 컨텍스트, 실시간 멀티모달을 구현해 제품 경험을 혁신할 수 있다.\n\n경쟁사인 AMD MI 시리즈, Intel Gaudi, 맞춤형 ASIC은 가성비로 NVIDIA를 추격해왔다. Vera Rubin은 성능 기준을 대폭 높이고 시스템 통합과 소프트웨어 생태계로 단기 추격을 어렵게 한다. NVLink 도메인은 거대 논리 GPU를 구성해 분산 스케줄링을 없애 운영을 간소화하고 플랫폼 고착성을 높인다. 다만 MLPerf는 최적화된 상한 성능이므로, 이종 칩이 특정 워크로드의 에너지 효율과 TCO에서 차별화할 여지가 있고, 엣지 시장은 기술 전이 속도가 관건이다.\n\n

전망\n\n앞으로

Vera Rubin의 대량 생산과 클라우드 인스턴스 제공은 2027년으로 예상되며, 이는 새로운 인프라 업그레이드 주기를 촉발할 것이다. NVIDIA가 Vera Rubin 기반 추론 전용 카드를 내놓아 데이터센터부터 엣지까지 유연한 배포를 제공할지가 관전 포인트다. TensorRT-LLM의 MoE·상태 공간 모델 지원은 최신 모델 추론 효율을 좌우할 것이다.\n\n경쟁사들의 대응도 마찬가지로 중요하다. AMD의 MI400, Intel의 Falcon Shores 등 경쟁 칩이 2027년경 실측 데이터를 제시해야 시장의 독점 구도가 다각화될지 판가름날 것이다. AI가 추론 중심으로 전환되며 추론 하드웨어 시장이 훈련 시장을 추월, 컴퓨팅 산업의 핵심으로 부상하고 있다. Vera Rubin NVL72를 통해 NVIDIA는 다시 한번 경쟁 우위가 단일 칩 성능에서 시스템, 인터커넥트, 소프트웨어의 풀스택 통합으로 확장됨을 입증했다. 이 선순환이 시작되면 AI 추론은 고처리량, 저비용, 간편한 배포의 새 국면에 접어들며, 혁신의 초점은 '실행 가능성'에서 '경제적 실행'으로 옮겨갈 것이다.

Sources