NVIDIA Vera Rubin NVL72, MLPerf Inference v6.1 데뷔에서 최고 성능 달성

Published · AI Daily — AI-assisted deep research, methodology & disclosure

시스템 성능, 효율적인 인프라 확장, 지속적인 소프트웨어 최적화는 AI 추론 경제성을 결정하는 핵심 요소입니다. 시스템 성능이 높을수록 더 많은 토큰이 생성되어 수익이 증가합니다. 효율적인 확장은 하드웨어 추가에 비례하여 처리량이 증가하는 것을 의미합니다.

배경

NVIDIA Vera Rubin NVL72 시스템이 MLPerf Inference v6.1 벤치마크에 처음 등장하여 여러 데이터센터 추론 워크로드에서 최고 성능을 기록했습니다. MLPerf는 AI 하드웨어와 소프트웨어의 종합 능력을 측정하는 가장 엄격한 기준으로, 실제 서비스 환경에서의 처리량과 지연 시간을 직접 평가합니다. NVL72는 GPT-J와 같은 대형 언어 모델에서 초당 수만 토큰의 생성 속도를 달성하며 이전 기록을 크게 경신했고, 우수한 에너지 효율도 유지했습니다.

이 결과는 단순히 단일 칩의 연산 능력에 의존한 것이 아니라, 72개 GPU를 고속 인터커넥트로 긴밀하게 통합하고 전 스택 소프트웨어 최적화를 통해 얻어낸 것입니다. 이는 초대규모 추론 시스템 설계에서 중요한 전환점을 의미합니다. 시스템 수준의 특성, 즉 인터커넥트 대역폭, 메모리 풀링, 소프트웨어 성숙도가 이제 결정적 성능 요소로 부상했으며, GPU 수 증가에 따른 거의 선형적인 확장은 랙 규모 설계가 비용 급증 없이 비례적인 처리량 향상을 제공할 수 있음을 입증합니다. 이로써 Vera Rubin은 추론 경제성의 새로운 기준으로 자리매김했으며, 하드웨어 투자가 더 많은 토큰 생성과 수익으로 직결됩니다.

심층 분석

실리콘 수준에서 Vera Rubin 아키텍처는 저정밀도 연산 밀도를 높인 재설계된 스트리밍 멀티프로세서를 도입했으며, 트랜스포머 추론에서 주를 이루는 행렬 곱셈과 어텐션 메커니즘을 하드웨어 가속합니다. 메모리 서브시스템은 더 높은 대역폭의 HBM과 최적화된 캐시 계층을 사용하여 메모리 월 병목 현상을 완화합니다. 그러나 진정한 차별화 요소는 72개 GPU를 통합 메모리 풀로 연결하는 랙 규모의 NVLink 및 NVSwitch 패브릭입니다. 이를 통해 모델 병렬 추론이 단일 시스템 내에서 완전히 실행될 수 있어 텐서 병렬 처리의 통신 오버헤드가 크게 줄어듭니다. 그 결과 GPU 수에 비례하는 거의 선형적인 처리량 확장이 가능해지며, 이는 추론 경제성에서 '효율적 확장'의 전형적인 사례입니다.

소프트웨어 측면에서는 NVIDIA의 TensorRT 추론 엔진이 Vera Rubin에 맞춰 심층 튜닝되었습니다. 공격적인 그래프 최적화, 연산자 융합, 메모리 할당 전략을 통해 데이터 이동을 최소화했으며, 고급 양자화 기술로 정확도 손실 없이 정밀도를 낮춰 하드웨어 활용도를 극대화했습니다. 새로운 연산 실리콘, 고대역폭 통합 메모리 패브릭, 최적화된 소프트웨어 스택이 결합되어 MLPerf에서 최고 성능을 달성한 시스템 성능을 제공합니다. 이 시너지가 초당 수만 토큰의 처리량으로 이어지며 추론 처리량의 새로운 기준을 세웠습니다.

산업 영향

클라우드 제공업체에게 NVL72의 높은 처리량과 선형적 확장은 토큰당 추론 비용을 직접적으로 낮춥니다. 생성형 AI 서비스의 가격 경쟁이 치열한 시장에서 이러한 비용 우위는 매우 중요합니다. 아마존 웹 서비스, 마이크로소프트 애저, 구글 클라우드와 같은 하이퍼스케일러들은 개발자를 유치하고 공격적인 가격을 제시하기 위해 Vera Rubin 인스턴스의 도입을 가속화할 가능성이 높습니다. 단일 NVL72 시스템은 이전에 여러 개별 노드가 필요했던 추론 볼륨을 처리할 수 있어 자본 및 운영 비용을 절감하고, 제공업체가 고객에게 비용 절감 혜택을 전달할 수 있게 합니다.

기업에게는 추론 비용 하락이 실시간 고객 지원, 코드 생성, 콘텐츠 제작과 같은 애플리케이션의 프로덕션 배포 장벽을 낮춥니다. NVL72의 성능은 인프라 지출을 비례적으로 늘리지 않으면서 더 많은 동시 사용자를 지원할 수 있음을 의미합니다. 경쟁 구도 측면에서 AMD의 Instinct MI300X는 단일 칩 사양에서는 격차를 좁혔지만 시스템 수준 확장과 소프트웨어 성숙도에서 뒤처집니다. 인텔의 Gaudi 3는 비용 효율적인 배포를 목표로 하지만 절대 성능에서는 경쟁할 수 없습니다. 구글의 TPU나 아마존의 Trainium/Inferentia와 같은 커스텀 ASIC은 특정 워크로드에 강점을 보이지만 CUDA 생태계의 폭넓은 지원에는 미치지 못합니다. Vera Rubin NVL72의 MLPerf 결과는 NVIDIA의 지배력을 강화하고 경쟁사의 기준을 높였습니다.

전망

Vera Rubin NVL72의 데뷔는 NVIDIA 추론 로드맵의 한 이정표입니다. 곧 출시될 Blackwell Ultra 아키텍처는 더 큰 GPU 클러스터나 고급 토폴로지를 지원하며 시스템 확장을 더욱 추진할 것으로 예상됩니다. 더 넓은 시장을 겨냥한 비용 최적화 Vera Rubin 변종이 등장할 수 있으며, TensorRT 개선은 독특한 스케줄링 및 메모리 문제를 가진 MoE 모델을 더 잘 지원할 것입니다.

AMD의 차세대 MI400과 인텔의 Falcon Shores는 단순한 사양 발표가 아닌 실제 시스템 수준의 성능 향상을 입증해야 도전할 수 있습니다. 커스텀 칩은 CUDA 생태계의 관성에 직면해 있습니다. 추론 비용이 계속 하락함에 따라 AI 애플리케이션 수요가 급증하여 인프라 수요를 촉진하는 선순환이 형성될 것입니다. MLPerf 점수는 이 컴퓨팅 경제의 바로미터가 되었으며, Vera Rubin NVL72와 함께 NVIDIA는 향후 수년간 투자와 설계 결정을 좌우할 높은 기준을 설정했습니다.

Sources

FAQ

NVIDIA Vera Rubin NVL72가 MLPerf Inference v6.1에서 어떤 성과를 거두었나요?

첫 등장에서 최고 성능을 기록하며 GPT-J 등 대규모 언어 모델에서 초당 수만 토큰의 생성 속도를 달성, 기존 기록을 크게 경신하고 높은 에너지 효율을 보여주었습니다.

이 결과가 AI 추론 경제성에 중요한 이유는 무엇인가요?

시스템 성능, 효율적 확장, 소프트웨어 최적화가 AI 추론 경제성을 좌우하는 핵심 요소이며, 토큰당 비용을 낮추고 수익을 높일 수 있음을 입증했기 때문입니다.

앞으로 주목해야 할 점은 무엇인가요?

Blackwell Ultra 등 후속 아키텍처, 비용 최적화 칩 출시 가능성, AMD와 Intel 등 경쟁사의 시스템 수준 성능 대응이 주목됩니다.