NVIDIA Vera Rubin NVL72がMLPerf Inference v6.1でトップ性能を達成
システム性能、効率的なインフラスケーリング、継続的なソフトウェア最適化は、AI推論の経済性を左右する重要な要素です。システム性能が高いほど、より多くのトークンが生成され、収益が向上します。効率的なスケーリングとは、ハードウェアの追加に比例してスループットが向上することを意味します。
背景と概要
NVIDIAのVera Rubin NVL72システムがMLPerf Inference v6.1に初登場し、複数のデータセンター推論ワークロードでトップ性能を達成しました。MLPerfはAIハードウェアとソフトウェアの総合能力を測る最も厳格なベンチマークであり、実際のサービス条件下でのスループットとレイテンシーを直接測定します。NVL72はGPT-Jのような大規模言語モデルで毎秒数万トークンを超える生成速度を記録し、従来の記録を大幅に更新するとともに、高いエネルギー効率を維持しました。この結果は単一チップの計算力に頼るものではなく、72基のGPUを高速インターコネクトで緊密に統合し、フルスタックのソフトウェア最適化を施したことによるものです。
今回の成果は、システムレベルの特性、すなわちインターコネクト帯域幅、メモリプーリング、ソフトウェアの成熟度が決定的な性能要因となっていることを示しています。GPU数増加に伴いほぼ線形のスケーリングが観測されたことは、ラックスケール設計がコストを急増させることなく比例的なスループット向上をもたらすというNVIDIAの賭けを裏付けています。このデビューにより、Vera Rubinは推論経済性の新たな基準として位置づけられ、ハードウェア投資が直接トークン生成量と収益増加に結びつくことを実証しました。
深掘り分析
シリコンレベルでは、Vera Rubinアーキテクチャは再設計されたストリーミングマルチプロセッサを導入し、低精度計算密度を高め、Transformer推論で支配的な行列乗算とアテンション機構をハードウェア加速しています。メモリサブシステムはより高帯域幅のHBMと最適化されたキャッシュ階層を採用し、メモリウォールのボトルネックを緩和します。しかし、真の差別化要因は、72基のGPUすべてを統合メモリプールに接続するラックスケールのNVLinkおよびNVSwitchファブリックです。これにより、モデル並列推論を単一システム内で完結させ、テンソル並列の通信オーバーヘッドを大幅に削減します。その結果、GPU数に応じたほぼ線形のスループットスケーリングが実現され、これは推論経済性における「効率的なスケーリング」の典型例です。
ソフトウェア面では、NVIDIAのTensorRT推論エンジンがVera Rubin向けに深くチューニングされ、積極的なグラフ最適化、オペレーター融合、メモリ割り当て戦略によりデータ移動を最小化しています。高度な量子化は、モデルの精度を損なうことなく計算精度を低下させ、ハードウェアのピーク活用を可能にします。新しい計算シリコン、高帯域幅の統合メモリファブリック、最適化されたソフトウェアスタックの相乗効果が、MLPerfでトップとなったシステム性能を生み出し、観測された毎秒数万トークンというスループットを達成しました。
業界への影響
クラウドプロバイダーにとって、NVL72の高スループットとほぼ線形のスケーリングは、トークンあたりの推論コストを直接的に低減します。生成AIサービスが価格競争を繰り広げる市場において、このコスト優位性は極めて重要です。Amazon Web Services、Microsoft Azure、Google Cloudといったハイパースケーラーは、Vera Rubinインスタンスの展開を加速し、開発者を惹きつけて積極的な価格設定を提供する可能性が高いです。単一のNVL72システムは、従来複数の個別ノードを必要とした推論ボリュームを処理できるため、資本的支出と運営支出の両方を削減し、プロバイダーはその節約分を顧客に還元できます。
企業にとっては、推論コストの低下がリアルタイムカスタマーサポート、コード生成、コンテンツ作成といったアプリケーションの本番展開への障壁を下げます。NVL72の性能は、インフラ支出を比例的に増やすことなく、より多くの同時ユーザーを可能にします。競合他社を見ると、AMDのInstinct MI300Xは単一チップのスペックでは迫るものの、システムレベルのスケーリングとソフトウェア成熟度で遅れをとっています。IntelのGaudi 3はコスト重視の展開をターゲットとしますが、絶対性能では及びません。GoogleのTPUやAmazonのTrainium/InferentiaといったカスタムASICは特定のワークロードで優れていますが、CUDAエコシステムの広がりには欠けます。Vera Rubin NVL72のMLPerfでの結果は、NVIDIAの優位性を強化し、競合他社にとってのハードルを引き上げました。
今後の展望
Vera Rubin NVL72のデビューは、NVIDIAの推論ロードマップにおける一つのマイルストーンです。次期Blackwell Ultraアーキテクチャでは、システムスケーリングがさらに進み、より大規模なGPUクラスターや高度なトポロジーがサポートされる見込みです。より幅広い市場向けにコスト最適化されたVera Rubinの派生モデルが登場する可能性や、TensorRTの強化により、独自のスケジューリングとメモリ課題を持つMixture-of-Experts(MoE)モデルのサポートが向上するでしょう。
AMDの次世代MI400やIntelのFalcon Shoresは、紙上のスペックではなく、実際のシステムレベルの向上を示さなければ対抗できません。カスタムチップはCUDAエコシステムの慣性に直面します。推論コストが低下し続けるにつれて、AIアプリケーションの需要が急増し、インフラ需要を喚起する好循環が生まれます。MLPerfスコアはこの計算経済のバロメーターとなっており、Vera Rubin NVL72によってNVIDIAは今後数年間の投資と設計判断を形作る高圧的な前線を設定しました。
Sources
FAQ
NVIDIA Vera Rubin NVL72はMLPerf Inference v6.1でどのような成果を上げましたか?
初登場でトップ性能を達成し、GPT-Jなどの大規模言語モデルで毎秒数万トークンの生成速度を記録、従来の記録を大幅に更新し高いエネルギー効率も示しました。
この成果はAI推論の経済性にどのような影響を与えますか?
システム性能、効率的なスケーリング、ソフトウェア最適化が鍵であることを証明し、トークンあたりのコスト削減と収益向上につながります。
今後の注目点は何ですか?
Blackwell Ultraなどの後継アーキテクチャ、コスト最適化版チップの可能性、AMDやIntelなど競合他社のシステムレベル性能での対応が注目されます。