NVIDIA Vera Rubin NVL72 domine MLPerf Inference v6.1
Les performances du système, la mise à l'échelle efficace de l'infrastructure et l'optimisation logicielle continue sont des leviers clés qui déterminent l'économie de l'inférence IA. Des performances système plus élevées signifient plus de jetons générés, ce qui se traduit par des revenus plus élevés. Une mise à l'échelle efficace signifie que le débit augmente proportionnellement à l'ajout de matériel.
Contexte
Le système NVIDIA Vera Rubin NVL72 a dominé MLPerf Inference v6.1 dès sa première apparition, atteignant des débits de plusieurs dizaines de milliers de jetons par seconde sur des modèles comme GPT-J. Ce benchmark rigoureux mesure les performances réelles d'inférence. Le résultat ne provient pas de la puissance brute d'une seule puce, mais de l'intégration de 72 GPU via des interconnexions rapides et une optimisation logicielle complète, marquant une avancée majeure pour l'inférence à grande échelle.
Cette performance souligne un changement : les attributs système — bande passante d'interconnexion, mémoire unifiée et maturité logicielle — sont désormais décisifs. La mise à l'échelle quasi linéaire observée valide l'approche de NVIDIA : les conceptions en rack offrent des gains de débit proportionnels sans explosion des coûts. Vera Rubin devient ainsi la référence pour l'économie de l'inférence, où chaque investissement matériel se traduit en revenus accrus.
Analyse approfondie
Au niveau silicium, Vera Rubin introduit un multiprocesseur repensé pour le calcul basse précision, avec accélération matérielle des multiplications matricielles et de l'attention. La mémoire HBM à haute bande passante et un cache optimisé réduisent le goulot d'étranglement mémoire. Mais le différenciateur clé est le tissu NVLink et NVSwitch à l'échelle du rack, unifiant les 72 GPU en un pool mémoire. Cela permet une inférence parallèle au sein d'un seul système, réduisant drastiquement les frais de communication et offrant une mise à l'échelle quasi linéaire du débit.
Côté logiciel, TensorRT a été optimisé pour Vera Rubin avec fusion d'opérateurs, optimisation de graphes et stratégies mémoire avancées. La quantification réduit la précision sans perte de qualité, maximisant l'utilisation du matériel. Cette synergie entre silicium, interconnexion et logiciel a permis de dominer MLPerf et d'établir un nouveau standard de débit.
Impact sur l'industrie
Pour les fournisseurs cloud, le débit élevé et la mise à l'échelle linéaire réduisent le coût par jeton. Dans un marché de guerre des prix, cet avantage est critique. AWS, Azure et Google Cloud devraient accélérer le déploiement d'instances Vera Rubin pour attirer les développeurs. Un seul système NVL72 remplace plusieurs nœuds, réduisant les dépenses d'investissement et d'exploitation.
Pour les entreprises, la baisse des coûts facilite le déploiement d'applications comme le support client en temps réel ou la génération de code. Face à la concurrence, l'Instinct MI300X d'AMD rattrape son retard sur les spécifications mais peine sur la mise à l'échelle système et la maturité logicielle. Le Gaudi 3 d'Intel vise les déploiements économiques mais ne rivalise pas en performance absolue. Les ASIC personnalisés (TPU, Trainium) excellent sur des charges spécifiques mais manquent de l'écosystème CUDA. Vera Rubin NVL72 renforce la domination de NVIDIA.
Perspectives
Le NVL72 n'est qu'une étape. L'architecture Blackwell Ultra à venir devrait pousser la mise à l'échelle encore plus loin. Une variante Vera Rubin optimisée pour les coûts pourrait émerger, et TensorRT s'adaptera mieux aux modèles MoE.
AMD (MI400) et Intel (Falcon Shores) doivent prouver des gains système réels. La baisse continue des coûts d'inférence stimulera la demande d'IA, créant un cycle vertueux. Les scores MLPerf sont le baromètre de cette économie, et NVIDIA a placé la barre très haut.
Sources
FAQ
Qu'a accompli le NVIDIA Vera Rubin NVL72 lors de MLPerf Inference v6.1 ?
Il a fait ses débuts en tête, générant des dizaines de milliers de jetons par seconde sur des LLM comme GPT-J, établissant de nouveaux records de performance et d'efficacité.
Pourquoi est-ce important pour l'économie de l'inférence IA ?
Cela prouve que la performance système, la mise à l'échelle efficace et l'optimisation logicielle réduisent le coût par jeton et augmentent les revenus pour les fournisseurs cloud et les entreprises.
Que faut-il surveiller après ces débuts ?
Les futures itérations comme Blackwell Ultra, les variantes à coût optimisé, et la réponse des concurrents comme AMD et Intel en matière de performance au niveau système.