NVIDIA Vera Rubin NVL72 domine MLPerf Inference v6.1
Les performances du système, la mise à l'échelle efficace de l'infrastructure et l'optimisation logicielle continue sont des leviers clés qui déterminent l'économie de l'inférence IA. Des performances système plus élevées signifient plus de jetons générés, ce qui se traduit par des revenus plus élevés. Une mise à l'échelle efficace signifie que le débit augmente proportionnellement à mesure que le matériel s'ajoute.
Contexte
Le 16 septembre 2026, NVIDIA a dévoilé les résultats de MLPerf Inference v6.1, marquant l'entrée fracassante de son système Vera Rubin NVL72. Cette plateforme à 72 GPU a immédiatement dominé les tests d'inférence pour les grands modèles de langage comme Llama 2 70B et GPT-J, tant en débit qu'en latence serveur. MLPerf est la référence de performance IA, et Vera Rubin, successeur de l'architecture Blackwell, utilise NVLink Switch pour unifier 72 GPU en un accélérateur géant. Ce résultat confirme le saut générationnel de NVIDIA, passant des promesses à la réalité mesurée.
L'économie de l'inférence repose sur trois piliers : performance système, mise à l'échelle efficace et optimisation logicielle. L'architecture Vera Rubin accroît la bande passante mémoire, permettant à un modèle de 70 milliards de paramètres de tenir dans la mémoire HBM d'un seul GPU. Pour les modèles plus grands, le domaine NVLink partage la mémoire entre 72 GPU via un NVSwitch de cinquième génération, rendant le parallélisme plus efficient.
Analyse approfondie
Les tests révèlent une croissance quasi linéaire du débit avec l'ajout de GPU, évitant les rendements décroissants. TensorRT-LLM a été optimisé pour le nouveau jeu d'instructions et les unités de calcul éparses de Vera Rubin, avec quantification FP8 et traitement par lots dynamiques validés par MLPerf. Ces avancées logicielles maximisent l'utilisation matérielle.
Commercialement, un débit supérieur génère plus de jetons, augmentant les revenus des API facturées à l'usage. La scalabilité linéaire simplifie les modèles de retour sur investissement, transformant l'économie du déploiement de l'inférence.
Impact sur l'industrie
Cette performance redéfinit le paysage concurrentiel. Les fournisseurs cloud peuvent offrir des services d'inférence plus rentables, attirant les entreprises et soutenant des applications IA à grande échelle. Pour les startups, la baisse des coûts débloque des cas d'usage complexes comme les interactions multimodales en temps réel.
Face à AMD, Intel et aux ASIC, Vera Rubin élève la barre grâce à son intégration système et son écosystème logiciel mature. Le domaine NVLink simplifie l'inférence des grands modèles en éliminant la planification multi-nœuds, renforçant la dépendance à la plateforme NVIDIA. Toutefois, les résultats MLPerf reflètent un optimum optimisé ; des puces hétérogènes pourraient se différencier sur l'efficacité énergétique ou le coût total pour des charges spécifiques.
Perspectives
La production en volume et les instances cloud sont prévues pour 2027, lançant un nouveau cycle d'infrastructure. NVIDIA pourrait décliner Vera Rubin en carte d'inférence dédiée pour la périphérie. L'adaptation de TensorRT-LLM aux architectures émergentes (mélanges d'experts, modèles d'état) sera déterminante. Les réponses d'AMD (MI400), Intel (Falcon Shores) et des clouds en 2027 décideront si le marché reste concentré ou se diversifie.
Avec le basculement de l'IA vers l'inférence, le matériel d'inférence devient le cœur de la chaîne de valeur. Vera Rubin NVL72 illustre l'avantage full-stack de NVIDIA, de la puce au logiciel, promettant une inférence plus rapide, moins chère et plus simple, et déplaçant l'innovation vers l'efficacité économique.