d-Matrix adopte NVIDIA NVLink Fusion pour ses déploiements XPU à l'échelle du rack

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Le fabricant de puces d'inférence IA d-Matrix a annoncé l'intégration de l'interconnexion optique NVIDIA NVLink Fusion au sein de son architecture de calcul en mémoire Corsair. Ce rapprochement permet d'atteindre une bande passante massive et une latence de l'ordre de la microseconde à l'échelle du rack, offrant une efficacité énergétique quadruplée pour l'inférence de modèles génératifs à long contexte.

Le défi de la mémoire dans l'inférence des modèles d'IA générative

L'essor fulgurant des modèles d'intelligence artificielle générative et le traitement de fenêtres de contexte atteignant plusieurs millions de jetons ont mis en lumière une contrainte physique majeure au sein des centres de données : le mur de la mémoire. Dans les architectures informatiques traditionnelles fondées sur le modèle de von Neumann, le processeur graphique conventionnel doit continuellement transférer d'immenses volumes de données entre la mémoire à haute bande passante (HBM) et les cœurs de calcul matriciel. Lors des phases de décodage autoregressif, le cache clé-valeur (KV) prend des proportions considérables, provoquant une congestion permanente des bus d'échange et réduisant drastiquement l'efficacité énergétique globale des serveurs.

Pour surmonter cette barrière fondamentale, la jeune entreprise technologique d-Matrix a conçu Corsair, une puce novatrice reposant sur le calcul numérique en mémoire (Digital In-Memory Computing, DIMC). En intégrant les opérations arithmétiques directement au sein de cellules de mémoire SRAM statique haute densité, Corsair élimine les transferts redondants entre composants distincts. Cette approche permet de réduire de manière spectaculaire la latence du premier jeton généré tout en garantissant une efficacité thermique inégalée à l'échelle de la puce individuelle.

Toutefois, la prise en charge des modèles de pointe comptant des centaines de milliards de paramètres nécessite une capacité mémoire globale dépassant largement les limites physiques d'une matrice semi-conductrice isolée. L'infrastructure exigeait donc une technologie d'interconnexion capable d'unifier ces processeurs spécialisés à l'échelle d'une baie de serveurs complète.

L'intégration de NVIDIA NVLink Fusion pour un tissu optique à ultra-faible latence

C'est dans ce contexte stratégique que d-Matrix a officialisé l'adoption de l'interconnexion optique NVIDIA NVLink Fusion sur l'ensemble de son matériel Corsair. Ce partenariat marque une étape décisive pour l'écosystème matériel en unissant une architecture de calcul novatrice à la référence industrielle des technologies de communication haute vitesse.

NVLink Fusion exploite l'optique co-packagée et la photonique sur silicium afin de contourner l'atténuation électrique inhérente aux liaisons en cuivre traditionnelles. Ce réseau optique délivre une bande passante massive tout en garantissant des temps de propagation microscopiques de l'ordre de la microseconde entre les différents nœuds d'un même rack. En intégrant directement ces liaisons au sein des cartes accélératrices Corsair, d-Matrix transforme une multitude de processeurs XPU en une entité informatique parfaitement homogène partageant un espace d'adressage virtuel commun.

Cette topologie révolutionne le traitement des contextes longs. Les immenses tables de cache KV peuvent être distribuées de manière fluide et dynamique à travers l'ensemble des modules de calcul en mémoire, sans que les temps de transfert réseau ne viennent dégrader les flux interactifs des utilisateurs.

Efficacité énergétique quadruplée et perspectives d'infrastructure durable

Les résultats expérimentaux menés conjointement par d-Matrix et NVIDIA attestent d'une avancée spectaculaire : le déploiement en rack des solutions Corsair sous NVLink Fusion assure une efficacité énergétique multipliée par quatre par rapport aux infrastructures de calcul accéléré classiques. Le nombre de jetons produits par watt consommé atteint des records inédits, offrant aux exploitants de centres de données une réponse concrète aux contraintes d'alimentation électrique et de dissipation thermique.

Cette réalisation consacre le principe du calcul désagrégé dans les environnements de production d'entreprise. Plutôt que de saturer les nœuds de calcul avec des GPU généralistes extrêmement énergivores, les opérateurs peuvent désormais adjoindre des îlots spécialisés dans l'inférence en mémoire reliés par un réseau optique unifié. L'alliance entre d-Matrix et NVIDIA démontre que l'avenir des architectures d'intelligence artificielle réside dans la synergie étroite entre spécialisation silicium et interconnexion photonique de pointe.

Sources

FAQ

Quel est l'objectif clé de ce partenariat ?

d-Matrix intègre l'interconnexion optique NVLink Fusion de NVIDIA dans ses puces Corsair afin de créer des clusters XPU à l'échelle du rack à ultra-faible latence.

Quels avantages offre le calcul en mémoire ?

En calculant directement au cœur de la mémoire, il élimine le goulot d'étranglement de transfert de données et multiplie par quatre l'efficacité énergétique en inférence.

Quel rôle joue NVLink Fusion dans les baies ?

Il offre une interconnexion optique affichant une latence de l'ordre de la microseconde, unifiant l'espace mémoire pour répartir les immenses caches de contexte KV.