NVIDIA DGX Spark 64 Go : un nouveau ticket d'entrée pour l'IA locale, extensible à deux machines
NVIDIA annonce une configuration DGX Spark à 64 Go de mémoire unifiée, disponible le 23 octobre chez Acer, ASUS, Dell, Gigabyte, HP et MSI, à partir de 4 999 dollars. Elle conserve la puce GB10 Grace Blackwell, DGX OS et la pile logicielle complète, et exécute localement des modèles jusqu'à 100 milliards de paramètres. Deux unités peuvent être reliées via NVIDIA Sync Cluster Assistant pour mutualiser 128 Go et viser 200 milliards de paramètres. Dans le test Qwen 3.8 27B de NVIDIA, deux machines en cluster atteignent jusqu'à 1,7 fois les performances d'une seule.
Le 2 octobre 2026, NVIDIA a annoncé sur son blog une nouvelle configuration du DGX Spark avec 64 Go de mémoire unifiée. Elle sera disponible le vendredi 23 octobre chez six partenaires constructeurs (Acer, ASUS, Dell, Gigabyte, HP et MSI), à partir de 4 999 dollars. Le même article présente NVIDIA Sync Cluster Assistant, un outil pour relier deux DGX Spark en cluster. Le raisonnement de NVIDIA est simple : à mesure que les agents d'IA passent de l'expérience au développement quotidien, des modèles ouverts de plus en plus capables rétrécissent pour tenir sur davantage d'appareils, et il y a donc plus à exécuter en local. Ce qui a été annoncé Le DGX Spark réunit en une seule machine le calcul NVIDIA Grace Blackwell, la mémoire unifiée, le réseau NVIDIA ConnectX-7 et une pile logicielle d'IA accélérée par CUDA. NVIDIA le présente comme une plateforme locale complète pour les agents, l'inférence, le fine-tuning, la science des données et le développement en périphérie. La nouvelle configuration 64 Go n'est vendue que par les partenaires constructeurs. Elle conserve la puce GB10 Grace Blackwell, DGX OS et la pile logicielle NVIDIA AI complète, comme le modèle 128 Go. Selon NVIDIA, elle prend en charge des modèles jusqu'à 100 milliards de paramètres, ainsi que les applications agentiques construites dessus, entièrement sur l'appareil et sans dépendance au cloud.
Le logiciel prêt à l'emploi est l'autre argument. NVIDIA Agent Toolkit, les bibliothèques CUDA-X AI, les modèles ouverts Nemotron, ainsi que des environnements d'exécution courants comme Ollama, vLLM et PyTorch avec CUDA sont pris en charge dès le premier jour. NVIDIA affirme qu'il suffit de quelques minutes entre la mise sous tension et l'exécution d'un modèle. Blender fait partie des premiers grands éditeurs d'applications créatives à prendre en charge la plateforme, avec un installateur prêt à télécharger annoncé prochainement. Le fonctionnement du cluster à deux unités Chaque DGX Spark est livré avec une carte réseau ConnectX-7 intégrée. Deux unités peuvent être reliées directement par un câble QSFP. Leur mémoire est alors mutualisée à 128 Go, la prise en charge monte jusqu'à 200 milliards de paramètres, la bande passante mémoire double et les performances progressent jusqu'à 1,7 fois. L'article décrit aussi cette liaison comme un réseau 200 GbE. Ce qui abaisse vraiment la barrière, c'est Cluster Assistant dans l'application NVIDIA Sync. Il détecte les unités connectées, valide la configuration des appareils et configure le réseau ConnectX-7, de sorte que le développeur n'a pas à régler le réseau et les nœuds à la main. Chaque nœud exécute la même pile logicielle NVIDIA : l'environnement n'a pas besoin d'être reconfiguré quand on passe d'une unité à deux. Une précaution : le chiffre de 1,7 fois provient du test Qwen 3.8 27B de NVIDIA lui-même et il est donné comme un maximum. Il reste sous le 2 fois théorique, ce qui suggère un coût de communication entre les nœuds. C'est notre lecture, pas une conclusion de l'article.
Changements de flux de travail : Model Launcher et trois cas d'usage L'article annonce aussi NVIDIA Sync Model Launcher, prévu pour la fin du mois. En quelques clics, les développeurs peuvent télécharger et lancer Qwen3.8 27B sur un seul DGX Spark ou sur un cluster. NVIDIA Sync configure le modèle pour qu'il tourne sur les appareils connectés et le rend accessible depuis l'ordinateur portable de l'utilisateur. Le lanceur configure aussi OpenCode pour utiliser ce modèle, afin de commencer à coder dans le navigateur. NVIDIA donne trois exemples. Premier exemple : faire tourner un agent d'IA en continu. Un agent de code ou de recherche reste actif sur le DGX Spark, prêt à relire du code, analyser des documents ou exécuter des tâches en plusieurs étapes. Un cluster ajoute de la capacité pour des modèles plus grands, des contextes plus longs ou plusieurs agents simultanés. Deuxième exemple : alimenter des applications d'IA sur le PC de tous les jours. Un modèle de langage ou d'image tourne sur le DGX Spark pendant qu'un agent ou une application créative s'exécute sur un portable ou un fixe, et l'inférence ne mobilise pas le PC. Troisième exemple : passer à l'échelle quand le travail grandit. Quand une tâche dépasse une unité, deux machines de 64 Go reliées par le réseau 200 GbE mutualisent leur mémoire à 128 Go, et le même flux de travail s'exécute sans reconfigurer l'environnement logiciel.
Ce que cela change pour les développeurs et le secteur Ce qui suit est notre analyse, pas la formulation de NVIDIA. D'abord, le prix. Un ticket d'entrée à 4 999 dollars rend l'accès plus facile aux développeurs individuels, aux chercheurs et aux petites équipes, qui peuvent acheter une unité maintenant et une seconde plus tard. L'article ne donne pas de prix pour le modèle 128 Go : l'écart entre les deux ne peut donc pas se lire dans la source. Ensuite, la confidentialité et le coût. Exécuter en local signifie que les modèles et les données privées ne quittent pas l'appareil, et qu'il n'y a pas d'instance cloud à louer pour chaque tâche. Cela séduit les équipes qui manipulent du code et des documents sensibles. Enfin, l'attraction de l'écosystème. En livrant la boîte à outils d'agents, les bibliothèques CUDA-X et les modèles Nemotron de NVIDIA tout en prenant en charge des environnements ouverts comme Ollama et vLLM, NVIDIA réduit le coût de démarrage et renforce en même temps l'écosystème CUDA. Plusieurs réserves s'imposent. La capacité mémoire détermine la taille du modèle et la longueur du contexte qu'une unité peut contenir. L'article annonce jusqu'à 100 milliards de paramètres, sans préciser le niveau de quantification ni la longueur de contexte qui sous-tendent cette affirmation. Le résultat de 1,7 fois porte sur un seul modèle de 27 milliards de paramètres, et d'autres modèles ou charges pourraient évoluer autrement. Model Launcher et l'installateur Blender sont encore annoncés comme prochains : l'expérience réelle après le lancement reste à vérifier. Pour démarrer, et perspectives Les étapes proposées par NVIDIA sont courtes. Télécharger un framework d'inférence pris en charge : llama.cpp, Ollama, vLLM ou LM Studio. Télécharger le modèle local recommandé pour son flux de travail. Pour passer à deux unités, les relier par leurs ports ConnectX-7 et lancer NVIDIA Sync Cluster Assistant, qui configure le réseau et répartit les charges automatiquement. Pour les guides d'IA agentique, les pages NemoClaw, OpenClaw, Hermes Agent et OpenShell de build.nvidia.com sont à consulter. Le signal de ce lancement est net. L'IA locale se présente de moins en moins comme un jouet d'amateur et de plus en plus comme une plateforme de développement avec un chemin de croissance défini : la capacité d'une unité plus un cluster de deux permettent de commencer petit puis de grandir. À surveiller ensuite : le prix réel et la disponibilité après le 23 octobre, les mesures indépendantes de tiers, et la livraison de Model Launcher à la fin du mois. Si ces éléments tiennent, le DGX Spark 64 Go pourrait devenir un point de départ courant pour le développement d'agents en local.