NVIDIA DGX Spark 64GB: Neuer Einstieg in lokale KI, mit Zwei-Geräte-Cluster erweiterbar

Published · AI Daily — AI-assisted deep research, methodology & disclosure

NVIDIA stellt eine DGX-Spark-Variante mit 64 GB Unified Memory vor. Sie erscheint am 23. Oktober bei Acer, ASUS, Dell, Gigabyte, HP und MSI, ab 4.999 US-Dollar. Sie behält den GB10 Grace Blackwell Superchip, DGX OS und den vollen KI-Software-Stack und führt Modelle mit bis zu 100 Milliarden Parametern komplett lokal aus. Zwei Geräte lassen sich über NVIDIA Sync Cluster Assistant koppeln: 128 GB gemeinsamer Speicher, bis zu 200 Milliarden Parameter. Im Qwen-3.8-27B-Test von NVIDIA erreichen zwei Geräte bis zum 1,7-Fachen eines einzelnen.

Am 2. Oktober 2026 hat NVIDIA in seinem Blog eine neue DGX-Spark-Konfiguration mit 64 GB Unified Memory angekündigt. Sie erscheint am Freitag, den 23. Oktober, bei sechs Herstellerpartnern (Acer, ASUS, Dell, Gigabyte, HP und MSI), ab 4.999 US-Dollar. Derselbe Beitrag stellt NVIDIA Sync Cluster Assistant vor, mit dem sich zwei DGX-Spark-Geräte zu einem Cluster verbinden lassen. NVIDIAs Argument ist einfach: Während KI-Agenten von Experimenten in die tägliche Entwicklung wandern, schrumpfen immer leistungsfähigere offene Modelle so weit, dass sie auf mehr Geräten laufen. Entwickler können also mehr lokal betreiben. Was angekündigt wurde Der DGX Spark vereint NVIDIA Grace Blackwell, Unified Memory, NVIDIA ConnectX-7 Networking und einen CUDA-beschleunigten KI-Software-Stack in einem System. NVIDIA beschreibt ihn als vollständige lokale Plattform für Agenten, Inferenz, Fine-Tuning, Data Science und Edge-Entwicklung. Die neue 64-GB-Konfiguration gibt es ausschließlich über Herstellerpartner. Sie behält den GB10 Grace Blackwell Superchip, DGX OS und den vollständigen NVIDIA-AI-Software-Stack, genau wie das 128-GB-Modell. Laut NVIDIA unterstützt sie Modelle mit bis zu 100 Milliarden Parametern sowie die darauf aufbauenden agentischen Anwendungen, komplett auf dem Gerät und ohne Cloud-Abhängigkeit. Software, die sofort läuft, ist das zweite Verkaufsargument. NVIDIA Agent Toolkit, CUDA-X-AI-Bibliotheken, die offenen Nemotron-Modelle sowie gängige Laufzeitumgebungen wie Ollama, vLLM und PyTorch mit CUDA werden ab dem ersten Tag unterstützt. Nach NVIDIAs Angaben vergehen vom Einschalten bis zum laufenden Modell nur Minuten. Blender gehört zu den ersten großen Anbietern kreativer Anwendungen, die die Plattform unterstützen. Ein vorgefertigtes, herunterladbares Installationspaket soll bald erscheinen. Wie der Zwei-Geräte-Cluster funktioniert Jeder DGX Spark wird mit einer eingebauten ConnectX-7-Netzwerkkarte ausgeliefert. Zwei Geräte lassen sich direkt per QSFP-Kabel verbinden. Ihr Speicher wird auf 128 GB gebündelt, die Modellunterstützung steigt auf bis zu 200 Milliarden Parameter, die Speicherbandbreite verdoppelt sich, und die Leistung steigt um bis zu das 1,7-Fache. Der Beitrag beschreibt die Verbindung an anderer Stelle auch als 200-GbE-Fabric. Was die Hürde wirklich senkt, ist der Cluster Assistant in der NVIDIA-Sync-App. Er erkennt verbundene Geräte, prüft deren Konfiguration und richtet das ConnectX-7-Netzwerk ein. Entwickler müssen Netzwerk und Knoten also nicht von Hand konfigurieren. Jeder Knoten führt denselben NVIDIA-Software-Stack aus, deshalb muss die Umgebung beim Wechsel von einem auf zwei Geräte nicht neu eingerichtet werden. Eine Einschränkung: Der Wert von 1,7 stammt aus NVIDIAs eigenem Qwen-3.8-27B-Test und wird als Obergrenze genannt. Er liegt unter dem theoretischen Faktor 2, was auf Kosten für die Kommunikation zwischen den Knoten hindeutet. Diese Lesart ist unsere Interpretation, keine Aussage des Beitrags.

Veränderte Arbeitsabläufe: Model Launcher und drei Anwendungsfälle Der Beitrag kündigt außerdem NVIDIA Sync Model Launcher für Ende des Monats an. Mit wenigen Klicks können Entwickler Qwen3.8 27B auf einem einzelnen DGX Spark oder auf einem Cluster herunterladen und starten. NVIDIA Sync konfiguriert das Modell so, dass es über die verbundenen Geräte läuft, und macht es vom Laptop des Nutzers aus erreichbar. Der Launcher richtet zudem OpenCode für dieses Modell ein, sodass man direkt im Browser mit dem Programmieren beginnen kann. NVIDIA nennt drei Beispiele. Erstens: einen KI-Agenten rund um die Uhr laufen lassen. Ein Coding- oder Recherche-Agent bleibt auf dem DGX Spark aktiv, bereit zum Prüfen von Code, zum Analysieren von Dokumenten oder für mehrstufige Aufgaben. Ein Cluster bietet zusätzliche Kapazität für größere Modelle, längere Kontextfenster oder mehrere Agenten gleichzeitig. Zweitens: KI-Anwendungen am gewohnten PC antreiben. Ein Sprach- oder Bildgenerierungsmodell läuft auf dem DGX Spark, während ein Agent oder eine Kreativanwendung auf Laptop oder Desktop arbeitet, und die Inferenz belastet den PC nicht. Drittens: skalieren, wenn die Arbeit wächst. Wächst eine Aufgabe über ein Gerät hinaus, bündeln zwei 64-GB-Systeme über das 200-GbE-Netz ihren Speicher auf 128 GB, und derselbe Arbeitsablauf läuft ohne Neukonfiguration der Software-Umgebung.

Bedeutung für Entwickler und die Branche Was jetzt folgt, ist unsere Analyse und nicht NVIDIAs Wortlaut. Erstens der Preis. Ein Einstieg ab 4.999 Dollar erleichtert Einzelentwicklern, Forschenden und kleinen Teams den Zugang, und sie können jetzt ein Gerät kaufen und später ein zweites. Der Beitrag nennt keinen Preis für das 128-GB-Modell, der Preisabstand lässt sich der Quelle daher nicht entnehmen. Zweitens Datenschutz und Kosten. Lokaler Betrieb heißt: Modelle und private Daten verlassen das Gerät nicht, und für jede Aufgabe muss keine Cloud-Instanz gemietet werden. Das spricht Teams an, die mit sensiblem Code und Dokumenten arbeiten. Drittens die Sogwirkung des Ökosystems. Mit NVIDIAs Agent Toolkit, den CUDA-X-Bibliotheken und den Nemotron-Modellen im Lieferumfang, bei gleichzeitiger Unterstützung offener Laufzeiten wie Ollama und vLLM, senkt NVIDIA die Einstiegskosten und stärkt zugleich das CUDA-Ökosystem. Einige Vorbehalte gelten. Die Speicherkapazität bestimmt, wie groß das Modell und wie lang der Kontext auf einem Gerät sein kann. Der Beitrag nennt bis zu 100 Milliarden Parameter, sagt aber nicht, bei welcher Quantisierung und Kontextlänge das gilt. Das 1,7-Fache bezieht sich auf ein einziges 27B-Modell, andere Modelle und Lasten können anders skalieren. Model Launcher und das Blender-Installationspaket sind noch als demnächst verfügbar angekündigt, die Praxis nach dem Marktstart muss sich erst zeigen. Einstieg und Ausblick NVIDIAs Einstiegsschritte sind kurz. Ein unterstütztes Inferenz-Framework herunterladen: llama.cpp, Ollama, vLLM oder LM Studio. Das empfohlene lokale Modell für den eigenen Arbeitsablauf herunterladen. Zum Erweitern auf zwei Geräte beide über die ConnectX-7-Ports verbinden und NVIDIA Sync Cluster Assistant starten, der das Netzwerk einrichtet und Lasten automatisch verteilt. Für Playbooks zu agentischer KI bieten die Seiten NemoClaw, OpenClaw, Hermes Agent und OpenShell auf build.nvidia.com Anleitungen.

Das Signal dieser Ankündigung ist klar. Lokale KI wird weniger als Spielzeug für Bastler verpackt und mehr als Entwicklungsplattform mit definiertem Wachstumspfad: Die Kapazität eines Geräts plus ein Cluster aus zwei Geräten erlauben es, klein anzufangen und zu wachsen. Als Nächstes lohnt der Blick auf reale Preise und Lieferbarkeit nach dem 23. Oktober, auf unabhängige Messungen Dritter und darauf, ob der Model Launcher pünktlich Ende des Monats erscheint. Halten diese Punkte, kann der DGX Spark mit 64 GB zu einem gängigen Ausgangspunkt für die lokale Agentenentwicklung werden.

Sources