NVIDIA, 64GB DGX Spark 공개: 4,999달러부터, 2대 클러스터로 로컬 AI 확장
NVIDIA가 64GB 통합 메모리 DGX Spark 구성을 발표했습니다. 10월 23일 Acer, ASUS, Dell, Gigabyte, HP, MSI에서 4,999달러부터 판매됩니다. GB10 Grace Blackwell 슈퍼칩, DGX OS, 전체 AI 소프트웨어 스택은 그대로이며 최대 1,000억 파라미터 모델을 로컬에서 실행합니다. 두 대를 NVIDIA Sync Cluster Assistant로 묶으면 128GB를 공유해 최대 2,000억 파라미터를 지원하고, Qwen 3.8 27B 테스트에서 단일 장비 대비 최대 1.7배 성능을 냈습니다.
2026년 10월 2일, NVIDIA는 공식 블로그를 통해 DGX Spark에 64GB 통합 메모리 구성을 추가한다고 발표했습니다. 신규 구성은 10월 23일(금)부터 Acer, ASUS, Dell, Gigabyte, HP, MSI 등 6개 제조 파트너가 4,999달러부터 판매합니다. 같은 글에서는 DGX Spark 두 대를 클러스터로 묶는 NVIDIA Sync Cluster Assistant도 소개했습니다. NVIDIA의 설명은 단순합니다. AI 에이전트가 실험 단계에서 일상 개발로 옮겨 가면서, 점점 더 강력해진 오픈 모델이 더 많은 기기에 들어갈 만큼 작아지고 있어 로컬에서 돌릴 수 있는 것이 늘고 있다는 것입니다. 발표 내용 DGX Spark는 NVIDIA Grace Blackwell 연산, 통합 메모리, NVIDIA ConnectX-7 네트워킹, CUDA 가속 AI 소프트웨어 스택을 한 시스템에 담았습니다. NVIDIA는 이를 에이전트, 추론, 파인튜닝, 데이터 사이언스, 엣지 개발을 위한 완결형 로컬 AI 플랫폼으로 소개합니다. 새 64GB 구성은 제조 파트너를 통해서만 판매되며, GB10 Grace Blackwell 슈퍼칩, DGX OS, 전체 NVIDIA AI 소프트웨어 스택은 128GB 모델과 같습니다. NVIDIA에 따르면 최대 1,000억 파라미터 모델과 그 위에 구축된 에이전트 애플리케이션을 클라우드 의존 없이 장비에서 직접 실행할 수 있습니다.
바로 쓸 수 있는 소프트웨어도 강조점입니다. NVIDIA Agent Toolkit, CUDA-X AI 라이브러리, Nemotron 오픈 모델, 그리고 Ollama, vLLM, CUDA 지원 PyTorch 같은 대표 런타임이 처음부터 지원됩니다. NVIDIA는 전원을 켜고 모델을 돌리기까지 몇 분이면 된다고 설명합니다. Blender도 이 플랫폼을 가장 먼저 지원하는 주요 크리에이티브 앱 제공사 중 하나이며, 미리 빌드된 다운로드용 설치 파일이 곧 나올 예정입니다. 두 대 클러스터의 작동 방식 모든 DGX Spark에는 NVIDIA ConnectX-7 NIC가 내장되어 있습니다. 두 대를 QSFP 케이블로 직접 연결하면 메모리가 128GB로 합쳐지고, 지원 모델 규모는 최대 2,000억 파라미터로 늘어납니다. 글에 나온 수치로는 메모리 대역폭이 두 배가 되고 성능은 최대 1.7배까지 올라갑니다. 글은 다른 대목에서 이 연결을 200 GbE 패브릭이라고도 설명합니다. 진입 장벽을 실제로 낮추는 것은 NVIDIA Sync 앱의 Cluster Assistant입니다. 연결된 장비를 감지하고, 장비 설정을 검증하고, ConnectX-7 네트워크를 구성하므로 개발자가 네트워크와 노드를 손으로 설정할 필요가 없습니다. 모든 노드가 같은 NVIDIA 소프트웨어 스택을 실행하기 때문에, 한 대에서 두 대로 늘려도 소프트웨어 환경을 다시 설정하지 않아도 됩니다. 주의할 점이 있습니다. 1.7배라는 수치는 NVIDIA 자체의 Qwen 3.8 27B 테스트 결과이고 상한값으로 제시되었습니다. 이론상 2배에 못 미치는 것은 노드 간 통신 비용이 있음을 시사하지만, 이는 저희의 해석이며 글의 결론이 아닙니다.
워크플로 변화: Model Launcher와 세 가지 활용 사례 글은 이달 말 출시 예정인 NVIDIA Sync Model Launcher도 예고합니다. 몇 번의 클릭으로 단일 DGX Spark나 클러스터에서 Qwen3.8 27B를 내려받아 실행할 수 있습니다. NVIDIA Sync가 연결된 장비 전체에서 모델이 돌아가도록 구성하고, 사용자의 노트북에서 접근할 수 있게 해 줍니다. 런처는 이 모델을 쓰도록 OpenCode도 설정하므로 브라우저에서 바로 코딩을 시작할 수 있습니다. NVIDIA는 세 가지 예를 듭니다. 첫째, AI 에이전트를 24시간 가동하는 것입니다. 코딩이나 리서치 에이전트를 DGX Spark에 상주시켜 코드 리뷰, 문서 분석, 여러 단계의 작업을 언제든 처리하게 합니다. 클러스터는 더 큰 모델, 더 긴 컨텍스트, 여러 에이전트의 동시 실행에 여유를 줍니다. 둘째, 평소 쓰는 PC에서 AI 앱을 구동하는 것입니다. 언어 모델이나 이미지 생성 모델은 DGX Spark에서 추론하고, 노트북이나 데스크톱에서는 에이전트나 크리에이티브 앱을 계속 쓸 수 있습니다. 셋째, 일이 커지면 확장하는 것입니다. 한 대로 모자라면 64GB 장비 두 대를 200 GbE 패브릭으로 연결해 메모리를 128GB로 합치고, 같은 워크플로를 소프트웨어 환경 변경 없이 그대로 실행합니다. 개발자와 업계에 주는 의미 이하는 NVIDIA의 표현이 아니라 저희의 분석입니다. 첫째, 가격입니다. 4,999달러부터라는 진입점은 개인 개발자, 연구자, 소규모 팀에게 더 접근하기 쉬운 선택지이며, 지금 한 대를 사고 나중에 두 번째를 더할 수 있습니다. 다만 글에는 128GB 모델의 가격이 없어서 둘의 가격 차이는 원문만으로는 알 수 없습니다. 둘째, 프라이버시와 비용입니다. 로컬 실행이라면 모델과 자체 데이터가 장비 밖으로 나가지 않고, 작업마다 클라우드 인스턴스를 빌릴 필요도 없습니다. 민감한 코드와 문서를 다루는 팀에게 매력적입니다. 셋째, 생태계의 끌림입니다. NVIDIA의 에이전트 툴킷, CUDA-X 라이브러리, Nemotron 모델을 기본 제공하면서 Ollama, vLLM 같은 오픈 런타임도 지원해, 시작 비용을 낮추는 동시에 CUDA 생태계를 강화합니다. 유의할 점도 있습니다. 메모리 용량이 한 대에서 다룰 수 있는 모델 크기와 컨텍스트 길이를 좌우합니다. 글은 최대 1,000억 파라미터라고 하지만, 어떤 양자화 수준과 컨텍스트 길이에서 그런지는 밝히지 않았습니다. 1.7배 결과는 27B 모델 하나에 대한 것이며 다른 모델과 부하에서는 다를 수 있습니다. Model Launcher와 Blender 설치 파일은 둘 다 아직 출시 예정이므로, 출시 후 실제 경험은 확인이 필요합니다. 시작 방법과 전망 NVIDIA가 제시한 시작 단계는 짧습니다. 지원되는 추론 프레임워크(llama.cpp, Ollama, vLLM, LM Studio)를 내려받고, 워크플로에 맞는 권장 로컬 모델을 내려받습니다. 두 대로 확장하려면 ConnectX-7 포트로 연결하고 NVIDIA Sync Cluster Assistant를 실행하면 네트워크 구성과 워크로드 분배가 자동으로 이루어집니다. 에이전트 AI 플레이북은 build.nvidia.com의 NemoClaw, OpenClaw, Hermes Agent, OpenShell 페이지에서 볼 수 있습니다.
이번 발표의 신호는 분명합니다. 로컬 AI가 취미용 장난감이 아니라 성장 경로가 분명한 개발 플랫폼으로 포장되고 있습니다. 한 대의 용량과 두 대 클러스터의 조합으로 작게 시작해 키울 수 있습니다. 앞으로 볼 것은 10월 23일 출시 후 실제 가격과 공급, 제3자의 독립 벤치마크, 그리고 월말 Model Launcher가 예정대로 나오는지입니다. 이 요소들이 갖춰진다면 64GB DGX Spark는 로컬 에이전트 개발의 흔한 출발점이 될 수 있습니다.