
NVIDIA DGX Spark 128 ГБ
Настольный AI-суперкомпьютер NVIDIA на чипе GB10 Grace Blackwell со 128 ГБ унифицированной памяти. Запускает модели до 200 млрд параметров локально — от инференса больших LLM до файнтюнинга 8B-моделей.
Характеристики
Ключевые сценарии
DGX Spark — настольный AI-суперкомпьютер NVIDIA со 128 ГБ унифицированной памяти. Влезают модели до 200 млрд параметров — те, что на обычной видеокарте не запустить. Это машина под инференс больших LLM и файнтюнинг, не под игры.
Что внутри. Чип GB10 Grace Blackwell: 20 ядер Arm и GPU с 6 144 CUDA-ядрами на одном кристалле, соединённые через NVLink-C2C (600 ГБ/с). Память общая для CPU и GPU — 128 ГБ LPDDR5x, 256 бит, 273 ГБ/с. Модель загружена один раз, доступна обоим процессорам, без копирования туда-сюда. Корпус — полтора литра (150×150×50 мм), вес 1,2 кг. Питание — внешний адаптер 240 Вт. Внутри 4 ТБ NVMe — пара терабайт моделей влезает без внешнего диска.
Сетевая часть: ConnectX-7 Smart NIC на 200 Гбит/с. Два устройства объединяются в кластер с 256 ГБ общей памяти — территория моделей до 405 млрд параметров.
Что реально запускается. Главное преимущество Spark — объём памяти, а не скорость. 128 ГБ unified memory означает около 90 ГБ под веса (остальное — KV-кэш, рантайм, система). Что помещается:
- Всё семейство 8B–32B в FP16: Llama 3.1 8B, Qwen2.5 32B, Gemma 3 27B, Mistral Small 24B — с запасом.
- 70B–120B в 4-битном квантовании: Llama 3.3 70B, Qwen2.5 72B, Nemotron-3-Super 120B, GPT-OSS-120B — работают на одном устройстве.
- MoE до ~235B (Qwen3-235B-A22B) — влезает в NVFP4, почти без запаса.
- Полный файнтюнинг 8B-моделей (Llama 3.1 8B, Qwen3 8B) с 8-битным Adam. QLoRA на 70B — тоже.
- FLUX.1 dev для генерации изображений, включая Dreambooth LoRA.
Скорость генерации — не конёк Spark. Пропускная способность памяти 273 ГБ/с — это вчетверо медленнее RTX 4090 и в 6,5 раз медленнее RTX 5090. Prefill (обработка промпта) летает, decode (потоковая генерация) — не спеша. Qwen3-30B-A3B в Q4_K_M — около 88 ток/с, комфортно для диалога. Qwen3-32B dense — 10 ток/с, уже на грани. Nemotron 120B — 17 ток/с. Таблица с источниками замеров — ниже.
Кому брать. Тем, кто регулярно запускает модели 70B+ и не хочет в облако. Тем, кто дообучает открытые модели под свои данные. Тем, кому нужен постоянно работающий локальный ИИ-ассистент. Данные наружу не уходят.
Кому не брать. Если задача — быстрая генерация длинных текстов: видеокарта с 1+ ТБ/с выигрывает. Если все модели до 32B — RTX 5090 дешевле и быстрее. Если игры — это не та машина. Если софт под Windows x86 — здесь Ubuntu для ARM.
Альтернативы. Mac Studio M3 Ultra — до 256 ГБ с 819 ГБ/с, но без CUDA. RTX 5090 — 32 ГБ с 1,8 ТБ/с, быстрее для малых моделей, но 70B+ не влезают. Два Spark в кластере — 256 ГБ для моделей до 405B.
Читайте также: сравнение RTX Spark с Apple Silicon и какие LLM тянет RTX Spark.
| Модель | Квантование | Контекст | Токенов/с | Источник |
|---|---|---|---|---|
| Llama 3.1 8B | NVFP4 | 8k | 34 | NVIDIA Technical Blog |
| Qwen3-30B-A3B | Q4_K_M | 8k | 88 | замер сообщества, GitHub DGX-SPARK |
| Mistral Small 3.1 24B | FP8 | 8k | 8.8 | NVIDIA Technical Blog |
| Qwen3-32B | Q4_K_M | 8k | 10.2 | замер сообщества, GitHub DGX-SPARK |
| GPT-OSS-120B | MXFP4 | 8k | 31.4 | NVIDIA Technical Blog |
| Nemotron-3-Super 120B | Q4_K | 8k | 17 | замер сообщества, GitHub DGX-SPARK |
Скорость зависит от модели, квантования и настроек запуска — смотрите столбец «Источник», чтобы понимать, откуда цифра.
| Что | Поддержка | Примечание |
|---|---|---|
| Ubuntu 24.04 LTS (DGX OS) | Да | предустановлена |
| Windows 11 | Частично | только через виртуализацию, нативная установка не поддерживается |
| Docker | Да | рекомендованный способ запуска vLLM и других фреймворков |
| llama.cpp | Да | включает оптимизации под NVFP4 для GB10 |
| Ollama | Да | нативные ARM64-сборки |
| vLLM | Да | через Docker-контейнеры для ARM64 (PagedAttention) |
| PyTorch | Да | стандартная установка через pip |
| TensorRT-LLM | Да | максимальная производительность prefill на NVFP4 |
| ComfyUI | Частично | работает, но не все кастомные ноды собраны под ARM64 |
| CUDA Toolkit | Да | версия 13.x |
| Дообучение (LoRA/QLoRA) | Да | полный файнтюнинг 8B, QLoRA до 70B |
| Кластер из 2 устройств | Да | через ConnectX-7, 256 ГБ общей памяти |
Сколько моделей помещается в 128 ГБ памяти?
До 200 млрд параметров. 70B-модели в 4-битном квантовании занимают около 45 ГБ — остаётся место под KV-кэш и систему. MoE-модели до 235B (Qwen3-235B) помещаются в NVFP4, но почти без запаса. Безопасный рабочий объём под веса — около 90 ГБ.
Можно ли объединить два DGX Spark?
Да, через ConnectX-7 (200 Гбит/с). Получается 256 ГБ памяти — хватает под модели до 405 млрд параметров. Но скорость генерации от кластера не растёт: она ограничена пропускной способностью памяти каждого узла (273 ГБ/с). Смысл кластера — только в объёме памяти.
Какая реальная скорость генерации текста?
Зависит от модели. Qwen3-30B-A3B (MoE) в Q4_K_M — около 88 ток/с, комфортно для диалога. Qwen3-32B (dense) — 10 ток/с, на грани. Nemotron 120B — 17 ток/с. Узкое место — пропускная способность памяти 273 ГБ/с. Prefill (обработка промпта) значительно быстрее, чем decode (потоковая генерация).
Подходит ли для дообучения моделей?
Да. Полный файнтюнинг моделей до 8B (Llama 3.1 8B, Qwen3 8B) помещается в памяти с 8-битным Adam — около 7 000–13 000 ток/с на обучение. QLoRA работает на моделях до 70B. Dreambooth LoRA для FLUX.1 — тоже.
Чем отличается от сборки на RTX 5090?
RTX 5090 — 32 ГБ VRAM с 1,8 ТБ/с. Модели до 32B на ней быстрее. Но 70B+ на RTX 5090 не влезают физически. DGX Spark берёт объёмом памяти — это разные инструменты под разные задачи. Не прямая замена, а дополнение.
Какие главные ограничения?
Первое — скорость генерации: 273 ГБ/с для decode медленно по сравнению с дискретными GPU. Второе — архитектура ARM (aarch64): не весь софт собирается нативно, для vLLM обязателен Docker. Третье — DGX OS на базе Ubuntu, нативная установка Windows не поддерживается. Четвёртое — это не игровая машина.