Независимый портал · не связан с NVIDIA
ПредзаказРендер материнской платы AI-станции NVIDIA DGX Spark со 128 ГБ памяти

NVIDIA DGX Spark 128 ГБ

Настольный AI-суперкомпьютер NVIDIA на чипе GB10 Grace Blackwell со 128 ГБ унифицированной памяти. Запускает модели до 200 млрд параметров локально — от инференса больших LLM до файнтюнинга 8B-моделей.

от 480 000 ₽
ориентировочно
Открыт предзаказ
Партнёрские ссылки: цена для вас не меняется, а сайт получает небольшое вознаграждение.
Проверенные характеристикиДанные сверяем с официальными источниками
Партнёрские ссылкиПоддержите проект без переплат
Подбор аналоговПоможем найти вариант под задачу
Сравнение ценСобираем предложения магазинов в одном месте

Характеристики

GPUGB10 Blackwell
CUDA-ядра6 144
Память128 ГБ LPDDR5x (унифицированная)
Пропускная способность273 ГБ/с
Тензорные ядра5-е поколение
АрхитектураNVIDIA Grace Blackwell
CPU20 ядер Arm (10× X925 + 10× A725)
Шина памяти256 бит
Накопитель4 ТБ NVMe M.2 PCIe 5.0
Питание240 Вт (адаптер)

Ключевые сценарии

Локальный запуск LLMЗапуск и инференс моделей без облака
Разработка и тестированиеAI-приложения, прототипы и исследования
Дообучение моделейLoRA и файнтюнинг на своих данных
Генерация изображений и видеоДиффузионные модели, апскейл, видеосинтез
Научные и инженерные задачиСимуляции, численные расчёты и моделирование

DGX Spark — настольный AI-суперкомпьютер NVIDIA со 128 ГБ унифицированной памяти. Влезают модели до 200 млрд параметров — те, что на обычной видеокарте не запустить. Это машина под инференс больших LLM и файнтюнинг, не под игры.

Что внутри. Чип GB10 Grace Blackwell: 20 ядер Arm и GPU с 6 144 CUDA-ядрами на одном кристалле, соединённые через NVLink-C2C (600 ГБ/с). Память общая для CPU и GPU — 128 ГБ LPDDR5x, 256 бит, 273 ГБ/с. Модель загружена один раз, доступна обоим процессорам, без копирования туда-сюда. Корпус — полтора литра (150×150×50 мм), вес 1,2 кг. Питание — внешний адаптер 240 Вт. Внутри 4 ТБ NVMe — пара терабайт моделей влезает без внешнего диска.

Сетевая часть: ConnectX-7 Smart NIC на 200 Гбит/с. Два устройства объединяются в кластер с 256 ГБ общей памяти — территория моделей до 405 млрд параметров.

Что реально запускается. Главное преимущество Spark — объём памяти, а не скорость. 128 ГБ unified memory означает около 90 ГБ под веса (остальное — KV-кэш, рантайм, система). Что помещается:

  • Всё семейство 8B–32B в FP16: Llama 3.1 8B, Qwen2.5 32B, Gemma 3 27B, Mistral Small 24B — с запасом.
  • 70B–120B в 4-битном квантовании: Llama 3.3 70B, Qwen2.5 72B, Nemotron-3-Super 120B, GPT-OSS-120B — работают на одном устройстве.
  • MoE до ~235B (Qwen3-235B-A22B) — влезает в NVFP4, почти без запаса.
  • Полный файнтюнинг 8B-моделей (Llama 3.1 8B, Qwen3 8B) с 8-битным Adam. QLoRA на 70B — тоже.
  • FLUX.1 dev для генерации изображений, включая Dreambooth LoRA.

Скорость генерации — не конёк Spark. Пропускная способность памяти 273 ГБ/с — это вчетверо медленнее RTX 4090 и в 6,5 раз медленнее RTX 5090. Prefill (обработка промпта) летает, decode (потоковая генерация) — не спеша. Qwen3-30B-A3B в Q4_K_M — около 88 ток/с, комфортно для диалога. Qwen3-32B dense — 10 ток/с, уже на грани. Nemotron 120B — 17 ток/с. Таблица с источниками замеров — ниже.

Кому брать. Тем, кто регулярно запускает модели 70B+ и не хочет в облако. Тем, кто дообучает открытые модели под свои данные. Тем, кому нужен постоянно работающий локальный ИИ-ассистент. Данные наружу не уходят.

Кому не брать. Если задача — быстрая генерация длинных текстов: видеокарта с 1+ ТБ/с выигрывает. Если все модели до 32B — RTX 5090 дешевле и быстрее. Если игры — это не та машина. Если софт под Windows x86 — здесь Ubuntu для ARM.

Альтернативы. Mac Studio M3 Ultra — до 256 ГБ с 819 ГБ/с, но без CUDA. RTX 5090 — 32 ГБ с 1,8 ТБ/с, быстрее для малых моделей, но 70B+ не влезают. Два Spark в кластере — 256 ГБ для моделей до 405B.

Читайте также: сравнение RTX Spark с Apple Silicon и какие LLM тянет RTX Spark.