Независимый портал · не связан с NVIDIA

Сколько видеопамяти нужно для локальных LLM в 2026 году

11 июля 2026 г.
Видеокарта с тремя вентиляторами и модули памяти на столе: сколько видеопамяти нужно для локальных LLM

Практический минимум на 2026 год — 16 ГБ видеопамяти. В них помещается модель на 20–30 миллиардов параметров в 4-битном кванте вместе с длинным контекстом. На 8 ГБ живут модели до 8B и короткий контекст, на 12 ГБ — до 14B. Всё, что крупнее 32B, упирается уже не в видеокарту, а в объединённую память: Apple Silicon, Ryzen AI Max или DGX Spark.

Обновлено 2 августа 2026. Пересчитана формула — прошлая версия закладывала фиксированные 2 ГБ на контекст, и это неверно. Добавлены разделы про KV-кэш, MoE-модели, пропускную способность памяти, объём оперативной памяти и ситуацию с ценами. Исправлена ошибка: у RTX 5090 не 24 ГБ, а 32.

Короткий ответ по объёмам

Видеопамять Что реально запускается Оговорка
8 ГБ Плотные модели до 8B в Q4, контекст 4–8K Контекст придётся держать коротким
12 ГБ До 14B в Q4 либо 8B с контекстом 32K MoE уровня gpt-oss-20b уже не влезает
16 ГБ gpt-oss-20b целиком, плотные 14B свободно, 30B-MoE впритык Рабочий минимум 2026 года
24 ГБ Плотные 32B в Q4 с длинным контекстом В линейке RTX 50 такого объёма нет вообще
32 ГБ 32B комфортно, 70B — с выгрузкой части слоёв Потолок одиночной потребительской карты
64–128 ГБ объединённой До 120B в MoE-формате целиком Влезет всё, вопрос в скорости

Строчка про 24 ГБ требует пояснения, потому что она ломает привычную логику апгрейда. RTX 5060 Ti выпускается на 8 и 16 ГБ, RTX 5070 несёт 12, RTX 5070 Ti и RTX 5080 по 16, RTX 5090 — 32 ГБ GDDR7 (NVIDIA). Ступени на 24 ГБ в поколении Blackwell не существует. Хотите её — либо б/у RTX 3090 и 4090, либо профессиональные RTX PRO по другому прайсу.

Из чего складывается расход видеопамяти

Слагаемых три: веса модели, кэш контекста и служебный оверхед. Про последний вспоминают обычно уже после того, как модель не влезла.

Веса модели. Считаются в лоб: количество параметров умножаем на объём одного веса. В Q4_K_M, самом ходовом кванте, выходит примерно 0,56 байта на параметр, то есть на 72% меньше, чем в FP16 (Will It Run AI).

Квантование Байт на параметр Модель 8B Модель 32B
FP16 2,0 ~16 ГБ ~64 ГБ
Q8_0 1,0 ~8 ГБ ~32 ГБ
Q4_K_M ~0,56 4,9 ГБ ~19 ГБ

Реальный файл Llama 3.1 8B в Q4_K_M весит 4,9 ГБ — чуть больше расчётных 4,5, потому что эмбеддинги и часть слоёв внимания в K-квантах остаются в повышенной точности.

KV-кэш. Память под контекст. Растёт линейно с числом токенов и на длинных диалогах перевешивает саму модель.

Оверхед. Контекст CUDA, буферы активаций, служебные аллокации движка. Полгигабайта-гигабайт, которые невозможно спланировать заранее, но которые обязательно всплывут, когда вы подгоните модель впритык под объём карты.

Старая формула «параметры × 0,6 + 2 ГБ» неплохо угадывает первое слагаемое и полностью врёт про второе.

Почему контекст съедает больше, чем сама модель

KV-кэш хранит ключи и значения для каждого уже обработанного токена, чтобы не пересчитывать их заново на каждом шаге генерации. Формула считается точно:

KV-кэш (байт) = 2 × слои × KV-головы × размер головы × токены × байт на значение

Подставим Llama 3.1 8B: 32 слоя, 8 KV-голов, размер головы 128, FP16. Получаем 131 072 байта на один токен — ровно 128 КБ. Дальше умножаем на длину контекста:

Контекст KV-кэш в FP16
4K 0,54 ГБ
8K 1,07 ГБ
32K 4,3 ГБ
128K 17,2 ГБ

Вот и ответ, куда девается память. На 32K контекста кэш почти равен весу модели, на 128K — тяжелее её в три с половиной раза. Модель на 4,9 ГБ вместе с полным контекстом требует 22 ГБ, и никакая RTX 5070 Ti это не переварит. Цифры сходятся с практикой: у Llama-3-8B в Q4_K_M на 32K контекста кэш занимает около 4 ГБ (dev.to).

Спасают два обстоятельства. Первое: групповое внимание GQA. У той же Llama 3.1 8B 32 головы запросов, но всего 8 KV-голов, и кэш за счёт этого вчетверо меньше, чем был бы при классическом multi-head. Второе — квантование самого кэша. vLLM и TensorRT-LLM умеют держать его в FP8 или INT4, что срезает 50–75% объёма (llm-stats) при потерях качества, которые в обычном чате незаметны.

Закладывайте контекст под задачу, а не «на всякий случай». Если вы пишете код с моделью, 16–32K нужны реально. Если общаетесь в чате — 8K хватит с запасом, а сэкономленные гигабайты пойдут на модель покрупнее.

MoE сломал старую арифметику

Раньше связка была жёсткой: больше параметров — больше памяти и медленнее генерация. Mixture-of-Experts разорвал вторую половину, и это самое существенное изменение в теме за последние полтора года. Модель держит в памяти десятки «экспертов», а на каждый токен включает лишь несколько из них.

Qwen3-30B-A3B: 30 миллиардов параметров всего, 3,3 миллиарда активных на токен, около 19 ГБ в Q4_K_M и контекстное окно на 256K. gpt-oss-20b устроен так же — 3,6 миллиарда активных, родное квантование MXFP4 ужимает веса до 12–13 ГБ, и модель укладывается в 16 ГБ вместе со 128K контекста (IntuitionLabs).

Скорость при этом остаётся на уровне мелких моделей: gpt-oss-20b выдаёт около 225 токенов в секунду на RTX 4090 (runaihome). Двадцатимиллиардная модель работает как семимиллиардная.

Память под MoE нужна как под полную модель: все эксперты обязаны лежать в VRAM, иначе начнётся подкачка. А вот скорость считается по активным весам. Поэтому вопрос «сколько мне нужно видеопамяти» распался на два разных — сколько нужно, чтобы модель влезла, и сколько нужно, чтобы она шевелилась. Ответы больше не совпадают.

Объём говорит «влезет», пропускная способность — «как быстро»

Чтобы выдать один токен, движок обязан прогнать через шину памяти все активные веса. Отсюда грубый потолок скорости: пропускная способность делить на объём активных весов. Всё остальное — оптимизации вокруг этого предела.

Платформа Память Пропускная способность
RTX 5090 32 ГБ GDDR7 1792 ГБ/с (спецификация)
DGX Spark 128 ГБ LPDDR5x ~273 ГБ/с (NVIDIA)
Ryzen AI Max+ 395 до 128 ГБ LPDDR5X 256 ГБ/с в теории, 212–215 на практике (llm-tracker)

Разрыв в шесть-семь раз объясняет вещи, которые иначе выглядят абсурдно. Плотная Llama 70B на DGX Spark идёт со скоростью около 2,7 токена в секунду: влезает целиком, но течёт через узкую шину. А gpt-oss-120b на том же устройстве выдаёт 35–50 токенов, потому что активных весов у неё в разы меньше. Подробный разбор этого парадокса — в статье какие LLM потянет RTX Spark.

Меня в своё время удивило, насколько плохо этот момент отражён в обзорах. Объём памяти пишут в первой строке спецификации, пропускную способность прячут в конец таблицы, а на скорость ответа она влияет сильнее.

Разбор по объёмам

8 ГБ

Нижняя рабочая граница, и слово «рабочая» тут с натяжкой. Плотные модели до 8B в Q4 сюда влезают, но с контекстом 4–8K: на 32K кэш уже не поместится рядом с весами. Для чат-бота, суммаризации коротких текстов и знакомства с темой достаточно. Для кода — тесно.

Карт с 8 ГБ в продаже много, и они дешёвые. Если это ваша единственная опция, начните с моделей класса 4B и посмотрите, хватает ли качества.

12 ГБ

Плотные 14B в Q4 либо 8B с приличным контекстом. Разумный компромисс, когда карта берётся ещё и под игры. Обидный момент: gpt-oss-20b в 12 ГБ не влезает, до него не хватает буквально пары гигабайт.

16 ГБ

Тот объём, который я советую как отправную точку. Причина конкретная: сюда помещается gpt-oss-20b целиком со 128K контекста, плотные 14B живут свободно, а 30B-MoE вроде Qwen3-30B-A3B заходит впритык при аккуратном обращении с контекстом. Плюс FLUX и SDXL для картинок работают без выгрузок.

В каталоге RTXSpark этот объём закрывают Palit RTX 5060 Ti 16 ГБ, самый доступный вариант, и MSI RTX 5070 Ti 16 ГБ, которая заметно быстрее на той же ёмкости. Остальные варианты собраны в разделе видеокарты.

24 ГБ

Плотные 32B в Q4 с длинным контекстом, комфортное дообучение через QLoRA. Проблема в том, что в актуальном поколении такой карты нет. Остаётся вторичный рынок с RTX 3090 и 4090 либо профессиональная линейка. Слухи про RTX 50 Super с 24 ГБ разбираю ниже, но полагаться на них при покупке сегодня я бы не стал.

32 ГБ

RTX 5090 и её 1792 ГБ/с — самая быстрая одиночная карта для локального инференса. Плотные 32B идут комфортно, 70B в Q4 требуют 43 ГБ и целиком не помещаются: часть слоёв придётся выгружать в оперативную память, и скорость просядет в разы.

Когда видеокарты кончаются: объединённая память

Модель на 70B в Q4_K_M весит 43,1 ГБ. Это больше любой потребительской видеокарты, и здесь начинается другая архитектура — общая память для процессора и графики.

Apple Silicon отдаёт под нужды графики системную память, так что 64 или 128 ГБ на M-чипе превращаются в рабочий объём для крупных моделей. AMD Ryzen AI Max+ 395 несёт до 128 ГБ, из которых до 96 конвертируются в VRAM через Variable Graphics Memory, и показывает около 100 токенов в секунду на Qwen3-30B (runaihome). NVIDIA DGX Spark — 128 ГБ с пропускной способностью около 273 ГБ/с.

Плата за объём — скорость. Ни одна из этих платформ близко не подходит к 1,8 ТБ/с дискретной карты. Выбор сводится к честному вопросу: вам нужна большая модель или быстрая? Развёрнутое сравнение подходов — в материале RTX Spark против Apple Silicon, а сами устройства собраны в разделе AI-станции.

Сколько нужно оперативной памяти

Минимальная конфигурация для запуска модели уровня 3B–7B в Q4 выглядит так: 16 ГБ системной памяти, современный процессор и видеокарта от 6 ГБ (overchat). Оперативная память нужна на двух этапах — при загрузке весов с диска и при выгрузке слоёв, которые не влезли в видеокарту.

Второй случай интереснее, потому что им можно пользоваться осознанно. llama.cpp и построенные на нём Ollama и LM Studio умеют размещать в VRAM только часть слоёв модели, а остальные считать на процессоре (параметр --n-gpu-layers). Модель на 20 ГБ запустится на карте с 12 ГБ, но каждый токен будет ходить через PCIe, и скорость упадёт кратно. Как способ попробовать модель, которая не влезает, приём рабочий. Жить в таком режиме постоянно тяжело.

32 ГБ оперативной снимают вопрос почти для любого сценария на потребительской карте.

Картинки и дообучение — другой профиль памяти

Генеративные модели изображений считают память иначе: KV-кэша там нет, зато веса грузятся целиком. FLUX.1-dev в fp8 занимает 11,9 ГБ, и на 8-гигабайтной карте работает через постоянную подкачку из оперативной памяти — медленно, но работает. Разбор установки со всеми подводными камнями — в гайде по ComfyUI и FLUX.

Дообучение требует ещё больше: к весам добавляются градиенты и состояния оптимизатора. QLoRA держит базовую модель замороженной в 4 битах и обучает только адаптеры, поэтому 7B укладывается примерно в 12 ГБ, а 13B просит от 20 (Spheron). Полное дообучение той же семёрки потребовало бы 100–120 ГБ, так что для домашних условий альтернативы адаптерам нет.

Что происходит с памятью и ценами в 2026

Производители памяти загружены заказами под дата-центры, и GDDR7 достаётся видеокартам по остаточному принципу. NVIDIA сократила отгрузки партнёрам примерно на 15–20%, а в июле цены на китайском рынке подскочили на 15–30% (Хабр). Трёхгигабайтные чипы GDDR7 стоят 60–70 долларов против примерно 20 за двухгигабайтные, и эта разница напрямую бьёт по картам с большим объёмом.

Отсюда судьба обновлённой линейки. По утечкам, RTX 50 Super должна была принести RTX 5080 Super и RTX 5070 Ti Super с 24 ГБ, а также RTX 5070 Super с 18 ГБ, но релиз сдвигается: свежие слухи называют CES 2027 (VideoCardz). Официально NVIDIA эти карты не анонсировала, так что любые даты и характеристики здесь остаются слухами.

Практический смысл: ждать удвоения гигабайтов за те же деньги в обозримом будущем не приходится. Планируйте исходя из того, что есть на полке сейчас.

Кому какой объём брать

Знакомитесь с локальным ИИ и бюджет жёсткий — 8–12 ГБ. Возьмите модель на 4–8B, короткий контекст, и посмотрите, закрывает ли она ваши задачи. Может выясниться, что большего и не надо.

Для работы с кодом и большими документами — 16 ГБ и ни граммом меньше. Длинный контекст съест разницу между 12 и 16 быстрее, чем вы успеете это заметить.

32 ГБ имеют смысл под плотные модели на 32B, дообучение на своих данных и генерацию видео. Альтернатива — б/у карта с 24 ГБ, если готовы к рискам вторичного рынка.

Модели на 70B и выше живут только в объединённой памяти. Дискретные карты в этой весовой категории кончились.

Частые вопросы

Хватит ли 8 ГБ видеопамяти для локальной LLM? Хватит для моделей до 8B в 4-битном кванте с контекстом 4–8K. Для кода и длинных документов будет тесно: KV-кэш на 32K контекста один займёт больше 4 ГБ. Начать и понять, нужно ли вам это вообще, — вполне достаточно.

Почему модель на 20 ГБ не запускается на карте с 24 ГБ? Потому что кроме весов в память ложатся KV-кэш и служебные буферы. Реальный расход равен весам плюс кэш под ваш контекст плюс примерно гигабайт оверхеда. Уменьшите контекст или возьмите квант поменьше.

Q4 сильно портит качество? Q4_K_M считается рабочим компромиссом: около 0,56 байта на параметр против 2 в FP16 при потерях, которые в обычных задачах заметить трудно. Если памяти хватает с запасом, Q5 или Q6 дадут чуть более аккуратные ответы, но разница меньше, чем между моделями разных поколений.

Что лучше: плотная 14B или MoE на 30B? При равном объёме памяти MoE обычно выигрывает, потому что активирует лишь часть весов и работает быстрее при большем общем размере. Проверьте только, влезает ли она целиком: в памяти нужно держать всех экспертов, а не активных.

Считается ли объединённая память видеопамятью? Функционально да, модель грузится в неё целиком. Но пропускная способность у неё в разы ниже, чем у GDDR7, и генерация идёт медленнее при том же объёме.

Можно ли объединить две видеокарты и сложить память? Для инференса — да, llama.cpp и vLLM умеют разносить слои по нескольким GPU. Суммарный объём складывается, скорость упирается в обмен по PCIe. Для домашней сборки вариант рабочий, но заметно более хлопотный, чем одна карта с нужным объёмом.

Что дальше

Посчитайте память под конкретную модель, которую собираетесь запускать, а не «вообще». Возьмите вес файла с Hugging Face, прибавьте KV-кэш по формуле выше под нужную длину контекста, добавьте гигабайт сверху. Полученное число и есть ваш минимум по видеопамяти — всё остальное в спецификациях вторично.

Если конфигурация ещё не собрана, начните с гайда по запуску нейросети на своей видеокарте, а разобраться, стоит ли овчинка выделки, поможет разбор зачем нужны локальные модели. Готовые варианты по объёму памяти — в каталоге: Palit RTX 5060 Ti 16 ГБ как точка входа, MSI RTX 5070 Ti 16 ГБ когда важна скорость, NVIDIA DGX Spark 128 ГБ для моделей, которые в видеокарту не помещаются в принципе.

RTXSpark — независимый информационный портал, не связанный с NVIDIA, AMD и Apple. Названия продуктов используются только для обозначения самих продуктов. Характеристики неанонсированных устройств приведены по открытым утечкам и официального подтверждения не имеют.