Поставка GPU-серверов для ИИ по всей России +7 (985) 489-06-26sales@gpumall.ruTelegram
Гайд · 6 мин чтения

Сколько видеопамяти нужно для LLM

Формула, пример расчёта и готовая таблица для популярных моделей — от Llama 8B до DeepSeek 671B. С подбором конфигурации из каталога.

Объём видеопамяти — главный параметр при выборе сервера под языковую модель. Не хватит памяти — модель просто не запустится или будет обслуживать единицы пользователей. Возьмёте с большим запасом — переплатите миллионы рублей. Ниже — методика, по которой инженеры GPU Mall считают память, и готовые цифры для популярных моделей.

Из чего складывается потребность в памяти

При инференсе (работе уже обученной модели) видеопамять расходуется на три вещи:

  • Веса модели. Число параметров × размер одного параметра. В FP16/BF16 параметр занимает 2 байта, в FP8 — 1 байт, в 4-битной квантизации — около 0,5–0,56 байта с учётом служебных данных. Модель на 70 млрд параметров в FP8 — это ~70 ГБ.
  • KV-кэш. Для каждого токена контекста модель хранит ключи и значения внимания: 2 × число слоёв × число KV-голов × размер головы × байты. У Llama 3.3 70B это ~0,31 МБ на токен в FP16. Кэш растёт пропорционально длине контекста и числу одновременных запросов — на длинных контекстах он легко превышает размер самих весов.
  • Накладные расходы. Активации, буферы CUDA, фрагментация памяти. Закладываем +10% и не планируем загрузку памяти выше 90%: так ведут себя vLLM, SGLang и TensorRT-LLM в реальной эксплуатации.

Итоговая формула: память ≈ (веса + KV-кэш) × 1,1 / 0,9.

Пример расчёта: Llama 3.3 70B на 50 пользователей

Из 50 активных пользователей одновременно генерируют ответ далеко не все — по нашему опыту, порядка 16 параллельных потоков. Контекст — до 32K токенов, в среднем заполнен наполовину. Веса и KV-кэш — в FP8.

  • Веса: 70 млрд × 1 байт = 70 ГБ
  • KV-кэш: 16 потоков × 16K токенов × 0,31 МБ / 2 (FP8) ≈ 40 ГБ
  • Итого с запасом: (70 + 40) × 1,1 / 0,9 ≈ 134 ГБ

Это больше, чем у одной H100 (80 ГБ), и впритык для одной H200 (141 ГБ): на практике модель распределяют на две карты и больше, чтобы оставался запас на пиковую нагрузку. Самый доступный сервер из каталога под такую нагрузку: 2× H200 · от 9 000 000 ₽.

Хотите посчитать под свою модель? Калькулятор подбора работает по этой же формуле и сразу показывает подходящие конфигурации.

Таблица: сколько памяти нужно популярным моделям

Инференс в FP8, контекст до 32K токенов. Колонки — число активных пользователей сервиса. В последней колонке — минимальная конфигурация из нашего каталога для 50 пользователей.

МодельВеса FP810 польз.50 польз.200 польз.Сервер на 50 польз.
Llama 3.1 8B8 ГБ15 ГБ29 ГБ68 ГБ1× L20 48Gb (видеокарта) · от 654 318 ₽
Qwen3 32B32 ГБ49 ГБ78 ГБ156 ГБ1× RTX PRO 6000 Blackwell Max-Q (видеокарта) · от 2 168 078 ₽
Llama 3.3 70B70 ГБ98 ГБ134 ГБ231 ГБ1× H200 NVL PCIe 141GB HBM3e (видеокарта) · от 7 140 375 ₽
Qwen3 235B235 ГБ295 ГБ317 ГБ376 ГБ4× RTX PRO 6000 · от 12 574 296 ₽
Llama 3.1 405B405 ГБ515 ГБ573 ГБ730 ГБ8× RTX PRO 6000 · от 17 333 272 ₽
DeepSeek V3 / R1671 ГБ823 ГБ831 ГБ853 ГБ10× RTX PRO 6000 · от 19 774 614 ₽

Для MoE-моделей (Qwen3 235B, DeepSeek V3/R1) KV-кэш на токен заметно меньше, чем у «плотных» моделей того же размера, — поэтому память у них определяется в основном весами. Подробнее о DeepSeek — в отдельном гайде.

Как квантизация меняет картину

Квантизация уменьшает размер весов. FP8 на картах Hopper и Blackwell почти не влияет на качество ответов и стала стандартом для продакшена. 4-битные форматы (AWQ, GPTQ, NVFP4 на Blackwell) экономят ещё ~45%, но качество на сложных задачах — коде, математике, длинных рассуждениях — стоит проверять на своих данных.

МодельFP16 / BF16FP8INT4 / FP4
Llama 3.1 8B16 ГБ8 ГБ4 ГБ
Qwen3 32B64 ГБ32 ГБ18 ГБ
Llama 3.3 70B140 ГБ70 ГБ39 ГБ
Qwen3 235B470 ГБ235 ГБ132 ГБ
Llama 3.1 405B810 ГБ405 ГБ227 ГБ
DeepSeek V3 / R11 342 ГБ671 ГБ376 ГБ

Дообучение и обучение: другие порядки

Для обучения памяти нужно кратно больше: помимо весов хранятся градиенты, состояния оптимизатора и активации. LoRA-дообучение замораживает основную модель и обучает небольшие адаптеры — это самый экономичный путь. Полное обучение с оптимизатором Adam в смешанной точности требует ~16–18 байт на параметр.

МодельLoRAСервер для LoRAПолное обучениеСервер для полного
Llama 3.1 8B33 ГБ1× L20 48Gb (видеокарта) · от 654 318 ₽151 ГБ2× H200 · от 9 000 000 ₽
Qwen3 32B105 ГБ1× H200 NVL PCIe 141GB HBM3e (видеокарта) · от 7 140 375 ₽604 ГБ8× RTX PRO 6000 · от 17 333 272 ₽
Llama 3.3 70B219 ГБ2× H200 · от 9 000 000 ₽1 322 ГБ8× B200 · от 45 581 221 ₽
Qwen3 235B714 ГБ8× RTX PRO 6000 · от 17 333 272 ₽4 439 ГБнесколько узлов

Цифры — для одной копии модели без учёта ускорения за счёт параллелизма. Для полного обучения больших моделей обычно нужен кластер из нескольких узлов с InfiniBand — такие проекты считаем индивидуально.

Типичные ошибки при расчёте

  • Считать только веса. Сервер, в который модель «влезает впритык», не сможет обслуживать больше пары пользователей.
  • Не учитывать длину контекста. RAG по документам и агенты работают с контекстом 32–128K — KV-кэш растёт пропорционально.
  • Путать пользователей и параллельные запросы. 1000 сотрудников с доступом к ассистенту — это обычно десятки одновременных генераций, а не тысяча.
  • Забывать про рост. Модели обновляются каждые несколько месяцев, и следующая версия часто больше. Запас 20–30% памяти окупается.

Обновлено 04.10.2026 · Инженерная команда GPU Mall

Из каталога

Подходящие конфигурации

Весь каталог →
HPE ProLiant DL380a Gen12
НовыйNVIDIA H200
HPE

ProLiant DL380a Gen12

GPU
NVIDIA H200 NVL Tensor Core
Видеопамять
282 ГБ
CPU
2× Intel Xeon 6 6710E (64C)
RAM
32GB DDR5-6400
Цена от9 000 000 ₽
КП
Supermicro ARS-221GL-NR
НовыйNVIDIA H100
Supermicro

ARS-221GL-NR

GPU
2× NVIDIA H100 NVL 94GB + Grace
Видеопамять
188 ГБ
CPU
2× NVIDIA Grace
RAM
960GB LPDDR5X
Цена от18 864 616 ₽
КП
Gigabyte G294-A22-AAP2
НовыйNVIDIA RTX PRO 6000
Gigabyte

G294-A22-AAP2

GPU
4× NVIDIA RTX PRO 6000 Blackwell 96GB
Видеопамять
384 ГБ
CPU
1× Intel Xeon 6944P (72C)
RAM
1152GB DDR5
Цена от12 574 296 ₽
КП
FAQ

Частые вопросы

Сколько видеопамяти нужно для Llama 70B?

Для одного-двух пользователей в FP8 хватит ~80–100 ГБ, для 50 пользователей с контекстом 32K — около 134 ГБ. Это две H100 или одна H200 с минимальным запасом; комфортнее — 4–8 GPU.

Можно ли запустить LLM на нескольких видеокартах?

Да. Фреймворки vLLM, SGLang и TensorRT-LLM делят модель между GPU (тензорный и конвейерный параллелизм). Чем быстрее связь между картами — NVLink вместо PCIe, — тем меньше потери производительности.

Что важнее для скорости ответа — память или вычисления?

Генерация токенов в основном упирается в пропускную способность памяти, а обработка длинного запроса — в вычислительную мощность. Поэтому H200 с более быстрой HBM3e генерирует заметно быстрее H100 при близкой вычислительной мощности.

Подготовим коммерческое предложение под вашу задачу

Ответим в течение часа в рабочее время.