Объём видеопамяти — главный параметр при выборе сервера под языковую модель. Не хватит памяти — модель просто не запустится или будет обслуживать единицы пользователей. Возьмёте с большим запасом — переплатите миллионы рублей. Ниже — методика, по которой инженеры GPU Mall считают память, и готовые цифры для популярных моделей.
Из чего складывается потребность в памяти
При инференсе (работе уже обученной модели) видеопамять расходуется на три вещи:
- Веса модели. Число параметров × размер одного параметра. В FP16/BF16 параметр занимает 2 байта, в FP8 — 1 байт, в 4-битной квантизации — около 0,5–0,56 байта с учётом служебных данных. Модель на 70 млрд параметров в FP8 — это ~70 ГБ.
- KV-кэш. Для каждого токена контекста модель хранит ключи и значения внимания: 2 × число слоёв × число KV-голов × размер головы × байты. У Llama 3.3 70B это ~0,31 МБ на токен в FP16. Кэш растёт пропорционально длине контекста и числу одновременных запросов — на длинных контекстах он легко превышает размер самих весов.
- Накладные расходы. Активации, буферы CUDA, фрагментация памяти. Закладываем +10% и не планируем загрузку памяти выше 90%: так ведут себя vLLM, SGLang и TensorRT-LLM в реальной эксплуатации.
Итоговая формула: память ≈ (веса + KV-кэш) × 1,1 / 0,9.
Пример расчёта: Llama 3.3 70B на 50 пользователей
Из 50 активных пользователей одновременно генерируют ответ далеко не все — по нашему опыту, порядка 16 параллельных потоков. Контекст — до 32K токенов, в среднем заполнен наполовину. Веса и KV-кэш — в FP8.
- Веса: 70 млрд × 1 байт = 70 ГБ
- KV-кэш: 16 потоков × 16K токенов × 0,31 МБ / 2 (FP8) ≈ 40 ГБ
- Итого с запасом: (70 + 40) × 1,1 / 0,9 ≈ 134 ГБ
Это больше, чем у одной H100 (80 ГБ), и впритык для одной H200 (141 ГБ): на практике модель распределяют на две карты и больше, чтобы оставался запас на пиковую нагрузку. Самый доступный сервер из каталога под такую нагрузку: 2× H200 · от 9 000 000 ₽.
Таблица: сколько памяти нужно популярным моделям
Инференс в FP8, контекст до 32K токенов. Колонки — число активных пользователей сервиса. В последней колонке — минимальная конфигурация из нашего каталога для 50 пользователей.
| Модель | Веса FP8 | 10 польз. | 50 польз. | 200 польз. | Сервер на 50 польз. |
|---|---|---|---|---|---|
| Llama 3.1 8B | 8 ГБ | 15 ГБ | 29 ГБ | 68 ГБ | 1× L20 48Gb (видеокарта) · от 654 318 ₽ |
| Qwen3 32B | 32 ГБ | 49 ГБ | 78 ГБ | 156 ГБ | 1× RTX PRO 6000 Blackwell Max-Q (видеокарта) · от 2 168 078 ₽ |
| Llama 3.3 70B | 70 ГБ | 98 ГБ | 134 ГБ | 231 ГБ | 1× H200 NVL PCIe 141GB HBM3e (видеокарта) · от 7 140 375 ₽ |
| Qwen3 235B | 235 ГБ | 295 ГБ | 317 ГБ | 376 ГБ | 4× RTX PRO 6000 · от 12 574 296 ₽ |
| Llama 3.1 405B | 405 ГБ | 515 ГБ | 573 ГБ | 730 ГБ | 8× RTX PRO 6000 · от 17 333 272 ₽ |
| DeepSeek V3 / R1 | 671 ГБ | 823 ГБ | 831 ГБ | 853 ГБ | 10× RTX PRO 6000 · от 19 774 614 ₽ |
Для MoE-моделей (Qwen3 235B, DeepSeek V3/R1) KV-кэш на токен заметно меньше, чем у «плотных» моделей того же размера, — поэтому память у них определяется в основном весами. Подробнее о DeepSeek — в отдельном гайде.
Как квантизация меняет картину
Квантизация уменьшает размер весов. FP8 на картах Hopper и Blackwell почти не влияет на качество ответов и стала стандартом для продакшена. 4-битные форматы (AWQ, GPTQ, NVFP4 на Blackwell) экономят ещё ~45%, но качество на сложных задачах — коде, математике, длинных рассуждениях — стоит проверять на своих данных.
| Модель | FP16 / BF16 | FP8 | INT4 / FP4 |
|---|---|---|---|
| Llama 3.1 8B | 16 ГБ | 8 ГБ | 4 ГБ |
| Qwen3 32B | 64 ГБ | 32 ГБ | 18 ГБ |
| Llama 3.3 70B | 140 ГБ | 70 ГБ | 39 ГБ |
| Qwen3 235B | 470 ГБ | 235 ГБ | 132 ГБ |
| Llama 3.1 405B | 810 ГБ | 405 ГБ | 227 ГБ |
| DeepSeek V3 / R1 | 1 342 ГБ | 671 ГБ | 376 ГБ |
Дообучение и обучение: другие порядки
Для обучения памяти нужно кратно больше: помимо весов хранятся градиенты, состояния оптимизатора и активации. LoRA-дообучение замораживает основную модель и обучает небольшие адаптеры — это самый экономичный путь. Полное обучение с оптимизатором Adam в смешанной точности требует ~16–18 байт на параметр.
| Модель | LoRA | Сервер для LoRA | Полное обучение | Сервер для полного |
|---|---|---|---|---|
| Llama 3.1 8B | 33 ГБ | 1× L20 48Gb (видеокарта) · от 654 318 ₽ | 151 ГБ | 2× H200 · от 9 000 000 ₽ |
| Qwen3 32B | 105 ГБ | 1× H200 NVL PCIe 141GB HBM3e (видеокарта) · от 7 140 375 ₽ | 604 ГБ | 8× RTX PRO 6000 · от 17 333 272 ₽ |
| Llama 3.3 70B | 219 ГБ | 2× H200 · от 9 000 000 ₽ | 1 322 ГБ | 8× B200 · от 45 581 221 ₽ |
| Qwen3 235B | 714 ГБ | 8× RTX PRO 6000 · от 17 333 272 ₽ | 4 439 ГБ | несколько узлов |
Цифры — для одной копии модели без учёта ускорения за счёт параллелизма. Для полного обучения больших моделей обычно нужен кластер из нескольких узлов с InfiniBand — такие проекты считаем индивидуально.
Типичные ошибки при расчёте
- Считать только веса. Сервер, в который модель «влезает впритык», не сможет обслуживать больше пары пользователей.
- Не учитывать длину контекста. RAG по документам и агенты работают с контекстом 32–128K — KV-кэш растёт пропорционально.
- Путать пользователей и параллельные запросы. 1000 сотрудников с доступом к ассистенту — это обычно десятки одновременных генераций, а не тысяча.
- Забывать про рост. Модели обновляются каждые несколько месяцев, и следующая версия часто больше. Запас 20–30% памяти окупается.


