Поставка GPU-серверов для ИИ по всей России +7 (985) 489-06-26sales@gpumall.ruTelegram
Гайд · 4 мин чтения

Сервер для DeepSeek и Qwen3

Сколько видеопамяти нужно MoE-моделям на сотни миллиардов параметров, какие серверы подходят и как сэкономить без потери качества.

DeepSeek V3 и рассуждающая модель DeepSeek R1 — одни из самых популярных открытых моделей для локального развёртывания: их можно запустить внутри периметра компании, без передачи данных во внешние облака. Но у них 671 млрд параметров, и «обычного» сервера с парой видеокарт не хватит. Разбираем, какое железо нужно на самом деле.

Почему DeepSeek такой требовательный — и почему не настолько, как кажется

DeepSeek V3/R1 — модель со смесью экспертов (MoE): из 671 млрд параметров на каждый токен работают только ~37 млрд. Поэтому вычислений нужно примерно как для модели на 40B, а вот хранить в памяти нужно все 671 млрд — какой эксперт понадобится следующим, заранее неизвестно. Отсюда главное требование: много видеопамяти в одном узле.

Зато у DeepSeek очень компактный KV-кэш: механизм Multi-head Latent Attention сжимает его примерно в 4–5 раз по сравнению с обычными моделями. На каждый токен — около 0,07 МБ против 0,31 МБ у Llama 70B. Значит, если веса поместились, пользователей и длинные контексты сервер выдержит легко.

Сколько памяти нужно

DeepSeek изначально обучен в FP8, поэтому FP8 — «родной» и рекомендуемый формат без потери качества. Расчёт для 50 активных пользователей и контекста до 32K:

  • FP8: веса ~671 ГБ, с KV-кэшем и запасом — 831 ГБ. Минимальная конфигурация из каталога: 10× RTX PRO 6000 · от 19 774 614 ₽.
  • 4-битная квантизация: веса ~376 ГБ, итого — 470 ГБ. Минимальная конфигурация: 8× RTX PRO 6000 · от 17 333 272 ₽.

Какие серверы подходят

СерверDeepSeek FP8DeepSeek INT4Qwen3 235B FP8Комментарий
8× H100 SXM (640 ГБ)—✓✓бюджетный вариант для INT4
8× RTX PRO 6000 (768 ГБ)—✓✓PCIe, без NVLink
10× RTX PRO 6000 (960 ГБ)✓✓✓FP8 помещается, но обмен через PCIe медленнее
8× H200 (1128 ГБ)✓✓✓оптимум для FP8 в одном узле
8× B200 (1,44–1,54 ТБ)✓✓✓запас под длинный контекст, FP4
8× B300 (2,3 ТБ)✓✓✓максимум пользователей и контекста
8× AMD MI300X / MI325X (1,5–2 ТБ)✓✓✓через ROCm, проверить стек

Вариант «8× H200» — самый частый выбор наших клиентов под DeepSeek: модель в родном FP8 целиком помещается в один узел, а сервер не требует особой подготовки ЦОД. Если нужно экономить, 4-битная версия работает на 8× H100 или 8× RTX PRO 6000 — но качество на коде и математике стоит проверить на своих задачах.

Qwen3 235B и другие MoE-модели

Qwen3-235B-A22B — сильная альтернатива DeepSeek с почти втрое меньшим числом параметров. В FP8 ей нужно около 317 ГБ на 50 пользователей (4× RTX PRO 6000 · от 12 574 296 ₽), в 4-битной квантизации — около 191 ГБ (2× H200 · от 9 000 000 ₽). Модели масштаба 1 трлн параметров (например, Kimi K2) в FP8 требуют уже ~1 ТБ и больше — это задача для 8× B200/B300 или 8× MI325X.

А если не нужна полная модель?

Дистиллированные версии R1 на базе Qwen и Llama сохраняют стиль рассуждений при гораздо меньших требованиях. Версия на 32B на 50 пользователей укладывается в ~78 ГБ, на 70B — в ~134 ГБ: это 1–2 H200 или 4-GPU сервер на RTX PRO 6000. Хороший вариант для пилота: проверить сценарии на дистилляте, а затем перейти на полную модель.

Программная часть

Для продакшена DeepSeek используют vLLM или SGLang — оба поддерживают FP8, MLA и параллелизм экспертов и дают OpenAI-совместимый API. Ollama и llama.cpp подходят для экспериментов, но не для обслуживания десятков пользователей. При поставке сервера можем развернуть модель и отдать готовый API-эндпоинт.

Нужен сервер под DeepSeek или Qwen? Подберём конфигурацию под число пользователей и длину контекста, развернём модель и проверим производительность до сдачи. Запросить КП

Обновлено 04.10.2026 · Инженерная команда GPU Mall

Из каталога

Подходящие конфигурации

Весь каталог →
Supermicro SYS-212GB-FNR
НовыйNVIDIA RTX PRO 6000
Supermicro

SYS-212GB-FNR

GPU
10× NVIDIA RTX PRO 6000 Blackwell 96GB
Видеопамять
960 ГБ
CPU
2× Intel Xeon Platinum 8558 (48C)
RAM
384GB DDR5
Цена от19 774 614 ₽
КП
ASUS ESC8000A-E13 SKU1
НовыйNVIDIA RTX PRO 6000
ASUS

ESC8000A-E13 SKU1

GPU
8× NVIDIA RTX PRO 6000 Blackwell 96GB
Видеопамять
768 ГБ
CPU
2× AMD EPYC 9575F (64C)
RAM
768GB DDR5
Цена от17 333 272 ₽
КП
Supermicro SYS-A22GA-NBRT
НовыйВ наличииNVIDIA B200
Supermicro

SYS-A22GA-NBRT

GPU
NVIDIA HGX B200 8-GPU 180GB
Видеопамять
1 440 ГБ
CPU
2× Intel Xeon 6960P (72C)
RAM
24× 128GB DDR5-6400
Цена от45 581 221 ₽
КП
FAQ

Частые вопросы

Какой сервер нужен для DeepSeek R1 671B?

Для полной модели в родном FP8 — около 831 ГБ видеопамяти: 8× H200, 8× B200, 8× B300 или 8× AMD MI300X/MI325X. В 4-битной квантизации — около 470 ГБ: подойдут 8× H100 или 8× RTX PRO 6000.

Можно ли запустить DeepSeek на одной видеокарте?

Полную модель — нет: ей нужно минимум ~400 ГБ даже в 4-битной квантизации. На одной карте с 80–141 ГБ запускаются дистиллированные версии R1 на 32B и 70B параметров.

Сколько пользователей выдержит сервер с DeepSeek?

Благодаря сжатому KV-кэшу (MLA) — много: на 8× H200 в FP8 после загрузки весов остаётся порядка 250–300 ГБ под кэш, этого хватает на десятки одновременных генераций с длинным контекстом. Точную цифру считаем под ваш профиль нагрузки.

Подготовим коммерческое предложение под вашу задачу

Ответим в течение часа в рабочее время.