DeepSeek V3 и рассуждающая модель DeepSeek R1 — одни из самых популярных открытых моделей для локального развёртывания: их можно запустить внутри периметра компании, без передачи данных во внешние облака. Но у них 671 млрд параметров, и «обычного» сервера с парой видеокарт не хватит. Разбираем, какое железо нужно на самом деле.
Почему DeepSeek такой требовательный — и почему не настолько, как кажется
DeepSeek V3/R1 — модель со смесью экспертов (MoE): из 671 млрд параметров на каждый токен работают только ~37 млрд. Поэтому вычислений нужно примерно как для модели на 40B, а вот хранить в памяти нужно все 671 млрд — какой эксперт понадобится следующим, заранее неизвестно. Отсюда главное требование: много видеопамяти в одном узле.
Зато у DeepSeek очень компактный KV-кэш: механизм Multi-head Latent Attention сжимает его примерно в 4–5 раз по сравнению с обычными моделями. На каждый токен — около 0,07 МБ против 0,31 МБ у Llama 70B. Значит, если веса поместились, пользователей и длинные контексты сервер выдержит легко.
Сколько памяти нужно
DeepSeek изначально обучен в FP8, поэтому FP8 — «родной» и рекомендуемый формат без потери качества. Расчёт для 50 активных пользователей и контекста до 32K:
- FP8: веса ~671 ГБ, с KV-кэшем и запасом — 831 ГБ. Минимальная конфигурация из каталога: 10× RTX PRO 6000 · от 19 774 614 ₽.
- 4-битная квантизация: веса ~376 ГБ, итого — 470 ГБ. Минимальная конфигурация: 8× RTX PRO 6000 · от 17 333 272 ₽.
Какие серверы подходят
| Сервер | DeepSeek FP8 | DeepSeek INT4 | Qwen3 235B FP8 | Комментарий |
|---|---|---|---|---|
| 8× H100 SXM (640 ГБ) | — | ✓ | ✓ | бюджетный вариант для INT4 |
| 8× RTX PRO 6000 (768 ГБ) | — | ✓ | ✓ | PCIe, без NVLink |
| 10× RTX PRO 6000 (960 ГБ) | ✓ | ✓ | ✓ | FP8 помещается, но обмен через PCIe медленнее |
| 8× H200 (1128 ГБ) | ✓ | ✓ | ✓ | оптимум для FP8 в одном узле |
| 8× B200 (1,44–1,54 ТБ) | ✓ | ✓ | ✓ | запас под длинный контекст, FP4 |
| 8× B300 (2,3 ТБ) | ✓ | ✓ | ✓ | максимум пользователей и контекста |
| 8× AMD MI300X / MI325X (1,5–2 ТБ) | ✓ | ✓ | ✓ | через ROCm, проверить стек |
Вариант «8× H200» — самый частый выбор наших клиентов под DeepSeek: модель в родном FP8 целиком помещается в один узел, а сервер не требует особой подготовки ЦОД. Если нужно экономить, 4-битная версия работает на 8× H100 или 8× RTX PRO 6000 — но качество на коде и математике стоит проверить на своих задачах.
Qwen3 235B и другие MoE-модели
Qwen3-235B-A22B — сильная альтернатива DeepSeek с почти втрое меньшим числом параметров. В FP8 ей нужно около 317 ГБ на 50 пользователей (4× RTX PRO 6000 · от 12 574 296 ₽), в 4-битной квантизации — около 191 ГБ (2× H200 · от 9 000 000 ₽). Модели масштаба 1 трлн параметров (например, Kimi K2) в FP8 требуют уже ~1 ТБ и больше — это задача для 8× B200/B300 или 8× MI325X.
А если не нужна полная модель?
Дистиллированные версии R1 на базе Qwen и Llama сохраняют стиль рассуждений при гораздо меньших требованиях. Версия на 32B на 50 пользователей укладывается в ~78 ГБ, на 70B — в ~134 ГБ: это 1–2 H200 или 4-GPU сервер на RTX PRO 6000. Хороший вариант для пилота: проверить сценарии на дистилляте, а затем перейти на полную модель.
Программная часть
Для продакшена DeepSeek используют vLLM или SGLang — оба поддерживают FP8, MLA и параллелизм экспертов и дают OpenAI-совместимый API. Ollama и llama.cpp подходят для экспериментов, но не для обслуживания десятков пользователей. При поставке сервера можем развернуть модель и отдать готовый API-эндпоинт.


