NVIDIA RTX PRO 6000 Blackwell Server Edition — одна из самых обсуждаемых карт 2025–2026 годов: 96 ГБ памяти, архитектура Blackwell с FP4 и цена, заметно ниже флагманов. Её всё чаще рассматривают как замену H100 для инференса. Разбираем, где это работает, а где нет.
Характеристики
| RTX PRO 6000 Blackwell | H100 SXM | H100 NVL (PCIe) | L40S | |
|---|---|---|---|---|
| Архитектура | Blackwell | Hopper | Hopper | Ada Lovelace |
| Память | 96 ГБ GDDR7 (ECC) | 80 ГБ HBM3 | 94 ГБ HBM3 | 48 ГБ GDDR6 |
| Пропускная способность | ≈1,6 ТБ/с | 3,35 ТБ/с | 3,9 ТБ/с | 0,86 ТБ/с |
| FP8 / FP4 | ✓ / ✓ | ✓ / — | ✓ / — | ✓ / — |
| NVLink | — | 900 ГБ/с | мост, 600 ГБ/с | — |
| Мощность | до 600 Вт | до 700 Вт | 350–400 Вт | 350 Вт |
| Видеокодеры, RT-ядра | ✓ | — | — | ✓ |
| 8-GPU сервер в каталоге | от 17 333 272 ₽ | от 33 105 375 ₽ | от 27 633 732 ₽ (H100 PCIe) | — |
Где RTX PRO 6000 выигрывает
- Объём памяти за рубль. Восемь карт — это 768 ГБ, больше, чем у 8× H100, при заметно меньшей цене сервера. Модели 70B помещаются в одну-две карты, DeepSeek в 4-битной версии — в один сервер.
- Масштабирование копиями модели. Если модель помещается в одну карту, каждая из восьми обслуживает своих пользователей независимо — отсутствие NVLink здесь не мешает.
- Генеративная графика и видео. RT-ядра и аппаратные видеокодеры делают RTX PRO 6000 универсальной: генерация изображений и видео, рендеринг, VDI, цифровые двойники. У H100 этих блоков нет.
- FP4. Blackwell поддерживает 4-битные вычисления аппаратно — для квантизованных моделей это дополнительный прирост скорости.
Где H100 и H200 остаются сильнее
- Скорость генерации одного потока. Генерация токенов упирается в пропускную способность памяти: у H100 SXM она вдвое выше, у H200 — втрое. Для чат-ботов, где важна задержка, это заметно.
- Модели, разрезанные на много карт. Без NVLink обмен идёт через PCIe — при тензорном параллелизме на 4–8 GPU потери производительности ощутимы.
- Обучение. Для многокарточного обучения HBM-память и NVLink у SXM-платформ по-прежнему вне конкуренции.
Итог: что выбрать
RTX PRO 6000 — для инференса моделей до ~70B (или больших MoE в квантизации) на много пользователей, для генеративной графики и видео, для смешанных нагрузок и при ограниченном бюджете или мощности стойки. H100/H200 SXM — когда важна минимальная задержка, модель приходится делить на много карт или планируется обучение. А если основной критерий — память в одном узле, посмотрите на H200.


