NVIDIA RTX PRO 5000 Blackwell с 72 Гб видеопамяти. Есть ли смысл переплачивать за «половинку» флагмана?

от автора

Nvidia окончательно запутывает нас своей линейкой Blackwell. Если посмотреть на PCI.ids выпущенных видеокарт профессионального семейства Blackwell, то мы увидим следующее:

  # RTX PRO Blackwell Series (Desktop / Workstation)  "10de:2bb5|RTX PRO 6000 Blackwell Server Edition"  "10de:2bb4|RTX PRO 6000 Blackwell Workstation Edition"  "10de:2bb1|RTX PRO 6000 Blackwell Max-Q"  "10de:2bb3|RTX PRO 5000 Blackwell"  "10de:2c31|RTX PRO 4500 Blackwell"  "10de:2c37|RTX PRO 4000 Blackwell"  "10de:2c36|RTX PRO 3000 Blackwell"  "10de:2d30|RTX PRO 2000 Blackwell"  "10de:2c35|RTX PRO 2000 Blackwell (Alternative)"  # RTX PRO Blackwell Series (Server / Embedded)  "10de:2c3a|RTX PRO 4500 Blackwell Server Edition"  "10de:2c77|RTX PRO 5000 Blackwell Embedded GPU"  # RTX PRO Blackwell Series (Laptop / Mobile)  "10de:2c38|RTX PRO 5000 Blackwell Generation Laptop GPU"  "10de:2f38|RTX PRO 3000 Blackwell Generation Laptop GPU"  "10de:2db8|RTX PRO 1000 Blackwell Generation Laptop GPU"

При этом каждой версии может также существовать несколько вариантов, как произошло с нашей сегодняшней испытуемой: NVIDIA RTX PRO 5000 Blackwell с увеличенным до 72 Гб объемом видеопамяти. То есть мы имеем две версии:

  • RTX PRO 5000 Blackwell (48 ГБ GDDR7): базовая версия, которая вышла изначально. В ней чипы памяти расположены с одной стороны платы. Карта поддерживает разделение MIG на два инстанса по 24 ГБ.

  • RTX PRO 5000 Blackwell (72 ГБ GDDR7): специальная high-memory версия, выпущенная позже для инференса более крупных ИИ-моделей. В память уже распаяна по технологии clamshell (двустороннее размещение чипов на плате). Поддерживает MIG в режиме 2 x 36 ГБ.

Мировая цена на базовую модель на 48 ГБ начинается в текущих реалиях от $5000. Версия на 72 ГБ оценивается уже от $9999 (дороже в два раза). В России PRO 5000 на 48 ГБ можно найти в среднем от 700 000 рублей, а за PRO 5000 на 72 ГБ попросят уже от 1 000 000 рублей.

Серверы с GPU NVIDIA и AMD

Выделенные и виртуальные серверы с графическими картами последних и предыдущих поколений с почасовой оплатой

Посмотреть

Но если сравнить ее с флагманом PRO 6000 Blackwell, то покупка на первый взгляд кажется спорной:

Характеристика

RTX PRO 5000 (72 ГБ)

RTX PRO 6000 (96 ГБ)

Объем видеопамяти

72 ГБ GDDR7 ECC

96 ГБ GDDR7 ECC

CUDA-ядра

14 080

24 064

Тензорные ядра

440 (5-е поколение)

752 (5-е поколение)

Пропускная способность

1 344 ГБ/с

1 792 ГБ/с

Производительность FP32

72,2 TFLOPS

125 TFLOPS

Энергопотребление (TDP)

300 Вт

600 Вт

С учетом первоначальной рекомендованной цены в $8000 за PRO 6000 Blackwell, существование 5000-й версии на 72 Гб должно вызывать вопросы. Но текущие реалии с ценой на память таковы, что сейчас на рынках карта стоит в два раза дороже (в РФ, например, за нее попросят от 2 000 000 рублей). При этом RTX PRO 5000 Blackwell при меньшем в два раза энергопотреблении в теории урезана по производительности не наполовину, а примерно на 40%. Зато с ней меньше проблем с питанием и охлаждением.

По форм-фактору всё стандартно: двухслотовое исполнение полной высоты и длины (FHFL) с активной системой охлаждения турбинного типа (blower). Такое же, как и у модели RTX PRO 6000.

Устанавливаем и тестируем

Мы раздобыли такую карту и провели с ней сравнительные тесты. Просим коллег собрать сервер, ставим Ubuntu 24.04 и драйвера с помощью нашего обновленного скрипта.

Затем запускаем наш GPU-тест. Увы, не получилось заполучить RTX PRO 6000 для получения данных по всем моделям, поэтому сравнение делали на DeepSeek R1.

GPU

VRAM

Model

Tokens/sec (average)

max ctx

Load (sec) average

Generate (sec) average

NVIDIA RTX PRO 5000 Blackwell

72 GB

deepseek-r1:32b

50.77

128 000

4.32

50.69

NVIDIA RTX PRO 5000 Blackwell

72 GB

deepseek-r1:70b

25.08

96 000

6.67

99.12

NVIDIA RTX PRO 5000 Blackwell

72 GB

gpt-oss:120b

156.52

128 000

9.43

21.70

NVIDIA RTX PRO 5000 Blackwell

72 GB

qwen3-coder-next:q4_K_M

192.13

128 000

7.50

14.97

NVIDIA RTX 6000 PRO Blackwell (gen5)

96 GB

deepseek-r1:32b

58.73

128 000

2.44

42.91

NVIDIA RTX 6000 PRO Blackwell (gen5)

96 GB

deepseek-r1:70b

30.19

112 000

4.5

84,23

NVIDIA RTX A5000 (gen3)

24 GB

deepseek-r1:32b

25.77

12 000

11.49

94.10

2xAMD RADEON AI PRO R9700

2×32 GB

deepseek-r1:32b

25.90

96 000

15.2

92.1

3xAMD RADEON AI PRO R9700

3×32 GB

deepseek-r1:70b

12.77

76 000

17.0

210.1

3×AMD RADEON AI PRO R9700

3×32 GB

gpt-oss:120b

60.75

128 000

21.05

57.34

3×AMD RADEON AI PRO R9700

3×32 GB

qwen3-coder-next:q4_K_M

37.42

128 000

17.85

79.55

72 ГБ видеопамяти позволяет PRO 5000 Blackwell работать с большим размером контекста (в тесте у нас до 128 000 токенов для моделей среднего размера, но можно и до их предела) и без проблем запускать тяжелые модели (вплоть до 120B). Скорость загрузки моделей в память (Load) очень высокая и составляет от 4 до 9 секунд, что говорит об отличной пропускной способности памяти.

Сравнение со старшей моделью (RTX 6000 PRO Blackwell, 96 ГБ)

Несмотря на то, что по «железу» карта проще. RTX PRO 5000 в наших тестах демонстрирует результаты, крайне близкие к флагману, уступая ему лишь в пределах 15-20%.

  • DeepSeek-R1 (32B). Разница в скорости минимальна. RTX 5000 выдает 50.77 токенов/сек против 58.73 у RTX 6000. Время генерации ответа отличается всего на 8 секунд. Обе карты удерживают максимальный контекст в 128 000 токенов.

  • DeepSeek-R1 (70B): на более тяжелой модели разрыв чуть заметнее: 25.08 против 30.19 токенов/сек (отставание ~17%). Здесь мы сталкиваемся с ограничением по памяти. RTX PRO 5000 может работать с контекстом лишь до 96 000 токенов, в то время как RTX PRO 6000 благодаря 96 ГБ VRAM позволяет держать контекст до 112 000 токенов.

Сравнение с предыдущим поколением (RTX A5000, 24 ГБ)

А вот здесь виден колоссальный скачок, связанный не только с архитектурой Blackwell, но и с объемом памяти. Причем мы тут даже не рассматриваем оптимизированные модели, например в NVFP4.

На модели deepseek-r1:32b новая RTX PRO 5000 работает почти в 2 раза быстрее предыдущего поколения (50.77 против 25.77 токенов/сек). Время ожидания ответа сократилось с 1.5 минут (94 сек) до 50 секунд. Сказывается и устаревший тип памяти, и архитектура.

При этом из-за скромных 24 ГБ видеопамяти старая RTX A5000 банально «задыхается» и жестко ограничивает контекст до 12 000 токенов. 72 ГБ у RTX PRO 5000 позволяют загрузить в 10 раз больше контекста (128 000 токенов и более), что кардинально меняет качество работы с длинными документами и историей диалогов.

Противостояние с AMD (Radeon AI PRO R9700)

Даже при использовании связок из нескольких карт AMD, одиночная RTX PRO 5000 показывает абсолютное доминирование по скорости генерации, что, скорее всего, связано с лучшей оптимизацией софта под архитектуру NVIDIA (CUDA). В защиту AMD стоит сказать, что даже три таких карты можно купить по цене одной PRO 5000 с 48 Гб памяти (цена на AI PRO R970 начинается сейчас от 200 000 рублей), при этом получив 96 Гб VRAM.

  • DeepSeek-R1 (32B). Одиночная RTX 5000 работает в 2 раза быстрее, чем связка из двух карт AMD R9 7700;

  • GPT-OSS (120B). RTX 5000 выдает невероятные 156.52 токена/сек, обходя связку из трех карт AMD (60.75 ток/сек) в 2.5 раза. Ответ от NVIDIA приходит за 21 секунду, а от AMD ответ приходится ждать почти минуту (57 секунд);

  • Qwen3-Coder-Next (q4_K_M): Тут мы видим полный разгром лагеря «красных». RTX 5000 генерирует 192,13 токена/сек, что более чем в 5 раз быстрее, чем три карты от AMD (37,42 ток/сек). Ответ пишется за 15 секунд, в то время как связка AMD тратит на это почти 80 секунд.

Карты AMD (особенно в связках) берут исключительно объемом памяти и ценой, но по скорости они проигрывают одной карте среднего ценового сегмента на чипе NVIDIA семейства Blackwell.

Попробуем в реальной задаче

Тесты тестами, но работать нам не с ними. Поэтому пробуем GPU в реальной задаче, а именно попробуем вайбкодить в MiMo Code (это клон Open Code от Xiaomi). Подключаемся в нем к Ollama к модели Qwen3-Coder-Next и даем задачу по работе с реальным проектом. (я взял свой проект товароучетной системы с поддержкой маркировки «Честный знак»).

Карта выдавала в среднем 100–120 токенов в секунду, прекрасно работала с агентскими задачами и начала притормаживать, только когда размер контекста стал уходить за 200 000 токенов (у самой модели предел 256 000).

На более громоздкой модели (gpt-oss-120b) результаты были поскромней, порядка 40–50 токенов в секунду, но тоже всё работало сравнимо с уровнем скорости платной подписки на модели Xiaomi.

Вердикт

Если бы я писал эту статью полгода назад, то в вердикте бы прозвучало «лучше чуть доплатить и взять RTX PRO 6000 Blackwell».

Но в текущих реалиях цен и дефицита памяти NVIDIA RTX PRO 5000 Blackwell — это идеальная «золотая середина» для энтузиастов и профессионалов, работающих с локальными нейросетями. Карта в инференсе на практике уступает топовой RTX PRO 6000 всего на четверть, при этом потребляя в два раза меньше энергии, и она на голову превосходит прошлое поколение (A5000), убирая жесткие лимиты на длину контекста. 

За счет поддержки MIG 2 вы можете разделить ее на две изолированные друг от друга виртуальные карты по 36 Гб видеопамяти с гарантированным QoS, что позволит сэкономить на тех же виртуальных GPU-серверах.

Серверы с GPU NVIDIA и AMD

Выделенные и виртуальные серверы с графическими картами последних и предыдущих поколений с почасовой оплатой

Посмотреть

ссылка на оригинал статьи https://habr.com/ru/articles/1067786/