Nvidia окончательно запутывает нас своей линейкой Blackwell. Если посмотреть на PCI.ids выпущенных видеокарт профессионального семейства Blackwell, то мы увидим следующее:
# RTX PRO Blackwell Series (Desktop / Workstation) "10de:2bb5|RTX PRO 6000 Blackwell Server Edition" "10de:2bb4|RTX PRO 6000 Blackwell Workstation Edition" "10de:2bb1|RTX PRO 6000 Blackwell Max-Q" "10de:2bb3|RTX PRO 5000 Blackwell" "10de:2c31|RTX PRO 4500 Blackwell" "10de:2c37|RTX PRO 4000 Blackwell" "10de:2c36|RTX PRO 3000 Blackwell" "10de:2d30|RTX PRO 2000 Blackwell" "10de:2c35|RTX PRO 2000 Blackwell (Alternative)" # RTX PRO Blackwell Series (Server / Embedded) "10de:2c3a|RTX PRO 4500 Blackwell Server Edition" "10de:2c77|RTX PRO 5000 Blackwell Embedded GPU" # RTX PRO Blackwell Series (Laptop / Mobile) "10de:2c38|RTX PRO 5000 Blackwell Generation Laptop GPU" "10de:2f38|RTX PRO 3000 Blackwell Generation Laptop GPU" "10de:2db8|RTX PRO 1000 Blackwell Generation Laptop GPU"
При этом каждой версии может также существовать несколько вариантов, как произошло с нашей сегодняшней испытуемой: NVIDIA RTX PRO 5000 Blackwell с увеличенным до 72 Гб объемом видеопамяти. То есть мы имеем две версии:
-
RTX PRO 5000 Blackwell (48 ГБ GDDR7): базовая версия, которая вышла изначально. В ней чипы памяти расположены с одной стороны платы. Карта поддерживает разделение MIG на два инстанса по 24 ГБ.
-
RTX PRO 5000 Blackwell (72 ГБ GDDR7): специальная high-memory версия, выпущенная позже для инференса более крупных ИИ-моделей. В память уже распаяна по технологии clamshell (двустороннее размещение чипов на плате). Поддерживает MIG в режиме 2 x 36 ГБ.
Мировая цена на базовую модель на 48 ГБ начинается в текущих реалиях от $5000. Версия на 72 ГБ оценивается уже от $9999 (дороже в два раза). В России PRO 5000 на 48 ГБ можно найти в среднем от 700 000 рублей, а за PRO 5000 на 72 ГБ попросят уже от 1 000 000 рублей.
|
Серверы с GPU NVIDIA и AMD Выделенные и виртуальные серверы с графическими картами последних и предыдущих поколений с почасовой оплатой |
Но если сравнить ее с флагманом PRO 6000 Blackwell, то покупка на первый взгляд кажется спорной:
|
Характеристика |
RTX PRO 5000 (72 ГБ) |
RTX PRO 6000 (96 ГБ) |
|---|---|---|
|
Объем видеопамяти |
72 ГБ GDDR7 ECC |
96 ГБ GDDR7 ECC |
|
CUDA-ядра |
14 080 |
24 064 |
|
Тензорные ядра |
440 (5-е поколение) |
752 (5-е поколение) |
|
Пропускная способность |
1 344 ГБ/с |
1 792 ГБ/с |
|
Производительность FP32 |
72,2 TFLOPS |
125 TFLOPS |
|
Энергопотребление (TDP) |
300 Вт |
600 Вт |
С учетом первоначальной рекомендованной цены в $8000 за PRO 6000 Blackwell, существование 5000-й версии на 72 Гб должно вызывать вопросы. Но текущие реалии с ценой на память таковы, что сейчас на рынках карта стоит в два раза дороже (в РФ, например, за нее попросят от 2 000 000 рублей). При этом RTX PRO 5000 Blackwell при меньшем в два раза энергопотреблении в теории урезана по производительности не наполовину, а примерно на 40%. Зато с ней меньше проблем с питанием и охлаждением.
По форм-фактору всё стандартно: двухслотовое исполнение полной высоты и длины (FHFL) с активной системой охлаждения турбинного типа (blower). Такое же, как и у модели RTX PRO 6000.

Устанавливаем и тестируем
Мы раздобыли такую карту и провели с ней сравнительные тесты. Просим коллег собрать сервер, ставим Ubuntu 24.04 и драйвера с помощью нашего обновленного скрипта.

Затем запускаем наш GPU-тест. Увы, не получилось заполучить RTX PRO 6000 для получения данных по всем моделям, поэтому сравнение делали на DeepSeek R1.
|
GPU |
VRAM |
Model |
Tokens/sec (average) |
max ctx |
Load (sec) average |
Generate (sec) average |
|---|---|---|---|---|---|---|
|
NVIDIA RTX PRO 5000 Blackwell |
72 GB |
deepseek-r1:32b |
50.77 |
128 000 |
4.32 |
50.69 |
|
NVIDIA RTX PRO 5000 Blackwell |
72 GB |
deepseek-r1:70b |
25.08 |
96 000 |
6.67 |
99.12 |
|
NVIDIA RTX PRO 5000 Blackwell |
72 GB |
gpt-oss:120b |
156.52 |
128 000 |
9.43 |
21.70 |
|
NVIDIA RTX PRO 5000 Blackwell |
72 GB |
qwen3-coder-next:q4_K_M |
192.13 |
128 000 |
7.50 |
14.97 |
|
NVIDIA RTX 6000 PRO Blackwell (gen5) |
96 GB |
deepseek-r1:32b |
58.73 |
128 000 |
2.44 |
42.91 |
|
NVIDIA RTX 6000 PRO Blackwell (gen5) |
96 GB |
deepseek-r1:70b |
30.19 |
112 000 |
4.5 |
84,23 |
|
NVIDIA RTX A5000 (gen3) |
24 GB |
deepseek-r1:32b |
25.77 |
12 000 |
11.49 |
94.10 |
|
2xAMD RADEON AI PRO R9700 |
2×32 GB |
deepseek-r1:32b |
25.90 |
96 000 |
15.2 |
92.1 |
|
3xAMD RADEON AI PRO R9700 |
3×32 GB |
deepseek-r1:70b |
12.77 |
76 000 |
17.0 |
210.1 |
|
3×AMD RADEON AI PRO R9700 |
3×32 GB |
gpt-oss:120b |
60.75 |
128 000 |
21.05 |
57.34 |
|
3×AMD RADEON AI PRO R9700 |
3×32 GB |
qwen3-coder-next:q4_K_M |
37.42 |
128 000 |
17.85 |
79.55 |
72 ГБ видеопамяти позволяет PRO 5000 Blackwell работать с большим размером контекста (в тесте у нас до 128 000 токенов для моделей среднего размера, но можно и до их предела) и без проблем запускать тяжелые модели (вплоть до 120B). Скорость загрузки моделей в память (Load) очень высокая и составляет от 4 до 9 секунд, что говорит об отличной пропускной способности памяти.
Сравнение со старшей моделью (RTX 6000 PRO Blackwell, 96 ГБ)
Несмотря на то, что по «железу» карта проще. RTX PRO 5000 в наших тестах демонстрирует результаты, крайне близкие к флагману, уступая ему лишь в пределах 15-20%.
-
DeepSeek-R1 (32B). Разница в скорости минимальна. RTX 5000 выдает 50.77 токенов/сек против 58.73 у RTX 6000. Время генерации ответа отличается всего на 8 секунд. Обе карты удерживают максимальный контекст в 128 000 токенов.
-
DeepSeek-R1 (70B): на более тяжелой модели разрыв чуть заметнее: 25.08 против 30.19 токенов/сек (отставание ~17%). Здесь мы сталкиваемся с ограничением по памяти. RTX PRO 5000 может работать с контекстом лишь до 96 000 токенов, в то время как RTX PRO 6000 благодаря 96 ГБ VRAM позволяет держать контекст до 112 000 токенов.
Сравнение с предыдущим поколением (RTX A5000, 24 ГБ)
А вот здесь виден колоссальный скачок, связанный не только с архитектурой Blackwell, но и с объемом памяти. Причем мы тут даже не рассматриваем оптимизированные модели, например в NVFP4.
На модели deepseek-r1:32b новая RTX PRO 5000 работает почти в 2 раза быстрее предыдущего поколения (50.77 против 25.77 токенов/сек). Время ожидания ответа сократилось с 1.5 минут (94 сек) до 50 секунд. Сказывается и устаревший тип памяти, и архитектура.
При этом из-за скромных 24 ГБ видеопамяти старая RTX A5000 банально «задыхается» и жестко ограничивает контекст до 12 000 токенов. 72 ГБ у RTX PRO 5000 позволяют загрузить в 10 раз больше контекста (128 000 токенов и более), что кардинально меняет качество работы с длинными документами и историей диалогов.
Противостояние с AMD (Radeon AI PRO R9700)
Даже при использовании связок из нескольких карт AMD, одиночная RTX PRO 5000 показывает абсолютное доминирование по скорости генерации, что, скорее всего, связано с лучшей оптимизацией софта под архитектуру NVIDIA (CUDA). В защиту AMD стоит сказать, что даже три таких карты можно купить по цене одной PRO 5000 с 48 Гб памяти (цена на AI PRO R970 начинается сейчас от 200 000 рублей), при этом получив 96 Гб VRAM.
-
DeepSeek-R1 (32B). Одиночная RTX 5000 работает в 2 раза быстрее, чем связка из двух карт AMD R9 7700;
-
GPT-OSS (120B). RTX 5000 выдает невероятные 156.52 токена/сек, обходя связку из трех карт AMD (60.75 ток/сек) в 2.5 раза. Ответ от NVIDIA приходит за 21 секунду, а от AMD ответ приходится ждать почти минуту (57 секунд);
-
Qwen3-Coder-Next (q4_K_M): Тут мы видим полный разгром лагеря «красных». RTX 5000 генерирует 192,13 токена/сек, что более чем в 5 раз быстрее, чем три карты от AMD (37,42 ток/сек). Ответ пишется за 15 секунд, в то время как связка AMD тратит на это почти 80 секунд.
Карты AMD (особенно в связках) берут исключительно объемом памяти и ценой, но по скорости они проигрывают одной карте среднего ценового сегмента на чипе NVIDIA семейства Blackwell.
Попробуем в реальной задаче
Тесты тестами, но работать нам не с ними. Поэтому пробуем GPU в реальной задаче, а именно попробуем вайбкодить в MiMo Code (это клон Open Code от Xiaomi). Подключаемся в нем к Ollama к модели Qwen3-Coder-Next и даем задачу по работе с реальным проектом. (я взял свой проект товароучетной системы с поддержкой маркировки «Честный знак»).


Карта выдавала в среднем 100–120 токенов в секунду, прекрасно работала с агентскими задачами и начала притормаживать, только когда размер контекста стал уходить за 200 000 токенов (у самой модели предел 256 000).
На более громоздкой модели (gpt-oss-120b) результаты были поскромней, порядка 40–50 токенов в секунду, но тоже всё работало сравнимо с уровнем скорости платной подписки на модели Xiaomi.

Вердикт
Если бы я писал эту статью полгода назад, то в вердикте бы прозвучало «лучше чуть доплатить и взять RTX PRO 6000 Blackwell».
Но в текущих реалиях цен и дефицита памяти NVIDIA RTX PRO 5000 Blackwell — это идеальная «золотая середина» для энтузиастов и профессионалов, работающих с локальными нейросетями. Карта в инференсе на практике уступает топовой RTX PRO 6000 всего на четверть, при этом потребляя в два раза меньше энергии, и она на голову превосходит прошлое поколение (A5000), убирая жесткие лимиты на длину контекста.
За счет поддержки MIG 2 вы можете разделить ее на две изолированные друг от друга виртуальные карты по 36 Гб видеопамяти с гарантированным QoS, что позволит сэкономить на тех же виртуальных GPU-серверах.
|
Серверы с GPU NVIDIA и AMD Выделенные и виртуальные серверы с графическими картами последних и предыдущих поколений с почасовой оплатой |
ссылка на оригинал статьи https://habr.com/ru/articles/1067786/