Как я объединил четыре Mac Studio в один компьютер с 1,5 ТБ – и запустил ИИ, который не влезает ни в одну видеокарту

от автора

Компания Apple предоставила мне этот кластер из Mac Studio для тестирования технологии RDMA через Thunderbolt – новой фичи в macOS 26.2. Проще всего обкатать её в деле с помощью Exo 1.0 – открытого инструмента для распределения задач искусственного интеллекта в локальных сетях. Благодаря технологии RDMA, подключённые маки объединяют свою оперативную память в единый исполинский пул, что даёт колоссальный буст при запуске тяжеловесных нейросетей.

Сияющая стопка Mac Studio с суммарным объёмом унифицированной памяти в 1,5 ТБ обойдётся в 40 000 долларов. К счастью, Apple просто одолжила мне эти компьютеры для тестов. Также хочу сказать огромное спасибо компании DeskPi, которая прислала мне компактную четырёхопорную мини-стойку, куда этот кластер так аккуратно и поместился.

На моей памяти в последний раз Apple всерьёз заявляла о себе в сфере высокопроизводительных вычислений (HPC) ещё в начале нулевых – тогда они выпускали свои знаменитые серверы Xserve.

В те годы у купертиновцев было проприетарное решение для создания кластеров под названием Xgrid… которое в итоге провалилось. Несколько университетов ради интереса собрали на этой базе учебные кластеры, но широкого признания технология не получила. Сегодня и линейка Xserve, и сам Xgrid стали лишь блёклым воспоминанием из прошлого.

Не знаю, вышло ли это случайно или Apple вела тонкую долгосрочную игру, но Mac Studio на чипе M3 Ultra оказался идеальным инструментом для локального запуска нейросетей. А теперь, благодаря поддержке RDMA, задержка при обращении к памяти рухнула с 300 мкс до скромных < 50 мкс – и объединение машин в кластер наконец-то даёт реальный, ощутимый прирост производительности, жизненно необходимый для работы гигантских языковых моделей.

Вдобавок эти крохи превосходно справляются с творческими приложениями и даже несложными научными расчётами. При этом вся система потребляет менее 250 Вт электроэнергии и работает практически бесшумно, едва уловимо шелестя кулерами.

Два нижних компьютера в стойке оснащены исполинскими 512 ГБ объединённой памяти и 32 процессорными ядрами каждый – по цене $11 699 за штуку. Те два, что стоят сверху, несут на борту вдвое меньше памяти и стоят по $8 099 каждый.

Но на фоне недавних анонсов от конкурентов – например, систем DGX Spark от Nvidia или платформ на чипах AI Max+ 395 от AMD, где максимальный объём памяти упёрся в скромные 128 ГБ (что в четыре раза меньше!), – мне безумно захотелось испытать наш терабайтный кластер.

❯ Настольный дата-центр в миниатюре

Буквально за день до приезда компьютеров от Apple ребята из DeskPi невероятно вовремя подогнали мне новенькую открытую мини-стойку TL1.

Свой проект Project MINI RACK я запустил ещё в начале года. Его суть проста: дать обычным пользователям все преимущества серверного стоечного оборудования, но в аккуратном настольном формате, который легко поместится в углу кабинета.

К сожалению, сейчас на рынке практически нет готовых решений для монтажа Mac Studio в 10-дюймовую стойку – разве что вот этот корпус для 3D-печати. Так что я пошёл по пути наименьшего сопротивления и просто расставил их на обычных 10-дюймовых полках.

Пожалуй, главная головная боль при попытке запихнуть любой Mac (не имеющий шильдика Pro) в серверный шкаф – это кнопка включения. У Mac Studio она ютится сзади слева на скруглённой грани корпуса. А значит, при монтаже в стойку нужно как-то ухитряться до неё дотягиваться.

Открытая конструкция моей мини-стойки решает эту проблему – я могу просунуть руку сбоку и нащупать заветную кнопку. Правда, саму коробку Mac Studio при этом приходится придерживать другой рукой, иначе она так и норовит съехать по полке вперёд!

С другой стороны, порты на передней панели Mac Studio – настоящее спасение, когда нужно быстренько на месте подключить монитор и клавиатуру:

За что хочется хвалить Apple – так это за встроенный блок питания. Слишком много современных микро-ПК хвастаются компактностью лишь потому, что прячут за пределами корпуса огромный кирпич внешнего БП. Купертиновцы обошлись без этого костыля. Однако здесь всплывает другой нюанс: фирменные нестандартные кабели Apple (совсем не похожие на привычные компьютерные шнуры C13). Найти такие шнуры идеальной длины, чтобы красиво уложить их сзади и избежать лапши из проводов, – та ещё задачка.

В плане сетевого подключения DGX Spark от Nvidia кладёт детище Apple на лопатки. Они используют массивные прямоугольные порты QSFP (как на фото выше). Разъём держится мёртвой хваткой и при этом легко вставляется и извлекается.

У Mac Studio есть 10-гигабитный сетевой порт, однако по-настоящему быстрый интерконнект (выдающий в реальных тестах 50–60 Гбит/с) в экосистеме Apple ложится на плечи интерфейса Thunderbolt. Но даже фирменные люксовые кабели Apple по 70 долларов за штуку не вызывают безусловного доверия: в суровых серверных реалиях эта гирлянда USB-C вряд ли проживёт долго без случайных отключений.

Вообще, существует крепление ThunderLok-A – специальная пластина, фиксирующая кабель винтом, но сверлить резьбу в казённых Mac Studio ради этого эксперимента я, конечно же, не решился.

Кроме того, насколько мне известно, коммутаторов с поддержкой Thunderbolt 5 в природе пока не существует. Вы не можете просто воткнуть все маки в один центральный свитч – приходится соединять каждую машину с каждой напрямую, что порождает хаос из кабелей. На текущий момент по такой круговой схеме можно связать максимум четыре компьютера, хотя для нового Mac Studio это может быть не пределом (в Apple божатся, что поддержка RDMA работает на всех пяти портах Thunderbolt 5).

Но главный вопрос в другом: нужен ли вообще целый кластер из нескольких Mac Studio? Ведь даже одиночная малютка – это уже чистейший монстр, который по мощи легко тягается с четырьмя топовыми системами уровня DGX Spark или AI Max+ 395.

❯ Сравниваем мускулы: M3 Ultra лицом к лицу с конкурентами

Чтобы оценить масштаб трагедии, я прогнал базовый пакет тестов. Полный список результатов (более подробный, чем то, что поместилось в этот пост) я выложил в репозиторий sbc-reviews.

Для наглядности я сравнил наш M3 Ultra Mac Studio с:

  • Dell Pro Max на чипе GB10 (аналог Nvidia DGX Spark, но с более продуманным охлаждением);

  • материнской платой Framework Desktop (со свежим чипом AMD AI Max+ 395).

Начнём с классического Geekbench. Чип M3 Ultra, несмотря на процессорные ядра двухлетней давности, стирает соперников в порошок как в однопотоке, так и в многопоточном режиме (а в Geekbench 5, который лучше адаптирован под многоядерные процессоры, отрыв оказался ещё более разгромным).

Перейдём к суровому тесту двойной точности FP64 – легендарному тесту top500 HPL. M3 Ultra стал первым компактным ПК в моих руках, который сумел преодолеть планку в 1 терафлопс в вычислениях FP64. Он почти вдвое быстрее решения от Nvidia на чипе GB10, а флагманский кремний AMD AI Max и вовсе остался далеко позади.

С энергоэффективностью у процессора тоже всё славно, хотя в случае с Apple это норма жизни ещё с первых чипов А-серии. В режиме простоя вся эта махина потребляет ничтожные 10 ватт:

Да что говорить, у меня некоторые одноплатники (SBC) в простое жрут больше 10 ватт, а тут полноценный персональный суперкомпьютер!

В задачах инференса (работы нейросетей) M3 Ultra держится особняком, отлично показывая себя как на лёгких, так и на тяжёлых моделях:

Разумеется, запустить по-настоящему гигантские модели (вроде DeepSeek R1 или Kimi K2 Thinking) на одной машине из двух представленных конкурентов даже пытаться нет смысла – им банально не хватит памяти.

Понятно, что перед нами компьютер за 10 тысяч баксов. Логично ожидать чудес за такие деньги.

Но посмотрите на это с другой стороны: один-единственный Mac Studio на M3 Ultra выдаёт больше вычислительной мощности, чем весь мой кластер на платах Framework Desktop, съедая при этом вдвое меньше энергии. Я также сопоставил его с мини-кластером из двух систем Dell Pro Max на GB10 – и одиночный M3 Ultra всё равно доминирует по скорости и энергоэффективности, предлагая при этом двукратный перевес по объёму памяти.

❯ Маленькая стопка – большие хлопоты?

Но каково это – администрировать и объединять в единый кластер сразу четыре мака?

Главным камнем преткновения лично для меня стала сама macOS. Я фанат автоматизации и стараюсь автоматизировать вообще всё, до чего могу дотянуться. Я поддерживаю самый популярный Ansible-плейбук для настройки систем на macOS и с полной уверенностью могу заявить: администрировать Linux-кластеры в разы проще и приятнее.

С трудностями сталкиваешься в любом кластере, но сборка из маков без корпоративных систем управления (вроде MDM) подкидывает кучу нелепых проблем на ровном месте. Приведу простой пример: знали ли вы, что обновить систему (скажем, до macOS 26.2) через SSH невозможно физически? Вам в любом случае придётся тыкать мышкой по кнопкам в графическом интерфейсе.

Вместо того чтобы городить огород и подключать KVM-переключатели к каждому маку, я использовал встроенный инструмент «Общий экран» в macOS, чтобы удалённо раздать команды через классический рабочий стол.

❯ HPL и Llama.cpp на практике

Развернув стенд, я устроил замеры: прогнал тест HPL через обычный быстрый порт, а затем погонял утилиту llama.cpp по сети и по интерфейсу Thunderbolt 5.

На одном Mac Studio чип M3 Ultra выдал в HPL честные 1,3 терафлопс. Собрав все четыре в кучу, я выжал 3,7 терафлопс. Да, прирост получился не четырёхкратный (меньше 3x), однако нужно учесть, что у верхних двух маков на борту ровно вдвое меньше памяти, чем у нижних. Так что трёхкратное масштабирование – вполне закономерный и логичный результат.

Я также попробовал погонять HPL через Thunderbolt напрямую (без RDMA, дедовским методом через обычный TCP). Но не тут-то было: спустя минуту оба подопытных компьютера весело зависали и отправлялись в глухой ребут. Я планировал поэкспериментировать со специальной MLX-обёрткой mpirun от Apple, предназначенной как раз для создания распределённых сред, но, к сожалению, банально не успел настроить её до сдачи этого материала.

Следом пошли тесты llama.cpp на разных нейросетях. Я сравнил скорость работы через сетевое подключение 2.5GbE и шину Thunderbolt 5:

С точки зрения задержек Thunderbolt выигрывает вчистую – даже без включения хайтек-режима RDMA.

Все детальные логи тестов моего кластера через llama.cpp можно найти здесь – экономии времени ради я опустил кучу промежуточных графиков, оставив самое интересное.

❯ Заводим RDMA на маках

Свежий релиз Exo 1.0 состоялся как раз сегодня, и его ключевым гвоздём программы стала полноценная поддержка RDMA для связи маков по шине Thunderbolt 5 в единый бесшовный кластер.

Правда, чтобы активировать RDMA, вам придётся загрузиться в режим восстановления и вручную вбить команду в консоли:

  1. Полностью выключаем Mac Studio.

  2. Зажимаем кнопку питания на 10 секунд (пока на экране не появится загрузочное меню параметров запуска).

  3. Переходим в раздел «Options» и в верхнем меню «Utilities» открываем «Terminal».

  4. Пишем заветную фразу: rdma_ctl enable – и жмём Enter.

  5. Перезагружаем Mac Studio в обычном режиме.

Проделав этот ритуал со всеми маками, я начал закидывать в них по-настоящему КРУПНЫЕ языковые модели. Например, Kimi K2 Thinking весом под 600 с лишним гигабайт – запустить такое чудовище на одном компьютере просто нереально.

На самом деле дирижировать моделями на нескольких ПК умеет и llama.cpp, и Exo. Разница в том, что полноценный RDMA пока завезли только в Exo. Llama.cpp на сегодня полагается на старый добрый метод удалённого вызова процедур (RPC), который просто размазывает веса и слои нейросети по узлам кластера. Да, система масштабируется, но совершенно неэффективно: с подключением новых компьютеров накладные расходы растут.

Бенчмарк Qwen3 235B наглядно демонстрирует эту пропасть:

Проект Exo заметно ускоряется при добавлении новых узлов, выдавая уверенные 32 токена в секунду на полном кластере. Этого с лихвой хватит для вайбкодинга (когда вы просто набрасываете идеи ИИ-ассистенту), если вам близок такой формат работы.

Затем я перешёл к тяжёлой артиллерии: запустил модель DeepSeek V3.1 на колоссальные 671 миллиард параметров.

Я был слегка удивлён, заметив, что llama.cpp здесь всё-таки показала небольшой прирост скорости. Возможно, при ограничении сборки всего парой узлов сетевые задержки не так сильно бьют по производительности? Точно утверждать не берусь.

Ну а теперь обратимся к абсолютной вершине – самой большой языковой модели, которую я вообще когда-либо запускал локально: Kimi K2 Thinking.

Масштаб пугающий: перед нами модель на 1 триллион параметров (хотя благодаря хитрой MoE-архитектуре в каждый конкретный момент времени активны лишь 32 миллиарда – отсюда и литера А в индексе A32B).

И даже при таких заоблачных масштабах кластер выдаёт комфортные ~30 токенов в секунду.

Поработав вплотную с такими титанами, начинаешь понимать, что от нейросетей действительно есть толк – особенно когда они крутятся локально под твоим полным контролем.

Впрочем, сегодня мы собрались обсудить не практическую ценность ИИ, а возможности кластера Mac Studio, RDMA и Exo. И надо сказать, эта связка отработала великолепно… когда вообще соизволила работать.

❯ С граблями по жизни: вопросы стабильности

Сразу оговорюсь: для тестов мне предоставили самый свежий предрелизный софт. Огромное количество багов разработчики отлавливали и чинили прямо на ходу по моим отчётам.

Тем не менее сырость технологии RDMA через Thunderbolt видна невооружённым глазом. В редкие моменты гармонии всё летает без сучка и задоринки. Но если что-то шло наперекосяк… Скажем так: я ни разу не пожалел, что заранее настроил скрипты Ansible для быстрой отправки всего кластера в глухую перезагрузку.

Выше я уже упоминал о падениях HPL при попытке пустить вычисления по Thunderbolt. К тому же, даже если решить проблему со стабильностью, на закате 2025 года работающие RDMA-кластеры ограничиваются максимум четырьмя маками. В Apple обещают, что все пять разъёмов Thunderbolt 5 поддерживают RDMA, так что теоретически цепочку можно масштабировать и дальше. Но проверять это на практике пока никто не берётся.

Разработчики Exo уже подразнили публику идеей поставить DGX Spark перед кластером Mac Studio для ускорения обработки промптов. Может, заодно и поддержку Raspberry Pi вернут? Поживём – увидим.

❯ Мысли на будущее и открытые вопросы

Наш эксперимент оставил после себя массу вопросов без ответов:

  • Где чип M5 Ultra? Если бы Apple выкатила новое поколение этого процессора, рассчёты машинного обучения полетели бы в разы быстрее.

  • Решатся ли в Купертино возродить Mac Pro? Полноценная рабочая станция с кучей линий PCIe сняла бы все ограничения пропускной способности интерфейса Thunderbolt и вывела бы скорость кластеризации на космический уровень.

  • Появится ли на macOS поддержка SMB Direct? Это позволило бы сетевым хранилищам работать на скоростях физически подключённых дисков, что стало бы настоящим подарком для видеомонтажёров и всех, кто работает с терабайтами тяжеловесных медиаданных.

Наконец, что будет с другим софтом? Тот же проект llama.cpp и другие популярные открытые библиотеки могли бы получить колоссальный буст производительности при нативной поддержке технологии RDMA.

❯ Вместо заключения

В отличие от сотен стартапов, которые пиарятся на теме искусственного интеллекта, хайп вокруг решений Apple меня нисколько не раздражает. Mac Studio остается мощной, надёжной, тихой и безотказной рабочей станцией для повседневных профессиональных задач (у меня самого на столе верой и правдой трудится монструозный Mac Studio на M4 Max!).

Разъём Thunderbolt 5 выступает пресловутым бутылочным горлышком, не давая раскрыть весь потенциал этой начинки. Порты QSFP подошли бы серверной сборке куда лучше, но тогда компьютер мгновенно потерял бы привлекательность в глазах обычных пользователей, которым «просто нужна рабочая машинка».

Быть может, в качестве компромисса Apple стоит выпустить спецверсию, заменив стандартный Ethernet и пару Thunderbolt-портов на задней панели на один честный QSFP? Тогда мы смогли бы забыть про путаницу кабелей, использовать промышленные сетевые коммутаторы и собирать кластеры хоть из десятков таких крох…

Может быть интересно:
Перейти ↩

Новости, обзоры продуктов и конкурсы от команды Timeweb.Cloud — в нашем Telegram-канале 

ссылка на оригинал статьи https://habr.com/ru/articles/1061842/