Привет, Хабр!
Чтобы сгенерировать одну иллюстрацию, проще всего открыть привычный чат с генератором изображений, описать сцену и выбрать лучший результат. Но как только картинка становится частью регулярного производства контента, одного поля для промпта начинает не хватать.
Хочется сохранять параметры, перезапускать удачный вариант с другим форматом, управляемо использовать референсы, подключать апскейл, а затем переносить всю цепочку в следующий проект. Здесь генератор постепенно превращается из инструмента «нарисуй картинку» в небольшой производственный конвейер.
В качестве микрокейса для обзора нашего решения я решил сделать в ComfyUI обложку для этой статьи — вместо того чтобы отправить тот же запрос в GPT Image. При этом ComfyUI я не устанавливал локально: арендовал RTX 5090 в GPUGO, выбрал готовый образ и получил ссылку на уже запущенный интерфейс.
Разберём, сколько этапов убирает такой образ, когда аренда мощной видеокарты действительно оправданна и как из одной обложки постепенно вырастает идея собственной контент-машины.
Зачем вообще уходить из обычного генератора изображений
GPT Image и похожие сервисы удобны тем, что скрывают почти всю техническую часть. Пользователю не нужно выбирать текстовый энкодер, VAE, семплер или способ загрузки весов. Написал запрос — получил изображение. Для одиночной картинки это часто лучший сценарий.
Но у такой простоты есть обратная сторона: пользователь управляет результатом в основном через диалог. Можно попросить изменить фон, композицию или материал объекта, но внутренний процесс остаётся скрытым. Сложнее превратить одну удачную генерацию в воспроизводимую последовательность операций.
ComfyUI построен иначе. Каждый этап здесь представлен отдельным узлом, а весь процесс сохраняется как workflow:
|
Этап |
Операция |
|---|---|
|
Ввод |
Промпт |
|
Вычисление · 01 |
Текстовый энкодер |
|
Вычисление · 02 |
Модель генерации |
|
Вычисление · 03 |
Латентное изображение |
|
Вычисление · 04 |
VAE |
|
Результат |
Готовая картинка |
Между этими блоками можно вставлять референсы, маски, ControlNet, LoRA, апскейлеры, обработку лиц, повторный проход и собственную логику. ComfyUI позиционируется именно как node-based engine, в котором видны модели, операции, параметры и связи между ними.
Мне было интересно проверить:
Насколько быстро можно превратить пустой удалённый сервер в рабочую визуальную студию и оставить себе не только итоговую картинку, но и повторяемый процесс её создания?
В обычном сценарии аренда GPU — это только начало
Сам факт аренды мощной видеокарты ещё не означает, что на ней можно сразу генерировать изображения.
На чистом Linux-сервере путь обычно выглядит примерно так:
Арендовать сервер ↓Подключиться по SSH ↓Проверить драйвер и CUDA ↓Установить Python и виртуальное окружение ↓Подобрать сборку PyTorch ↓Установить ComfyUI ↓Запустить его на внешнем интерфейсе ↓Разобраться с портами ↓Подключить Manager ↓Скачать модели ↓Начать работу
В идеальных условиях это не катастрофа. Установка ComfyUI оценивается примерно в 15 минут для Windows Portable и в 30 минут для Linux из исходников. Первая генерация потребует ещё около пяти минут — при условии, что модель уже скачана и всё запустилось с первого раза.
Проблема не столько в количестве команд, сколько в неопределённости. Версия PyTorch может не совпасть с CUDA, интерфейс может слушать только localhost, Manager — оказаться выключенным, а новый набор custom nodes — потребовать другую версию библиотеки.
Когда цель состоит в изучении Linux и ML-инфраструктуры, это полезный опыт. Когда нужно за вечер подготовить несколько иллюстраций, настройка среды становится побочной работой.
Как выглядит тот же путь в GPUGO
В моём случае последовательность сократилась до нескольких действий:
Выбрать видеокарту ↓Выбрать образ ComfyUI + Jupyter ↓Запустить аренду ↓Открыть выданную ссылку на ComfyUI ↓Загрузить готовый workflow ↓Подтянуть модели через Workflow Models ↓Начать генерацию
После старта инстанса в панели появляется ссылка на ComfyUI. Не нужно самостоятельно запускать процесс на порту 8188, настраивать проброс или открывать SSH-туннель.
Сам интерфейс при этом остаётся обычным ComfyUI. Это важно: речь не о закрытом генераторе, который только внешне напоминает знакомый инструмент, а о полноценной среде с workflow, моделями, custom nodes и доступом к файловой системе.
Подробно устройство интерфейса, базовые ноды, KSampler, VAE, ControlNet и варианты локальной установки уже разобраны в отдельном материале: «ComfyUI для начинающих: установка, настройка и первая генерация в 2026». Здесь повторять базовый курс не будем и сосредоточимся на рабочем сценарии.
Где берутся модели
Сам ComfyUI весит несравнимо меньше моделей. Основные файлы самых небольших могут занимать десятки гигабайт:
-
diffusion model непосредственно генерирует изображение;
-
text encoder переводит промпт в понятное модели числовое представление;
-
VAE преобразует внутреннее latent-представление в обычные пиксели;
-
дополнительные LoRA, ControlNet и апскейлеры расширяют workflow.
Раньше типичный процесс выглядел так: найти страницу модели, скачать файл, понять его тип и вручную положить в нужную папку внутри models/. Причём VAE, text encoder и diffusion model могут относиться к одной системе, но лежать в трёх разных каталогах.
В свежем ComfyUI часть этой рутины берут на себя встроенные шаблоны. При загрузке шаблона интерфейс проверяет наличие обязательных файлов и предлагает скачать недостающие модели. Manager также умеет управлять моделями и находить отсутствующие custom nodes.
При работе с образом GPUGO помогает раздел Workflow Models. Он показывает, каких весов не хватает открытому workflow, и позволяет инициировать их загрузку на сервер. Пользователь не пересылает многогигабайтный файл через свой компьютер и не раскладывает его вручную по директориям.
Само скачивание весов, разумеется, никуда не исчезает. Если комплект занимает 15–20 ГБ, его всё равно необходимо передать по сети и записать на диск. Готовый образ экономит время до и после загрузки:
-
среда уже установлена;
-
GPU уже виден внутри ComfyUI;
-
веб-интерфейс запущен;
-
модели загружаются на тот компьютер, где будут использоваться;
-
шаблон знает, какие компоненты ему нужны.
Корректнее поэтому говорить не «модель запускается мгновенно», а так:
В хорошем случае готовый образ экономит около 15–30 минут установки. В неудачном — вечер поиска несовместимой зависимости.
Микрокейс: создаём обложку для этой статьи
Задача довольно типичная для корпоративного блога. Нужна технологичная горизонтальная обложка без встроенного заголовка: сам заголовок Хабр всё равно покажет рядом.
Я сформулировал короткий бриф:
Формат: 780 × 440Сюжет:абстрактный граф;ощущение вычислительной мощности;связь между сервером, нодами и итоговым изображением.Стиль:современная редакционная иллюстрация;тёмный фон;фирменные световые акценты;без перегруженного киберпанка;без текста и случайных логотипов.
Пример промпта:
A wide high-detail technical product illustration on a deep matte charcoal background.On the left stands a large modular compute core made from a square matrix of softly rounded tiles. Some tiles glow warm coral red, several glow bright cyan, and the remaining tiles are dark inactive graphite. Every tile has a smooth solid front surface with no markings.The compute core has a detailed dark substrate, fine metallic edges, tiny ventilation structures, precise contacts and subtle internal illumination. It feels powerful, engineered and physically believable.From the right side of the compute core, multiple thin elegant cables flow toward the center of the composition. The cables connect to five floating rounded processing modules arranged in a clean horizontal sequence. Each module is a solid dark geometric object with smooth blank surfaces, precise edges and one tiny circular indicator light.The modules vary in size and depth, creating a rich layered processing pipeline. Coral light travels through the first connections and gradually transforms into cyan light near the final stage.On the right stands a large luminous cyan rectangular frame. Inside the frame is a highly detailed abstract crystalline composition made from sharp translucent glass fragments, folded metallic surfaces, dark graphite structures and restrained coral reflections.The complete scene forms a clear left-to-right transformation: dark modular compute structure, interconnected processing objects, finished crystalline visual output.Dense but organized composition. Large central objects. Strong visual hierarchy. Balanced use of the entire horizontal frame. Precise geometry. Crisp object boundaries. Fine surface detail. Controlled reflections. High local contrast. Sharp focus across the whole scene. Clean premium industrial design. Subtle three-dimensional depth. No haze and no soft-focus effects.Every visible front surface is completely blank and unmarked. The entire frame contains only geometric objects, cables, materials, colored light and abstract artwork.
Выбор модели
Для обложки корпоративной статьи важно учитывать не только качество, но и лицензию.
К примеру: FLUX.2 Klein существует в версиях 4B и 9B. Модель 4B распространяется под Apache 2.0 и допускает коммерческое использование. Старшая 9B-модель выпускается по некоммерческой лицензии, поэтому без отдельного соглашения её не стоит использовать для коммерческих материалов.
Поэтому для финальной обложки логичен FLUX.2 Klein 4B FP8. Он поддерживает:
-
text-to-image;
-
редактирование изображений;
-
работу с несколькими референсами;
-
быстрый distilled-режим.
Старшую 9B-версию разумнее оставить для исследований, прототипирования и проверки тяжёлых workflow, если лицензия конкретного проекта допускает её использование.
Шаг 1. Запускаем среду
В каталоге GPUGO выбираем RTX 5090 и образ с ComfyUI и Jupyter. После запуска открываем ссылку на ComfyUI из карточки сервера.
Здесь можно было бы начать писать команды установки, но именно этот этап образ и должен устранять. Терминал остаётся доступен через Jupyter или SSH для нестандартных задач, однако для базового сценария он не нужен.

Шаг 2. Загружаем готовый workflow
В ComfyUI открываем библиотеку шаблонов и выбираем подходящий workflow:
FLUX.2 Klein 4B → image_flux2_klein_text_to_image
Для генерации первой версии обложки достаточно готового шаблона. Он загружает на рабочее поле связанную схему и избавляет от необходимости вручную подбирать совместимые узлы.
При этом устройство процесса не скрывается. Пользователь всё равно видит:
-
где загружается модель;
-
где обрабатывается промпт;
-
какой блок отвечает за семплирование;
-
где латент превращается в изображение;
-
куда сохраняется результат.

Шаг 3. Подтягиваем недостающие веса
Открываем Workflow Models, проверяем список компонентов и запускаем загрузку.
Некоторые модели на Hugging Face требуют авторизации или предварительного принятия лицензии. В таком случае одного нажатия недостаточно: придётся войти в аккаунт и подтвердить условия владельца модели.
Но вручную определять, является ли файл основной моделью, VAE или текстовым энкодером, уже не приходится — workflow сам сообщает, какие компоненты ему нужны.
Шаг 4. Не ищем идеальную картинку с первого раза
Вместо одного запуска полезнее сразу сделать серию вариантов с разными seed.
Это один из случаев, когда быстрый локальный инференс удобнее диалогового редактирования. Можно оставить модель, workflow и промпт неизменными, меняя только seed. Затем вернуться к понравившейся версии и точно повторить её.
Workflow также можно сохранить вместе с параметрами и использовать для следующей обложки.
Шаг 5. Сохраняем не только PNG
После завершения сессии стоит скачать:
-
итоговую обложку;
-
исходник большего разрешения;
-
JSON-файл workflow;
-
использованный промпт;
-
несколько альтернативных вариантов.
Так одна обложка превращается в небольшой воспроизводимый проект, а не остаётся случайно удачной картинкой в истории чата. Данные после завершения аренды на GPUGO можно держать до 12 часов без продления, но если нужно зафиксировать результаты прогона, то лучше выгрузить себе /workspace



Когда пригодится именно RTX 5090
1. Когда нужен быстрый цикл итераций
В производстве контента редко побеждает первая картинка. Обычно приходится:
-
сравнить несколько seed;
-
попробовать разные соотношения сторон;
-
проверить несколько промптов;
-
прогнать редактирование;
-
сделать апскейл;
-
повторить цикл для другого формата.
Разница между несколькими секундами и десятками секунд не выглядит драматичной на одном запуске. На сотне итераций она уже превращается в рабочее время.
2. Когда workflow состоит не из одной модели
Свободная VRAM нужна не только генератору. В одном графе могут одновременно участвовать:
Diffusion model+ text encoder+ VAE+ несколько референсов+ ControlNet+ IPAdapter+ апскейлер+ detailer+ повторный проход
На карте с небольшим объёмом памяти ComfyUI начинает выгружать компоненты в системную RAM и возвращать их обратно. Такой offload позволяет запустить тяжёлый workflow, но увеличивает паузы между этапами.
32 ГБ RTX 5090 дают запас для более сложного графа и уменьшают количество таких переключений.
3. Когда хочется проверить старшие модели
Некоторые современные модели в квантизированном виде занимают почти всю память RTX 5090. На картах с 16 или 24 ГБ они либо не запускаются, либо требуют агрессивной выгрузки компонентов в RAM.
Для коммерческой обложки важно отдельно проверить лицензию конкретной модели. Однако для исследований и разработки прототипов наличие 32 ГБ открывает класс workflow, которые на массовых видеокартах приходится сильно упрощать.
4. Когда изображение — только первый этап
Удачный статичный кадр можно передать дальше:
Обложка ↓варианты для социальных сетей ↓вертикальный формат ↓анимация отдельных элементов ↓короткий image-to-video ролик
Современные видеомодели заметно тяжелее генераторов изображений. Даже 32 ГБ не гарантируют, что любой video workflow пойдёт без компромиссов, но дают существенно больше свободы в выборе разрешения, длительности, квантизации и дополнительных этапов.
5. Когда мощность нужна эпизодически
Покупка RTX 5090 оправданна, если она загружена регулярно. Если же тяжёлый контент-пакет собирается раз в неделю или несколько раз в месяц, почасовой инстанс может быть рациональнее собственной рабочей станции.
Подход GPUGO хорошо ложится именно на интенсивные сессии:
Запустил среду ↓подготовил серию материалов ↓скачал результаты и workflow ↓остановил аренду
Оценивать при этом стоит не только стоимость одного часа, но и общее время выполнения задачи. Более мощная карта может оказаться выгоднее, если тот же набор генераций на слабом GPU выполняется в несколько раз дольше.
Насколько готовый образ действительно ускоряет работу
Сравним не скорость самой нейросети, а путь до неё.
|
Этап |
Чистый Linux-сервер |
Образ GPUGO |
|---|---|---|
|
Драйверы и CUDA |
Проверка и возможная настройка |
Уже подготовлены |
|
Python и PyTorch |
Установка и подбор версий |
Уже установлены |
|
ComfyUI |
Клонирование и зависимости |
Уже запущен |
|
Внешний доступ |
Порт, firewall или туннель |
Готовая ссылка |
|
Manager и ноды |
Установка и перезапуск |
Входят в среду |
|
Модели |
Ручное скачивание и каталоги |
Workflow Models |
|
Первая генерация |
После настройки всей среды |
После загрузки весов |
В штатном сценарии разница составляет примерно 15–30 минут, которые потребовались бы на обычную установку. Но это нижняя граница. Она не учитывает:
-
обновление драйвера;
-
конфликт версий PyTorch;
-
проблемы custom nodes;
-
неверно открытый порт;
-
неправильную директорию модели;
-
необходимость пересобрать окружение.
Поэтому главное преимущество образа — не обещание «первой картинки за 60 секунд». Оно в другом: время запуска становится более предсказуемым.
От одной обложки к собственной контент-машине
Обложка — намеренно маленький пример. Она позволяет проверить всю цепочку без попытки сразу построить огромную автоматизацию.
Следующий шаг — превратить эту последовательность в более универсальную систему.
В общих чертах будущая контент-машина должна будет принимать:
-
тему материала;
-
краткий бриф;
-
визуальные референсы;
-
правила бренда;
-
список необходимых форматов.
А возвращать не одну картинку, а согласованный пакет:
Ключевой визуал├── обложка статьи├── квадратный анонс├── вертикальный формат├── альтернативы для A/B-теста└── заготовка для короткой анимации
Важно, чтобы это была не кнопка «сделать много картинок». Ценность появляется, когда разные результаты сохраняют общую композиционную логику, цвета, материалы и стиль.
ComfyUI подходит для такого сценария по трём причинам:
-
Workflow можно хранить и версионировать.
-
Каждый этап можно заменить независимо от остальных.
-
Граф можно запускать не только из интерфейса, но и программно через API.
Конкретную архитектуру, набор моделей и внутренние ветвления пока оставлю за рамками этой статьи. Сначала нужно проверить, насколько хорошо система переживает смену темы, форматов и референсов — и не превращается ли красивый граф в конструкцию, которую невозможно поддерживать.
ComfyUI начинает выигрывать, когда требуется контролировать не только результат, но и процесс:
-
создавать серии;
-
повторять параметры;
-
менять отдельные этапы;
-
работать с открытыми весами;
-
использовать собственные референсы;
-
собирать из генерации производственный workflow.
Вывод
Мой микрокейс можно было решить одним сообщением в GPT Image. Но тогда результатом была бы только обложка.
В ComfyUI результат состоит из двух частей:
-
самой картинки;
-
workflow, который объясняет, как она была получена и как получить следующую.
Готовый образ GPUGO убирает наиболее скучную часть эксперимента. После аренды RTX 5090 пользователь получает ссылку на уже работающий ComfyUI, открывает шаблон и загружает необходимые модели через Workflow Models. Время уходит не на согласование CUDA с PyTorch, а на промпт, композицию и отбор вариантов.
Для одной генерации 32 ГБ VRAM могут быть избыточны. Для серийной работы, тяжёлых моделей, многореференсного редактирования, ControlNet-стеков, апскейла и видео этот запас уже меняет доступный класс задач.
Обложка в таком случае становится не конечной целью, а первым узлом более крупной системы — временной облачной контент-студии, которую можно включить на несколько часов, выполнить весь производственный цикл и выключить до следующего проекта.
Сайт компании: https://gpugo.ru/
Наш телеграм-канал: https://t.me/GpuGo
ссылка на оригинал статьи https://habr.com/ru/articles/1062944/