Нейросеть для генерации изображений сегодня упирается не в разрешение и не в анатомию, а в одну неочевидную вещь: картинка получается слишком чистой, чтобы сойти за фотографию. Разберём восемь моделей, условия доступа из России, готовые запросы на русском и один сквозной пример, который прогоним от первой неудачной попытки до достоверного кадра. Все модели открываются из одного аккаунта на Umnik AI, оплата рублями картой российского банка.

Сквозной пример будет такой: нужен портрет человека за столиком кофейни, свет из окна сбоку, в руке чашка. Сцена нарочно бытовая, потому что именно на ней видны все типичные провалы: кожа, руки, вывеска на заднем плане и физика света.
Нейросеть для генерации изображений: почему результат не похож на фото

Начну с технической части, без которой дальнейшее лишено смысла. Подпишись на Telegram-канал Umnik AI и получи 50 токенов бесплатно, их хватит на тесты из статьи.
Реальная фотография это набор дефектов. Матрица даёт шум, тем заметнее, чем меньше света. Объектив даёт виньетирование по углам, хроматические аберрации на контрастных границах и падение резкости к краю кадра. Глубина резкости конечна, поэтому что-то всегда чуть расфокусировано. Диафрагма формирует боке определённой формы.
Диффузионная модель не снимает сцену, а достраивает её из шума, и на выходе даёт изображение без единого из этих артефактов: резкость равномерная по всему кадру, шума нет, углы такие же яркие, как центр. Мозг не умеет назвать причину, но опознаёт неправильность мгновенно.
Отсюда первый практический вывод, который меняет результат сильнее любой смены модели: дефекты съёмки нужно запрашивать явно. Не «фотореалистично», а конкретно: умеренный шум, мягкие углы, малая глубина резкости, небольшая хроматика на контрастных границах.
Попробовать разницу можно в разделе генерации.
ТОП-8 нейросетей для создания картинок
Краткий список, по абзацу на каждую. Каждое название открывает нужный раздел.
Nano Banana Pro. Лучшее сходство при работе с лицом по загруженному фото. Основной выбор, когда на картинке должен быть конкретный узнаваемый человек.
Flux 2 Pro. Сильнее всех в материалах и фактуре: ткань, металл, стекло, кожа с настоящим подповерхностным рассеянием. Главный инструмент для реализма.
GPT Image 2.5 Sunburst. Единственная, кто уверенно держит читаемый текст в кадре. Вывески, упаковка, надписи на экранах.
Imagen 4 Ultra. Верный масштаб и архитектура. Интерьеры, улицы, всё, где важны пропорции относительно человека.
Midjourney. Сильная художественная подача и композиция. Берут, когда нужна не документальная точность, а выразительный кадр.
Gemini 3.1 Pro. Не генератор, а мультимодальная модель: смотрит на готовую картинку и говорит, что именно в ней не так. Незаменима на этапе разбора неудачных дублей.
Улучшение качества фото. Готовый инструмент для подготовки исходника. Мягкий снимок после мессенджера модель достраивает по догадке, и это главный источник брака.
Замена фона. Готовый инструмент, когда объект удачный, а окружение нет. Дешевле, чем перегенерировать сцену целиком.
Переключение между ними не требует отдельных подписок, условия лежат на странице тарифов.
Что выбрать: генерацию изображений по тексту или по фото?

Два режима решают разные задачи, и путать их дорого.
|
|
По тексту |
По фото |
|---|---|---|
|
Что на входе |
только описание |
ваш снимок плюс описание |
|
Внешность человека |
сгенерированная, неповторяемая |
сохраняется с исходника |
|
Свобода композиции |
полная |
ограничена кадрировкой снимка |
|
Повторить того же человека |
нельзя |
можно |
|
Сколько попыток обычно нужно |
5-10 |
2-3 |
|
Где ломается чаще |
анатомия, пропорции |
свет и границы вставки |
Правило простое: если на картинке должен быть конкретный человек, режим только по фото. Текстовое описание внешности не воспроизводит одно и то же лицо дважды, даже при идентичном запросе.
Для нашего сквозного примера берём второй режим: посетитель кофейни должен быть узнаваемым.
Как сделать реалистичное фото нейросетью: пример до и после
Разберём сквозной пример по шагам, с реальными формулировками.
Попытка первая, как делают почти все. Запрос звучит так:
Фотореалистичный портрет мужчины в кофейне, свет из окна, в руке чашка, высокое качество, 4K, детализация.
Что получается. Технически безупречная картинка, которая ни на секунду не обманывает. Кожа гладкая и матовая, резкость одинаковая от центра до углов, шума нет вообще, чашка держится в руке неестественно ровно, на вывеске за спиной вместо букв орнамент. Слова «высокое качество» и «4K» не улучшают результат, они только смещают модель в сторону рекламного глянца.
Попытка вторая. Тот же кадр, но запрос переписан:
Портрет мужчины с приложенного фото за столиком кофейни. Лицо в точности как на исходнике. Свет: большое окно слева, мягкий рассеянный дневной свет, на правой щеке лёгкая тень. Там, где ткань тонкая, кожа просвечивает тёплым красноватым оттенком: край уха, крылья носа, пальцы вокруг чашки. Оптика: снято на полный кадр, объектив 50 мм, диафрагма 1.8. Глаза в фокусе, ухо уже слегка мягче, задний план размыт. К углам кадра резкость падает, есть лёгкое затемнение по краям. Плёнка: умеренный шум в тенях, чуть заметная цветная кайма на контрастных границах. Руки: чашка стоит на столе, пальцы лежат на ней расслабленно, большой палец сверху. Пять пальцев, ногти обычной длины. Фон: не добавляй читаемых надписей, вывеска вне фокуса.
Что изменилось. Ни одного слова про качество и разрешение, зато семь конкретных физических требований. Модель не умеет оценивать качество, она умеет воспроизводить названные признаки.
Результат. Кожа получает объём, углы кадра садятся, руки перестают быть проблемой, потому что поза задана словами, а не оставлена на усмотрение модели.
Собрать то же самое можно в разделе генерации.
1. Flux 2 Pro: материалы и реалистичная кожа
Сильная сторона. Единственная модель в подборке, которая честно отрабатывает подповерхностное рассеяние: край уха на фоне окна действительно светится тёплым, а не просто становится ярче. Плюс ткань, металл и стекло ведут себя как разные материалы, а не как одинаково гладкая поверхность.
Ограничение. Слабее держит сходство с загруженным лицом. В конвейере её обычно ставят вторым проходом, после модели на сходство.
Запрос.
Кожа с подповерхностным рассеянием: тёплое красноватое свечение там, где ткань тонкая, на просвет. Поры видны только на ближней к свету стороне. Ткань одежды с различимым переплетением нити.
Открыть Flux 2 Pro.
2. Nano Banana Pro: сходство с загруженным лицом
Сильная сторона. Точнее остальных переносит узнаваемость конкретного человека на сгенерированную сцену. Если на картинке должен быть не абстрактный мужчина, а конкретный, начинать нужно отсюда.
Ограничение. Материалы отрабатывает слабее профильной модели, поэтому кадр часто требует второго прохода по фактуре.
Запрос.
Человек с приложенного фото, лицо в точности как на исходнике: разрез глаз, форма носа, линия бровей. Поместить в описанную сцену, подчинив свету сцены, а не свету исходника.
Открыть Nano Banana Pro.
3. GPT Image 2.5 Sunburst: читаемый текст в кадре
Сильная сторона. Держит буквы. Вывеска, ценник, упаковка, надпись на экране ноутбука: у остальных моделей всё это превращается в орнамент через пару символов.
Ограничение. Тяготеет к студийной чистоте, для документальной эстетики дефекты придётся запрашивать отдельно и настойчиво.
Запрос.
На вывеске за спиной героя текст: [ваш текст]. Буквы чёткие и читаемые, шрифт без засечек, равномерный интервал. Остальная часть кадра в лёгком расфокусе.
Открыть GPT Image 2.5 Sunburst.
4. Imagen 4 Ultra: пропорции и интерьер
Сильная сторона. Строит пространство с верным масштабом: высота потолка, ширина столика, размер окна относительно человека. Ошибка масштаба это самый тихий брак: картинка выглядит странно, а причину назвать не получается.
Ограничение. На крупном плане сходство лица уступает профильной модели.
Запрос.
Интерьер кофейни с правильными пропорциями относительно сидящего человека: высота столика около 75 сантиметров, окно от пола до потолка слева, глубина помещения различима.
Открыть Imagen 4 Ultra.
5. Midjourney: композиция и художественная подача
Сильная сторона. Чувство кадра. Там, где остальные модели ставят объект в центр и включают ровный свет, эта выстраивает композицию и работает с настроением.
Ограничение. Именно из-за художественности хуже подходит для документальной задачи: подтягивает кадр к красивому, а не к достоверному.
Запрос.
Кадр с несимметричной композицией, герой смещён из центра, взгляд направлен за пределы кадра. Контровой свет из окна, силуэт частично в тени.
Открыть Midjourney.
6. Gemini 3.1 Pro: разбор неудачного дубля
Сильная сторона. Не генерирует картинки, а смотрит на них и объясняет, что именно не так. Это самый недооценённый шаг конвейера: вместо того чтобы вслепую перегенерировать десять раз, вы получаете список конкретных дефектов.
Ограничение. Сама изображение не создаёт, работает как аналитик.
Запрос.
Посмотри на это сгенерированное изображение и перечисли признаки, по которым видно, что оно не является фотографией. По пунктам, с указанием места в кадре. Не оценивай художественность.
Открыть Gemini 3.1 Pro.
7. Улучшение качества фото: подготовка исходника
Сильная сторона. Восстанавливает детализацию исходника перед генерацией. Это шаг, который пропускают чаще всего: снимок после мессенджера уже потерял микродетали, и модель достраивает черты по догадке, а вы потом списываете результат на слабую модель.
Ограничение. Не создаёт детали, которых в снимке нет совсем. Из сильно размытого кадра резкий не сделает.
Как использовать. Открыть инструмент, загрузить исходник, забрать результат и только потом идти в генерацию. Промт не нужен.
8. Замена фона: когда объект удачный, а сцена нет
Сильная сторона. Решает частую ситуацию дешевле, чем полная перегенерация: человек получился отлично, а окружение развалилось. Меняется только фон, объект остаётся.
Ограничение. Требует, чтобы свет на объекте и в новом фоне совпадал по направлению, иначе результат выглядит аппликацией.
Как использовать. Загрузить кадр в инструмент и выбрать новое окружение. Промт не нужен.
Генерация изображений по описанию: порядок работы
Пять шагов, которые дают предсказуемый результат.
Шаг 1. Подготовить исходник
Если на картинке должен быть конкретный человек, взять фронтальный снимок при ровном свете и прогнать через улучшение качества. Качество исходника влияет на результат сильнее, чем выбор модели.
Шаг 2. Описать свет, а не качество
Убрать из запроса слова «высокое качество», «4K», «детализация», «фотореализм». Вместо них назвать источник света, его размер, направление и мягкость. Свет это половина достоверности кадра.
Шаг 3. Заказать дефекты оптики
Указать фокусное расстояние, диафрагму, падение резкости к краям, лёгкое затемнение углов, умеренный шум в тенях. Именно отсутствие этих дефектов выдаёт генерацию.
Шаг 4. Задать руки явно
Описать словами, что делают руки и где они лежат. Кисть имеет много степеней свободы и мало пикселей, поэтому оставленная на усмотрение модели рука ломается чаще всего.
Шаг 5. Разобрать неудачный дубль, а не перегенерировать вслепую
Отправить плохой результат в мультимодальную модель и попросить перечислить признаки генерации. Правки по списку работают быстрее и дешевле, чем десять случайных попыток.
Какую нейросеть для генерации изображений выбрать под свою задачу?
|
Задача |
Модель |
|---|---|
|
Конкретный узнаваемый человек |
|
|
Реалистичная кожа и материалы |
|
|
Текст, вывеска, упаковка |
|
|
Интерьер, архитектура, масштаб |
|
|
Выразительная композиция |
|
|
Разбор неудачного результата |
|
|
Подготовка исходного снимка |
|
|
Объект хорош, фон плох |
Скажу по опыту: рабочая связка почти всегда одна и та же. Сходство берут у одной модели, фактуру у второй, а третья объясняет, что осталось не так. Одной моделью реалистичный кадр собирается заметно дольше.
Можно ли пользоваться нейросетью для генерации изображений бесплатно?
|
Способ |
Что даёт |
Подвох |
|---|---|---|
|
Стартовые токены за подписку на Telegram-канал |
хватает на первые дубли |
разовое начисление |
|
Низкое разрешение на этапе подбора |
в разы дешевле |
финал всё равно в полном |
|
Одна композиция вместо пяти вариантов |
экономит перебор |
нужен точный запрос сразу |
|
Бесплатные сервисы в интернете |
ноль рублей |
водяной знак, очередь, загрузка своего лица на неизвестный сервер |
Честный ответ: попробовать и собрать несколько картинок бесплатно можно, поставить работу на поток нельзя. Каждая генерация это реальные вычисления. Актуальные условия лежат на странице тарифов.
Как работать с нейросетью для генерации изображений и не потратить лимит
Четыре приёма, которые экономят больше половины расхода.
Подбирать композицию в низком разрешении. Ракурс, свет и поза отлично видны на маленькой картинке. В полном размере генерируется только финал.
Не менять запрос после одного дубля. Разброс между заходами на одном и том же запросе больше, чем разница между двумя похожими формулировками. Три дубля дешевле, чем переписывание промта.
Не перегенерировать ради мелочи. Неудачный фон меняется заменой фона, мягкость лечится улучшением качества. Обе операции дешевле полной генерации.
Держать один отлаженный шаблон запроса. Блоки про свет, оптику и дефекты переносятся из задачи в задачу заменой двух-трёх строк.
Что проверить перед публикацией изображения?
-
резкость падает к краям кадра, а не одинакова везде
-
в тенях есть умеренный шум
-
углы слегка затемнены
-
кожа просвечивает тёплым там, где ткань тонкая
-
глубина резкости конечна, задний план размыт
-
на руках пять пальцев, суставы гнутся в правильную сторону
-
текст в кадре читается или намеренно вне фокуса
-
масштаб предметов соответствует человеку
-
тени от всех объектов идут в одну сторону
Частые вопросы
Какая нейросеть лучше для генерации изображений? Зависит от задачи. Для узнаваемого человека одна модель, для материалов другая, для текста третья. Универсальной нет, и выбор по одному рейтингу приводит к разочарованию.
Как сгенерировать реалистичное фото нейросетью? Описать не качество, а физику: источник света, фокусное расстояние, диафрагму, шум, падение резкости к краям. Слова «фотореализм» и «4K» результат не улучшают.
Почему кожа на сгенерированном фото выглядит пластиковой? Модель рисует её как непрозрачный материал. Реальная кожа пропускает свет на пару миллиметров, и это нужно запрашивать явно.
Как сделать картинку по описанию с конкретным человеком? Только через режим по фото. Текстовое описание внешности не воспроизводит одно и то же лицо дважды.
Почему нейросеть плохо рисует руки? У кисти много степеней свободы и мало пикселей в кадре, поэтому обучающих примеров на каждую конкретную конфигурацию мало. Помогает описать положение рук словами.
Можно ли получить читаемый текст на изображении? Да, но уверенно это делает только одна модель из подборки. Остальным текст лучше не поручать или ставить его отдельным слоем.
Как нейросети для создания картинок доработать почти готовый кадр? Не перегенерировать целиком. Фон меняется отдельным инструментом, мягкость лечится улучшением качества, это дешевле.
Как понять, что именно не так с картинкой? Отправить её в мультимодальную модель и попросить перечислить признаки генерации по пунктам с указанием мест в кадре.
Работают ли генераторы изображений в России? Да, если сервис не требует зарубежной карты и прокси. Все модели из подборки открываются из одного аккаунта на Umnik AI.
Заключение
Главный вывод парадоксальный: чтобы картинка выглядела как фотография, её нужно намеренно испортить. Шум в тенях, падение резкости к углам, затемнение краёв, конечная глубина резкости. Модель по умолчанию выдаёт изображение без единого дефекта съёмки, и именно это выдаёт её быстрее анатомических ошибок.
Второй вывод про кожу. Пластиковый вид лечится не порами и морщинами, а требованием подповерхностного рассеяния: свет должен проходить сквозь тонкие ткани и возвращаться тёплым. Одна фраза в запросе меняет портрет сильнее, чем смена модели.
Возвращаясь к нашему примеру с кофейней: от бесполезного «фотореалистично, 4K» до достоверного кадра оказалось семь конкретных физических требований и ни одного слова про качество. Все восемь инструментов открываются из одного аккаунта на Umnik AI, оплата рублями картой российского банка.
ссылка на оригинал статьи https://habr.com/ru/articles/1084346/