Тестировал генерацию изображений в Nano Banana Pro: что работает, что нет

от автора

Несколько месяцев, несколько сотен генераций — честные выводы без маркетинга

Задача была прикладная: наладить поток визуального контента без фотостудии. Карточки товаров, имиджевые иллюстрации, визуалы для соцсетей. Студийная съёмка обходится в 25 000–44 000 ₽ на 50 снимков, плюс неделя ожидания — хотелось понять, насколько реально перевести это на нейросети.

Тестировал через Nano Banana Pro — русскоязычный интерфейс, токенная модель оплаты (можно считать реальную стоимость каждой генерации), в Pro-версии нет суточного лимита на количество попыток. Последнее оказалось важным: итерационная работа с промтами предполагает много запусков подряд.

Ниже — структурированный разбор: что работает стабильно, что не работает совсем, и где граница между этими двумя зонами.

Что T2I закрывает хорошо

Предметная съёмка на нейтральном фоне

Самый зрелый сценарий. Загружаете фото продукта → описываете фон и освещение → получаете карточку для маркетплейса. Детали поверхности и текстуры объекта модель берёт с исходного фото, генерирует только окружение.

Стабильно работает для: одежда, обувь, косметика, товары для дома, еда на однотонном фоне. Нестабильно: ювелирка с мелкими деталями, часы, электроника с экранами.

Lifestyle-иллюстрации для типовых сцен

Если сцена стандартная — человек с чашкой кофе, ноутбук на столе, продукт «в использовании» в бытовом контексте — результат предсказуемый. Модель обучалась на огромном количестве подобных изображений, статистически «знает», как это выглядит.

Ломается, когда контекст нестандартный или требует точной демонстрации конкретного действия.

Иллюстрации и визуалы без привязки к реальным объектам

Баннеры, фоны для лендингов, декоративные изображения — здесь T2I работает наиболее свободно. Нет исходного объекта, которому нужно соответствовать, нет проверки «похоже или нет».

Что не работает — и почему

Точная передача фирменного стиля

Если у бренда специфический визуальный язык — конкретный оттенок, нестандартный шрифт, уникальная композиция — нейросеть воспроизводит «похожее», а не «то самое». На 10 изображениях это незаметно, на 100 — визуальный ряд начинает расходиться.

Решение частичное: жёсткая промт-дисциплина + визуальный аудит каждые 2–3 недели. Полное решение — использовать нейросеть для производных форматов, а исходный стиль всё равно устанавливать с дизайнером.

Технически сложные объекты

Ювелирка, оптика, часы, электроника с деталями — модель плохо держит микротекстуры: блики на металле, грани камней, циферблаты. Здесь студия воспроизводит точнее. Это не проблема конкретного сервиса — это ограничение текущего поколения диффузионных моделей для предметной съёмки такого класса.

Текст на изображении

Генерация корректного читаемого текста — известная проблема T2I-моделей. Буквы, цифры, надписи в сцене модель часто искажает или перемешивает. Если на изображении должен быть текст — добавляйте его постобработкой, не промтом.

Консистентность персонажа на многих изображениях

Сгенерировать одного человека для 20 разных сцен так, чтобы он выглядел одинаково — пока нерешённая задача без специальных инструментов под это. Каждая генерация независима, модель не «помнит» предыдущие.

Как работает промт — и где большинство теряет время

T2I-модель получает текстовую инструкцию и генерирует изображение, которое статистически соответствует этому описанию на основе обучающих данных. Это важно понять: модель не «рисует», она предсказывает — какими должны быть пиксели, чтобы максимально соответствовать вашему тексту.

Из этого следует главная ошибка в промтах:

«товар на красивом фоне, профессиональное фото, высокое качество»

«товар на красивом фоне, профессиональное фото, высокое качество»

«Красивый» и «профессиональный» — это оценки, а не описания. Модель не знает, что красиво по вашим стандартам. Она воспроизводит «среднестатистически красивое» из обучающих данных.

«товар на светло-сером матовом фоне, студийное освещение с мягкими тенями, съёмка сверху под углом 45°, белое виньетирование по краям, без отражений»

«товар на светло-сером матовом фоне, студийное освещение с мягкими тенями, съёмка сверху под углом 45°, белое виньетирование по краям, без отражений»

Здесь указано конкретно: цвет фона, тип освещения, угол съёмки, детали обработки. Модель воспроизводит описание, а не интерпретирует пожелание.

Структура промта, которая работает стабильно

  1. Объект — что именно на изображении и как выглядит

  2. Среда/фон — где находится, что окружает

  3. Освещение — источник, характер, тени

  4. Ракурс и композиция — угол, кадрирование, что в фокусе

  5. Стиль — фотореализм, иллюстрация, конкретная эстетика

  6. Что исключить — явные запреты на артефакты, лишние элементы

Не обязательно использовать все шесть блоков в каждом промте — но чем специфичнее задача, тем больше блоков нужно заполнить. Готовые шаблоны под разные типы задач собраны в библиотеке промтов — удобно взять за основу и адаптировать.

Таблица: что описывать в промте для разных задач

Задача

Критичные параметры

Что можно опустить

Карточка товара

Фон, освещение, угол, тени

Стиль (фотореализм по умолчанию)

Lifestyle с людьми

Сцена, действие, настроение

Точный ракурс

Иллюстрация для статьи

Стиль, палитра, уровень детализации

Освещение

Баннер / фон

Настроение, цветовая схема, композиция

Детали объектов

Портрет

Ракурс, освещение, фон

Одежда (если не важна)

Итерация: почему один запуск — это не тест

T2I-генерация стохастична: один и тот же промт каждый раз даёт разный результат. Это природа диффузионных моделей, не баг конкретного сервиса.

Что из этого следует практически:

  • Первый результат — это не оценка промта. Это один из возможных результатов

  • Минимальный тест промта — 4–5 запусков подряд. Хороший промт даёт приемлемый результат в 3 из 5 случаев

  • Плохой промт — это когда все 5 результатов промахиваются. Тогда меняйте промт, а не запускайте шестой раз

Именно здесь суточный лимит становится реальным ограничением. При тестировании промта для нового типа контента легко потратить 20–30 генераций за день — сначала на отладку промта, потом на выборку лучшего из финальных вариантов. В Nano Banana Pro этого ограничения нет, что на практике ускоряет отладку промт-библиотеки с нуля примерно вдвое.

Один нюанс, который понимаешь не сразу: задача не «найти идеальный промт», а «сузить диапазон результатов до приемлемого». Идеального промта нет — есть промт, который стабильно попадает в нужную зону.

Реальная стоимость: как считать честно

Токенная модель позволяет считать стоимость точнее, чем подписка. Актуальные цифры — на странице с тарифами, там видно стоимость одной генерации и сколько попыток входит в каждый план.

Ключевой момент при расчёте: считайте не стоимость одного изображения, а стоимость одного финального изображения — с учётом итераций. Если на хороший результат уходит в среднем 4 попытки, реальная стоимость в 4 раза выше стоимости одного токена.

На практике: после выстроенной промт-библиотеки и наработанных шаблонов количество итераций падает до 1–2 на финальный файл. В первые 2 месяца — 4–6. Это нормальный темп, его нужно закладывать в смету заранее.

Разрешение: где реально можно сэкономить вдвое

Про это мало пишут, но это первое, что стоит понять до старта.

Генерация в 2K стоит 100 токенов. В 4K — 200. Вдвое дороже, и при большом объёме это ощутимо.

Подвох в том, что 4K нужна далеко не всегда. Для Stories, Reels, постов в соцсетях — 2K хватает с запасом, разница на экране телефона не видна. Для баннера на сайте — тоже в большинстве случаев. 4K реально нужна когда изображение идёт в печать, в крупный офлайн-баннер или как исходник для дальнейшей обработки.

Я быстро выработал простое правило: все итерации и тестовые прогоны — в 2K. Когда промт отточен и результат устраивает — финальный вариант в 4K, если площадка требует. Итого: платишь 4K токенов только за финал, а не за все попытки до него. На объёме это существенно.

Что в итоге

T2I-генерация — это не «нажал кнопку, получил фото». Это производственный процесс со своей кривой обучения, промт-дисциплиной и зонами применимости. Те, кто это понимают до старта, выходят на нормальный поток за 2–3 месяца. Те, кто ждут волшебства с первой генерации, бросают после второй недели.

Конкретный вывод из нескольких месяцев работы: нейросеть стабильно закрывает 40–60% типичного визуального потока e-commerce. Остальное — гибридная схема или студия. Начинать стоит с самого однородного и повторяющегося типа контента — там быстрее всего формируется промт-шаблон и виден результат.

Сам инструмент генерации — на русском, интерфейс без лишнего. Если нужен старт без изучения английской документации — это работает.

Чеклист перед первой генерацией

✅ Определили конкретный тип контента для теста — не весь поток сразу

✅ Промт содержит конкретные параметры, а не оценочные слова («красивый», «качественный»)

✅ Указан фон, освещение, ракурс — три базовых параметра для предметной съёмки

✅ Заложено 4–5 итераций на первый тест промта

✅ Завели таблицу: промт / результат / оценка — даже простую в Google Sheets

✅ Проверили, что результат проходит технические требования площадки (маркетплейс, сайт)

ссылка на оригинал статьи https://habr.com/ru/articles/1061972/