xAI выпустила Imagine Image 2.0 — обновление своего генератора изображений, которое позиционируется не как «ещё одна красивая генерация», а как инструмент для реальной итеративной работы с картинками.
Ниже — что реально изменилось, где модель стоит в бенчмарках и имеет ли смысл смотреть в её сторону, если вы уже сидите на Nano Banano / GPT-Image.
Коротко: в чём суть релиза
Предыдущие image-модели Grok в основном конкурировали на поле «нарисуй по промпту». Image 2.0 явно заточен под другой сценарий:
Первая генерация почти никогда не финальная — нужна точечная правка, а не перегенерация всего кадра.
Отсюда и набор фич: region edit, segmentation, background removal, multi-ref и smart resize.
xAI прямо пишет, что модель учили планировать типографику и layout «как дизайнер», держать плотные многоэлементные композиции и не убивать мелкий текст.
Недавно, по такому же пути пошла и Reve, но у них не задалось со спросом и они прекратили выпуск по API своей модели.
Что умеет Imagine Image 2.0
1. Точечное редактирование
-
Magic Wand — правит только указанную область, остальное не трогает.
-
Segmentation — выбор конкретных зон, а не «надежда, что модель поймёт по тексту».
-
Background removal — экспорт объекта с прозрачностью (PNG), сразу в другие пайплайны.
Для продакшена это важнее, чем +5% к «красоте» генерации. Перегенерировать удачный кадр из-за одной детали — боль.
2. Multi-reference editing — до 5 изображений
В одном запросе можно скормить до пяти референсов: продукт, модель, фон, лого, style plate.
Раньше в их image API фигурировало до 3 source images. Прыжок до 5 — не косметика, а сдвиг в сторону нормальной композиции без ручного склеивания в Photoshop.
3. Smart Resize
Выбираешь соотношение сторон — модель достраивает кадр, а не тупо кропает.
Поддержаны 9 форматов: 1:2, 9:16, 2:3, 3:4, 1:1, 4:3, 3:2, 16:9, 2:1
Для тех, кто гоняет один креатив в stories / feed / banner / display — одна из самых практичных фич релиза.
4. 15 шаблонов под типовые задачи
Готовые workflow-стартеры:
|
Категория |
Шаблоны |
|---|---|
|
Photo Tools |
Photo Edit, Reimagine, Photo Collage, BG Removal & Change, Professional Headshot |
|
Marketing |
Editorial Product Poster, E-Commerce Photos, UGC Photos, Merch Maker |
|
Design |
Mascot Maker, Icon Maker, Character Sprite |
|
Game Assets |
Props & UI Kit |
|
Streaming |
Emoji Creator |
|
Product |
Product Color Change |
Идея простая: не собирать промпт с нуля, а кинуть входы в уже собранный пайплайн.
5. Консистентность для «миров» и pre-production
Отдельно показывают сценарий: персонаж + локации + пропсы генерируются раздельно, но в одном визуальном стиле. xAI подает это как задел под video production workflows (у них параллельно живёт Imagine Video).
Главный вопрос — как это все будет реализовано по API?
Тот же Reve давал возможность редактировать слои изображений только в своем генераторе, по API былм доступны базовые режимы — text to image, image to image. Видимо поэтому не взлетел.
Бенчмарки: второе место в Arena
|
Категория |
Место |
Elo |
Лидер |
|---|---|---|---|
|
Image Edit Arena |
2 |
1439 |
GPT-Image-2 — 1463 |
|
Text-to-Image Arena |
2 |
1320 |
GPT-Image-2 — 1380 |
Доступ, API, цены
Сейчас модель доступна по API только у Vercel AI Gateway (поправьте если это не так) . Стоимость генерации «xai/grok-imagine-image-2.0-preview» = 0.05 $
Для сравнения:
Seedream 5 Pro = 0.0675 $, Nano Banano 2 = 0,08 $, GPT Image 2 ~ $0.18 $
Получается что даже если не будут работать все функции по API, то модель будет пользоваться популярностью, если не будет хуже Nano Banano 2.
Образцы генерации
Промт:
Реклама фотографа. Черно-белый снимок для обложки журнала. Флэтлай камер, объективов, полароидных снимков и аксессуаров профессионального фотографа. Без надписей.
Протестируем русский язык:
Промт:
A young woman from the late 19th century sitting by a window in a dimly lit Victorian study, soft natural sidelight, wearing a modest dark high-neck dress with lace collar and a simple brooch, hair in an elegant low bun with soft loose strands, pale skin, contemplative expression. She holds an open old hardcover book of Fyodor Dostoevsky, the pages clearly visible and sharp in the foreground, readable Cyrillic text from “Crime and Punishment” or “The Idiot” on the open spread, slightly yellowed paper, letterpress type. Shallow depth of field, book text in crisp focus, her face softly detailed, cinematic black-and-white photography with rich silver gelatin tones, fine film grain, Rembrandt lighting, atmospheric dust motes in the light beam, highly detailed, photorealistic, magazine cover quality, no modern objects, no text overlays, no watermarks
По скорости генерации, Grok Imagine Image 2.0 Preview сильно уступает Nano Banano 2, но быстрее чем GPT Image 2.
Стоит ли пробовать
Определенно да. Китайский модели сильно не дотягивают до уровня Nano Banano 2, поэтому дешевая и качественная модель, у многих точно станет базовой.
Где попробовать в России?
Пока нигде, т.к. официально в API, есть только Preview версия, которая доступна на Vercel AI Gateway.
Но релиз уже скоро и на этой недели вы сможете вовсю использовать эту модель, на многих сервисах, включая VEGA.
ссылка на оригинал статьи https://habr.com/ru/articles/1068954/