Grok Imagine Image 2.0 — ставка на редактирование, а не на генерацию

от автора

xAI выпустила Imagine Image 2.0 — обновление своего генератора изображений, которое позиционируется не как «ещё одна красивая генерация», а как инструмент для реальной итеративной работы с картинками.

Ниже — что реально изменилось, где модель стоит в бенчмарках и имеет ли смысл смотреть в её сторону, если вы уже сидите на Nano Banano / GPT-Image.

Коротко: в чём суть релиза

Предыдущие image-модели Grok в основном конкурировали на поле «нарисуй по промпту». Image 2.0 явно заточен под другой сценарий:

Первая генерация почти никогда не финальная — нужна точечная правка, а не перегенерация всего кадра.

Отсюда и набор фич: region edit, segmentation, background removal, multi-ref и smart resize.

xAI прямо пишет, что модель учили планировать типографику и layout «как дизайнер», держать плотные многоэлементные композиции и не убивать мелкий текст.

Недавно, по такому же пути пошла и Reve, но у них не задалось со спросом и они прекратили выпуск по API своей модели.

Что умеет Imagine Image 2.0

1. Точечное редактирование

  • Magic Wand — правит только указанную область, остальное не трогает.

  • Segmentation — выбор конкретных зон, а не «надежда, что модель поймёт по тексту».

  • Background removal — экспорт объекта с прозрачностью (PNG), сразу в другие пайплайны.

Для продакшена это важнее, чем +5% к «красоте» генерации. Перегенерировать удачный кадр из-за одной детали — боль.

2. Multi-reference editing — до 5 изображений

В одном запросе можно скормить до пяти референсов: продукт, модель, фон, лого, style plate.

Раньше в их image API фигурировало до 3 source images. Прыжок до 5 — не косметика, а сдвиг в сторону нормальной композиции без ручного склеивания в Photoshop.

3. Smart Resize

Выбираешь соотношение сторон — модель достраивает кадр, а не тупо кропает.

Поддержаны 9 форматов: 1:2, 9:16, 2:3, 3:4, 1:1, 4:3, 3:2, 16:9, 2:1

Для тех, кто гоняет один креатив в stories / feed / banner / display — одна из самых практичных фич релиза.

4. 15 шаблонов под типовые задачи

Готовые workflow-стартеры:

Категория

Шаблоны

Photo Tools

Photo Edit, Reimagine, Photo Collage, BG Removal & Change, Professional Headshot

Marketing

Editorial Product Poster, E-Commerce Photos, UGC Photos, Merch Maker

Design

Mascot Maker, Icon Maker, Character Sprite

Game Assets

Props & UI Kit

Streaming

Emoji Creator

Product

Product Color Change

Идея простая: не собирать промпт с нуля, а кинуть входы в уже собранный пайплайн.

5. Консистентность для «миров» и pre-production

Отдельно показывают сценарий: персонаж + локации + пропсы генерируются раздельно, но в одном визуальном стиле. xAI подает это как задел под video production workflows (у них параллельно живёт Imagine Video).

Главный вопрос — как это все будет реализовано по API?

Тот же Reve давал возможность редактировать слои изображений только в своем генераторе, по API былм доступны базовые режимы — text to image, image to image. Видимо поэтому не взлетел.

Бенчмарки: второе место в Arena

Категория

Место

Elo

Лидер

Image Edit Arena

2

1439

GPT-Image-2 — 1463

Text-to-Image Arena

2

1320

GPT-Image-2 — 1380

Arena.ai

Arena.ai

Доступ, API, цены

Сейчас модель доступна по API только у Vercel AI Gateway (поправьте если это не так) . Стоимость генерации «xai/grok-imagine-image-2.0-preview» = 0.05 $

Для сравнения:
Seedream 5 Pro = 0.0675 $, Nano Banano 2 = 0,08 $, GPT Image 2 ~ $0.18 $

Получается что даже если не будут работать все функции по API, то модель будет пользоваться популярностью, если не будет хуже Nano Banano 2.

Образцы генерации

Промт:

Реклама фотографа. Черно-белый снимок для обложки журнала. Флэтлай камер, объективов, полароидных снимков и аксессуаров профессионального фотографа. Без надписей.

Слева-направо: GPT Image 2, Grok Imagine Image 2.0 Preview, Nano Banano 2

Слева-направо: GPT Image 2, Grok Imagine Image 2.0 Preview, Nano Banano 2

Протестируем русский язык:

Промт:

A young woman from the late 19th century sitting by a window in a dimly lit Victorian study, soft natural sidelight, wearing a modest dark high-neck dress with lace collar and a simple brooch, hair in an elegant low bun with soft loose strands, pale skin, contemplative expression. She holds an open old hardcover book of Fyodor Dostoevsky, the pages clearly visible and sharp in the foreground, readable Cyrillic text from “Crime and Punishment” or “The Idiot” on the open spread, slightly yellowed paper, letterpress type. Shallow depth of field, book text in crisp focus, her face softly detailed, cinematic black-and-white photography with rich silver gelatin tones, fine film grain, Rembrandt lighting, atmospheric dust motes in the light beam, highly detailed, photorealistic, magazine cover quality, no modern objects, no text overlays, no watermarks

Слева-направо: Grok Imagine Image 2.0 Preview, GPT Image 2, Nano Banano 2

Слева-направо: Grok Imagine Image 2.0 Preview, GPT Image 2, Nano Banano 2

По скорости генерации, Grok Imagine Image 2.0 Preview сильно уступает Nano Banano 2, но быстрее чем GPT Image 2.

Стоит ли пробовать

Определенно да. Китайский модели сильно не дотягивают до уровня Nano Banano 2, поэтому дешевая и качественная модель, у многих точно станет базовой.

Где попробовать в России?

Пока нигде, т.к. официально в API, есть только Preview версия, которая доступна на Vercel AI Gateway.

Но релиз уже скоро и на этой недели вы сможете вовсю использовать эту модель, на многих сервисах, включая VEGA.

ссылка на оригинал статьи https://habr.com/ru/articles/1068954/