
Есть такой тип новостей – после которых ты просто закрываешь ноутбук и минуту тупишь в стену. Вот у меня так случилось пару дней назад, когда я добрался до демок MiniMax H3. И нет, не потому что “о боже, ещё одна видеомодель” – их сейчас штампуют как флагманские смартфоны. А потому что H3 упорно отказывается вести себя как обычная видюха.
Обычно у таких генераторов фокус один: текст → видео, ну или картинка → видео, максимум монтаж отдельным сервисом прикрутят. А тут прям с порога плюют на границы – между “сгенерировать” и “отредачить”, между “картинкой” и “звуком”. Кидаешь ей шесть референсных изображений, ролик-образец для тайминга монтажа и одно предложение текста – она выдаёт 15-секундный клип, смонтированный именно так, как в примере. Просунул зелёный экран с актёром – уберёт хромакей, подставит сказочный лес и перестроит освещение под новую сцену.
И, блин, у всего этого СРАЗУ есть звук – стерео, 32 кГц, синхронно с картинкой, а не вот это вот «сначала видео, потом отдельно студия Foley, и молись чтобы губы попали».
Разрабы формулируют красиво: H3 – «шаг к более общему мультимодальному интеллекту», а все эти специализированные модельки под конкретную задачу они прямо называют «лишней сложностью». Вместо зоопарка узких инструментов – один трансформер, который смотрит на текст, картинки, видео и аудио как на единый контекст. Спорно? Ну… отчасти да.
Но у этой позиции теперь есть проверка на прочность: модель открыли под лицензией, и любой желающий может прогнать её на своих материалах и убедиться, врёт маркетинг или нет. Чем мы, собственно, и займёмся.
Коротко: чё это и откуда название
Если видели “Hailuo 3.0” или “Hailuo 03” – это она и есть, MiniMax H3. Запустить можно здесь, кстати.
Модель вышла 31 июля 2026 как API-продукт и сразу же влетела в независимые рейтинги. Анонс обещал открытые веса «в ближайшие дни» – и 2–3 августа они реально появились на Hugging Face. Три дня от «можно арендовать» до «можно скачать» – по меркам индустрии это спринт, я вам отвечаю.
Табличка для любителей сравнений:
|
Параметр |
Значение |
|---|---|
|
Длительность / кадры |
4–15 секунд, 24 fps |
|
Аудио |
Нативное стерео, 32 кГц, генерится вместе с картинкой |
|
Разрешение |
до 2K через API; 768p при самостоятельном хостинге |
|
Форматы |
21:9, 16:9, 4:3, 1:1, 3:4, 9:16 и другие |
|
Языки |
11 стабильных: русский, китайский, арабский, английский, немецкий, испанский, японский, французский, корейский, португальский, итальянский |
|
Референсы |
до 9 изображений, 3 видео, 3 аудио – всего одновременно до 12 файлов |
Архитектурно заявлено аж четыре «столпа»:
-
сжатие любого источника в языковое описание (около 100 тысяч токенов исходника ужимается до 4 тысяч), из-за чего модель уверенно жонглирует составными промптами в духе «камера как у Хичкока из видео 1, герой из картинки 2 поёт, вокал из аудио 3»;
-
переработанный VAE-токенизатор с четырёхкратным приростом эффективной длины последовательности – вот это и делает честный 2K;
-
раздельные вычисления «понимания» и «генерации»;
-
и перегенерация собственного черновика в контексте вместо отдельного апскейлера – так восстанавливается мелкий текст и логотипы.
Архитектуру Hailuo 02 в MiniMax отложили как «избыточную сложность» – H3 написана с нуля. Ну чтож, молодцы.
А теперь – к примерам. Промпты оставляю как есть (англ.), без пересказа: искусство работы с моделью как раз в деталях формулировок, так что учитесь.
Телескоп, который ищет вас в толпе
Промпт под полторы тысячи символов, четыре кейфрейма – модель имитирует оптический поиск через старый телескоп: whip-переходы, размытие в движении, вспышки экспозиции, и при этом неизменная двойная круглая маска объектива на протяжении всего ролика.
Выглядит так, будто вы сами сидите в обсерватории и подглядываете за кем-то… но только здесь ищут установку «Минимакс».
Исходные данные:




ПРОМПТ: Images 1–4 are consecutive keyframes, simulating an old telescope searching for the MINIMAX installation. Open out of focus with handheld shake, then rack focus quickly in to image 1. Between images, transition as a telescope sweep – whip movement, motion blur, optical smear, exposure flicker – cutting at the blurriest point and stabilising and refocusing immediately. Hold a fixed twin-circle lens mask throughout (black feathered vignette, absolutely consistent position, size and edge softness, no distortion or drift); only the picture inside it moves. In image 2 the fabric drifts in the wind with restraint and the MINIMAX lettering stays readable as the surface undulates. In image 3 the figure walks, turns and swings an arm like a stylish passer-by caught by accident. In image 4 the figure adjusts their glasses or lifts their chin slightly, carrying a cool, relaxed fashion-campaign attitude. The red type loads in with the focus: it appears slightly soft at low opacity and resolves sharp within 0.3–0.5 s (a small vertical slide or letter-spacing breath is fine), then fades out before the cut or is carried off by motion blur. No rotation, no bouncing, no large fly-ins or fly-outs. Wes Anderson-style peeping, 35mm film texture (light grain, soft highlight bloom, restrained colour, red type as accent), minimal and refined with a touch of playful mischief. Do not add people, vehicles, buildings or logos; keep the original core composition and the MINIMAX installation unchanged.
Результат:
Телескопические переходы между кадрами, что может быть круче? Гигантский промпт модель разобрала без проблем, подцепив все приложенные изображения и устроив «слайд-шоу», что Вим Вендерс обзавидуется.
Тут же и главный лайфхак работы с H3: описывайте не настроение, а видимое изменение состояния. Не «сделай красиво» (аж передёргивает от таких формулировок), а «размытие держится 0,3–0,5 секунды, буква проявляется резко, потом уходит». Чем конкретнее физика движения – тем послушнее модель.
Раскадровка вместо референса – рекламная кампания одежды
Полноценный рекламный ролик для фэшн-бренда, где каждому из четырёх изображений явно назначена роль. Прям как в нормальном продакшене: даёшь раскадровку и говоришь – тут персонаж, тут шмотка, тут лого. Модель всё это вытягивает.
Исходные данные:




ПРОМПТ: Produce a 16:9 high-end fashion brand film. Overall atmosphere, setting and film texture reference image 1; the bag asset references image 3; the character asset references image 2; the brand ending logo references image 4. This is a campaign selling clothing and bags, so the register should be elevated, cool and restrained – but the edit must not be boring. It should be livelier, with a fashion rhythm. Not like an ordinary narrative film, and not like an e-commerce ad. The core story stays very simple: beside a desert highway and a vintage car, a woman returns to the rear of the car, opens the boot, takes out a black bag, shares a brief quiet moment with the man standing by the car, then leaves carrying it. The bag and the clothing should sit naturally inside her movement and read as part of the character.
Результат:
И эта рекламка тоже удалась на славу.
Здесь вновь четыре входных изображения, причём одно из них раскадровка, а не просто кадр.
Обратите внимание, как в промпте расписано: «overall atmosphere reference image 1; character asset image 2; bag asset image 3; brand logo image 4». К каждому инпуту указано, что он значит (мало ли – вдруг стоящие в ряд люди на белом фоне это не референсы внешности, а желаемый кадр, потому что вы снимаете новую часть «Матрицы», всякое ведь бывает). Никто не заставляет так делать – можно пихать как попало, надеясь, что модель сама разберётся. Но для коммерческого проекта распишите роли явно, это стоит пяти лишних минут набора текста, а сохраняет кучу нервов.
Кроссовер
Помните фильмы 80х-90х, где рисованная картинка совмещалась с отснятым видео? «Кто подставил кролика Роджера»(1988, эталон жанра от старины Земекиса). Так вот – H3 может и такое. Жесть.
Итак, то, о чём мы всегда мечтали: промпт для ночной прачечной, которую посещает нарисованное существо:
Исходные данные:
Их нет🤣
ПРОМПТ: 15 seconds, 16:9. A live-action late-night self-service laundromat blended with hand-drawn glowing animation. A small laundromat with faintly flickering fluorescent light, washing machines running, plastic laundry baskets, an old bench, and a single sock on the floor. The space is quiet and faintly nostalgic. Handheld one-handed phone texture with obvious shake; the white fluorescent light makes the exposure rise and fall; glass surfaces carry ambient reflection; focus lags as the lens moves close to an object. Nothing should look as polished as a commercial – the whole thing should feel like real documentary footage grabbed by someone who wandered in late at night and started chasing a strange apparition.
Результат:
И да, здесь даже не понадобились референсные изображения – нейросеть сама нарисовала качественное видео, без исходных кадров (но если нужен предсказуемый результат, добавить их – разумная идея).
Landing page для кроссовок – и где модель ещё спотыкается
Из фотографии кроссовка нужно было слепить взрывную промостраницу в стиле Nike – с прокруткой вниз, наклонным шрифтом, инверсией цвета при наведении:
Исходные данные:

ПРОМПТ: A website page, website UI design, website motion – the video shows a smooth downward page scroll. A highly explosive, dynamic Nike-style product landing page UI/UX demonstration video whose central subject is the product in image 1. The page uses rough, forceful, slanted oversized sans-serif type for bold layout. The background carries fast-moving light and shadow with a real sense of speed, dark carbon fibre or athletic breathable mesh texture interweaving and shifting. The video shows a tight, powerful downward scroll, plus UI interactions such as strong visual scale-up and colour inversion on hover.
Результат:
Простая фотка кроссовок превращается в элегантную рекламу. В мелкие надписи на видео лучше не вглядываться – да, над этим ещё разработчикам предстоит поработать, увы. Мелкий текст на видео – общая слабость ВСЕХ генеративных видеомоделей на 2026 год, и H3 тут не исключение, хоть и держит крупные надписи заметно лучше конкурентов. Такшта дизайнерам UI пока можно спать спокойно.
Шесть референсов, один четырёхсекундный клип
Задача: смонтировать шесть референсных изображений в четырёхсекундный ролик, строго повторив ритм монтажа, переходы и музыку из отдельного видео-примера.
Исходные данные:






ПРОМПТ: Images 1 through 6, following the shot rhythm, transition style and music of example video 1 strictly.
Результат:
И здесь я обомлел… Сможет ли нейросеть уместить ШЕСТЬ референсов-изображений (!) в четырёхсекундное видео (!), смонтировав их так, как в приложенном видео? Оказалось, да, как нефиг делать!
Попутно изображения, конечно же, анимируются и движутся.
Если раньше «смонтировать под чужой ритм» казалось задачей для человека с Premiere Pro и вагоном терпения, то теперь это одна строчка текста.
Кофе становится пустыней
Классический приём бесшовного перехода: макросъёмка кофе должна незаметно перетечь в песчаные дюны пустыни, без единого монтажного стыка.
Исходные данные:


ПРОМПТ: @image 1 – the camera first pushes in quickly to the microfoam on the coffee surface, the cocoa particles and the texture of the dark liquid, letting the grains, foam and ripples gradually fill the whole frame and occlude everything else. The camera keeps a true macro quality with extremely shallow depth of field, fine powder drifting slowly in backlight, the surface texture sitting somewhere between fine sand and fluid. Avoid any tearing in the frame. At the moment when the coffee grains, the rise and fall of the foam and the liquid vortex most closely resemble the dune ridges, wind-eroded texture and blowing sand grains of @image 2, transform seamlessly into the desert landform, then keep pushing forward to reveal the full dunes of @image 2. Strictly avoid frame tearing; no cut to black, no hard cut, no obvious effects, no sense of splicing. The whole thing should feel real, quiet and restrained, as though one and the same granular material becomes a macroscopic desert world from a microscopic coffee surface. One continuous take, with no join in the middle.
Результат:
Задачка вроде бы простая для видеогенератора (представляю, если бы кто-то сказал мне такое лет двадцать назад), но хотелось изучить тот знаменитый рекламный «бесшовный» переход от съедобного в бесконечные поля.
И да, получилось ощущение ровно то же. Обратите внимание на синтаксис @image1 / @image2 – этот способ ссылки на референс тоже прекрасно понимается моделью, наравне с обычным «image 1». Кстати, @ – это не просто так, это ж практически как упоминания в Твиттере, старый добрый способ указать на что-то в промпте.
Один персонаж, чужие движения
Способность свободно смешивать источники разной природы в одном запросе: персонаж берётся с одной картинки, движение – с чужого видео.
Исходные данные:

ПРОМПТ: The character in image 1 follows the movement, expression and performance rhythm of input video 1 strictly. A man stands at the sink on the right of frame and passes a washed plate to the woman on the left, then turns and suddenly flicks washing-up foam with his right hand toward the woman at the left edge of frame. Startled, she immediately retaliates, and the two begin happily throwing foam at each other and dodging, laughing.
Результат:
И вновь H3 позволяет запросто смешать два источника – персонажей с одного ролика, а действия с другого.
И да, все ролики создаются со стереозвуком, это прям важный момент, потому что звук часто задвигают (пока что лучше всего звук в Google Veo).
В официальном анонсе есть похожий, но ещё более экстремальный пример: «камера как у Хичкока из видео 1, персонаж из картинки 2 поёт, вокал из аудио 3» – именно на такую многослойную инструкцию рассчитан механизм сжатия контекста в язык.
Свет как выключатель
Показательная правка – смена освещения на существующем видео без изменения композиции.
Исходные данные:
ПРОМПТ: Replace the lighting. Following the reference video, change the illumination to night.
Результат:
Девушка за столиком уличного кафе лёгким мановением промпта оказывается в ночи. Все окружающие элементы переданы идентично, как будто в помещении кто-то просто выкрутил лампочку. Переснять сцену в другое время суток стоит студийного дня, а тут – одна строчка в промпте. Одна строчка.
Шесть правок за один проход
Самый показательный пример во всей подборке – здесь видно, чем «инструктивное редактирование» отличается от банального переролла.
Исходные данные:
ПРОМПТ: Replace the newspaper in the reference video with a green-covered book; change the chair the character sits on to a red sofa; remove the sunglasses the character is wearing and keep the face clear; remove the car fire effect so the vehicle stays normal; change the photograph the character takes from inside their coat to a small black notebook; and add a tree on the left of frame.
Результат:
Этот пример (на входе вновь не изображение, а целое видео) показывает, что H3 способна вносить в видео множество правок одновременно.
Что у нас на входе? Ничего необычного, листай дальше: мужик в пустыне сидит, читает газету на фоне горящей машины.
В промпте прописано ровно шесть составляющих: 1) заменить газету на книгу; 2) заменить кресло на диван; 3) снять солнечные очки; 4) потушить машину; 5) заменить фотографию в руке на блокнот; 6) добавить дерево слева. И каждое из этих требований соблюдено, как будто видео изначально было таким! Обратите внимание, граффити на тачке таки остались – об этом в промпте не было сказано.
«И в чём тут инженерная мысль?» А нигде. Просто работает. И это прекрасно.
Фокусники меняются костюмами
Последний пример – двухмерная, буквально театральная сценка.
Исходные данные:

ПРОМПТ: Two magicians stand on stage facing the audience and perform a “swap” trick: both wave their wands at once and a cloud of smoke rises. When the smoke clears, the colours of their suits have exchanged – the man on the left now wears the white suit and the man on the right the black – but the colour of their gloves is unchanged. The two bow in thanks, the red curtain behind them draws closed, and it gradates from deep red to deep blue.
Результат:
Напоследок – двухмерная анимация, как же без неё? Ничего необычного, просто два фокусника на сцене меняются одеждой – чёрный стал белым, и наоборот. (Интересно, как же им это удалось?..) Мелочь вроде «цвет перчаток не меняется» – классическая ловушка «следования инструкции буквально», в которой большинство моделей теряют деталь. H3 её держит.
До чего доросли независимые рейтинги
Демки – это красиво, но демки всегда красивые, их для того и делают.

Artificial Analysis – один из самых цитируемых бенчмарков видеогенерации – считает рейтинг через слепые попарные сравнения роликов с агрегацией голосов в шкалу, похожую на Эло. По их данным H3 – #1 в «Видеоредактировании со звуком» (единственная открытая модель в топ-7 категории, вы только вдумайтесь) и #2 в «Текст-в-видео» и «Изображение-в-видео со звуком».
Табличка для сомневающихся:
|
№ |
Модель |
Elo |
$/минуту |
|---|---|---|---|
|
1 |
MiniMax H3 [открытые веса] |
1130 |
$7,80 |
|
2 |
Gemini Omni Flash |
1122 |
$6,00 |
|
3 |
HappyHorse-1.0 |
1096 |
$27,04 |
|
4 |
Wan 2.7 |
1079 |
$16,90 |
|
5 |
Dreamina Seedance 2.0 720p |
1037 |
$5,57 |
|
6 |
Aleph 2.0 (Runway) |
1011 |
$16,80 |
|
7 |
Kling 3.0 Omni 1080p (Pro) |
1000 |
$10,91 |
(Видеоредактирование со звуком, Artificial Analysis)
На Arena AI, отдельном лидерборде для image-to-video, картина менее однозначная: H3 (1476) всего на две сотые балла отстаёт от Dreamina Seedance-2.0 (1478). Два балла разницы на краудсорсинговой выборке – это статистическая погрешность, а не поражение. А модель, что обгоняет H3 по image-to-video на два очка, отстаёт от неё же на 93 очка по видеоредактированию со звуком. Этот разрыв – и есть звук: у конкурентов попросту нечем ответить на нативное стерео, рождающееся в один проход с картинкой.

В бытовых деньгах: H3 на 2K обходится примерно в $7,80 за минуту – меньше половины того, что просят Wan, Runway и Kling.
Отдельно MiniMax собрала отзывы студий, прогнавших одинаковые брифы через H3 и Seedance 2.5 (главного соперника – вышел в тот же день), и выделила семь направлений с наибольшим перевесом. Итак, в каких областях H3 выигрывает – пробежимся по списку:
-
реклама и e-commerce (текст на экране не «плывёт»),
-
игры и UI/UX (интерфейс не съезжает в движении),
-
диалоги и клипы (сильный липсинк),
-
трейлеры (кинематографичная база без отдельного компоузинга),
-
мода (одежда не «плывёт»),
-
международный маркетинг (озвучка на 11 языках),
-
обучающий контент (текст читаем по всему кадру).
Честная оговорка от самих авторов: это отзывы тестировавших, а не контролируемый бенчмарк. Но звучит как правдоподобное обещание светлого будущего.
Открытые веса
2–3 августа 2026 года MiniMax выложила H3-Base на Hugging Face – тот самый флагман, что лидировал в рейтингах. В открытом доступе:
-
H3-Base – 33-миллиардная плотная Omni-трансформенная модель, BF16 (около 13 млрд параметров сидят в AdaLN-ветках и не загружаются при инференс-only развёртывании);
-
два чекпоинта – FL2VA под текст-в-видео и работу по кадрам, Ref2VA под мультимодальную генерацию по референсам;
-
полные веса текстового энкодера Qwen3-VL-32B;
-
автоэнкодеры под видео и аудио.
Развернуть можно через SGLang, vLLM, diffusers или ComfyUI – с готовыми шаблонами воркфлоу. Референсный конфиг обслуживает модель на четырёх GPU.
Разрешение при self-host упирается в 768p – такой вот потолок первого релиза.
Кстати, из технических ограничений: генерация ограничена 15 секундами за проход; аудиореференс нельзя отправить без сопровождающей картинки или видео; режимы image-to-video и reference-to-video взаимно исключают друг друга в рамках одного запроса. Ну вот, вечно у них какие-то компромиссы, а не полноценный AGI.
Завершение
Подкупает в H3 вот что: модель, ещё неделю назад бывшая API-эксклюзивом, за три дня стала штукой, которую можно скачать, потрогать, дообучить под свой стиль и запустить на своём железе, ни у кого не спрашивая разрешения. В индустрии, где половина «открытых» релизов на деле оказываются вчерашним днём с приклеенным ярлыком «open», выход актуального флагмана без задержки – редкость, которую стоит отметить отдельно. Значит, мы на правильном пути.
Я просто рад, что могу написать об этом, просто как есть. Потому что это именно то, ради чего мы когда-то вошли в IT – ощущение, что держишь в руках что-то настоящее, а не очередную фичу в Jira. Bon travail, MiniMax.
Источники и дальнейшее чтение:
ссылка на оригинал статьи https://habr.com/ru/articles/1067254/