MiniMax открыла веса видеомодели H3 — одной из самых сильных open-weight систем для генерации видео со звуком

от автора

Китайская компания MiniMax опубликовала веса своей видеомодели H3, выполнив обещание, данное во время релиза несколькими днями ранее. Теперь разработчики могут скачать локальную версию модели, которая генерирует короткие видеоролики со встроенным стереозвуком по текстовым описаниям, изображениям, видеофрагментам и аудиореференсам.

Для рынка генерации видео это важный момент: OpenAI, Google, Runway, Pika и большинство других лидеров по-прежнему распространяют свои видеомодели только через API, тогда как MiniMax сделала доступной значительную часть собственной системы в формате open weights.

По данным Reuters, H3 была представлена как мультимодальная модель нового поколения и изначально разрабатывалась с учетом возможности локального запуска и дальнейшей кастомизации пользователями.

Что умеет H3

H3 — это 33-миллиардная мультимодальная модель, которая может принимать на вход:

  • текст;

  • изображения;

  • видео;

  • аудио;

  • их комбинации.

На выходе модель генерирует видео со звуком в одном проходе, без отдельного этапа озвучивания.

Заявленные характеристики:

  • длительность роликов — от 4 до 15 секунд;

  • 24 FPS;

  • стереозвук 32 кГц;

  • поддержка пропорций 21:9, 16:9, 4:3, 1:1, 3:4 и 9:16;

  • поддержка реплик персонажей на 11 языках, включая русский.

Важная особенность — звук генерируется той же моделью, которая создает видео, а не отдельным TTS- или аудиогенератором.

Полный конвейер H3

MiniMax отдельно описывает архитектуру своей системы как трехступенчатый конвейер.

H3-Context-IR

Этот модуль анализирует весь пользовательский ввод — текст, изображения, видео и аудио — и переводит его во внутреннее представление, с которым далее работает генератор.

H3-Base

Основной генератор видео. Именно этот модуль создает ролик в разрешении 768p и отвечает за синхронную генерацию видео и стереозвука.

H3-Regenerate-2K

Финальный модуль, который пересобирает сгенерированное видео в 2K-разрешении. Именно он обеспечивает качество, показанное в официальных демо MiniMax.

Что открыли

MiniMax открыла не всю систему H3. В открытый доступ опубликован только H3-Base, тогда как H3-Context-IR и H3-Regenerate-2K остаются закрытыми сервисами компании.

Локально можно генерировать видео в базовом разрешении, но полный коммерческий конвейер MiniMax по-прежнему использует закрытые компоненты.

Две версии H3-Base

Компания опубликовала два отдельных чекпоинта.

H3-Base-FL2VA работает с:

  • текстом;

  • первым кадром;

  • последним кадром;

  • либо сразу двумя кадрами.

Соответственно поддерживаются режимы:

  • text-to-video;

  • image-to-video;

  • first-and-last-frame interpolation.

H3-Base-Ref2VA — более продвинутый режим. Модель может принимать:

  • до 9 изображений;

  • до 3 видеофрагментов;

  • до 3 аудиодорожек;

при общем ограничении 12 файлов на запрос. При этом аудио нельзя использовать без изображения или видео — звуковые референсы работают только как часть мультимодального контекста.

Производительность

По данным Artificial Analysis, MiniMax H3 занимает:

  • 1-е место в задачах редактирования видео;

  • 2-е место в генерации видео по тексту;

  • 3-е место в генерации видео по изображению.

Лицензия

Модель распространяется по лицензии MiniMax H3 Community License.

Она разрешает:

  • локальный запуск;

  • исследовательское использование;

  • дообучение модели на собственных видео;

  • обучение на собственных персонажах;

  • обучение на собственном визуальном стиле.

Однако существуют важные ограничения. Коммерческое использование допускается только для компаний с годовой выручкой менее 20 млн долларов. Более крупным организациям требуется отдельное разрешение MiniMax.

Кроме того, компания пока не опубликовала официальный код для обучения, поэтому полноценный fine-tuning остается ограниченным.

MiniMax открыла современную мультимодальную видеомодель со встроенной генерацией звука, тогда как большинство конкурентов по-прежнему держат аналогичные системы полностью закрытыми.

Если экосистема вокруг H3 продолжит быстро развиваться, MiniMax может стать для видеогенерации тем, чем Llama и Qwen стали для текстовых моделей, — базовой открытой платформой, которую можно адаптировать под конкретные продукты, персонажей и визуальные стили.

Пока открыта лишь часть полного конвейера H3, но даже этого уже достаточно, чтобы существенно снизить порог входа для разработчиков, исследователей и небольших студий, которым раньше были доступны только API закрытых сервисов.

Полезные ссылки:

Модель

Инструкция по использованию в своей среде и опубликовали базовые воркфлоу для генерации по тексту и референсу.

Кук-буки под SGLangvLLM и diffusers, а так же промпт-гайды под базу и фулл-реф мод.

ссылка на оригинал статьи https://habr.com/ru/articles/1066674/