Сегодня хочу разобрать тему нейросетей для генерации видео. В соцсетях довольно много вижу нейрослоп-сериалов и думаю, что должен что-то сказать по этому поводу.
Я, конечно, не AI-инженер, но примерно понимаю, как это всё работает. В этой статье я разберу, как работают диффузорные ИИ-модели, чем они хороши и чем плохи, а также как можно было бы решить их проблемы.
Диффузоры
Существуют различные нейросети для генерации видео: Seedance, Runway, Kling AI и так далее. Их всех объединяет то, что они являются диффузорами — то есть они как «угадайки» предсказывают, где и какого цвета должен быть следующий пиксель.
Процесс на примере изображений (пошагово):
Прямая диффузия (добавление шума): Нейросеть берёт исходное изображение и шаг за шагом добавляет к нему случайный шум, пока изображение полностью не станет «белым шумом».
Обучение: Модели показывают этот «белый шум», и её задачей становится угадать, какой шум был добавлен на конкретном шаге.
Обратная диффузия (генерация): Модель начинает удалять шум шаг за шагом, проясняя конкретный объект.
Плюсы таких моделей: высокая детализация, разнообразие генераций и точное управление (промты / ControlNet).
Минусы: медленная скорость и артефакты.
Артефакты
Самая главная проблема, на мой взгляд. Я уже не раз видел новости, где студии пытаются создать полнометражные фильмы с помощью ИИ-инструментов…
Чего только стоят выражения лиц персонажей и их топорная мимика. Нейросеть генерирует предметы, проходящие сквозь друг друга, генерирует по шесть, а то и больше пальцев на руках, ну и пространство вокруг главных объектов постоянно меняется.
Студии, конечно, редактируют результаты, которые выдаёт ИИ, большинство артефактов получается купировать, но, по моим наблюдениям, пространство, в котором происходят действия, всегда меняется, а мимика выглядит неживой.
3D + нейросеть
Именно из-за этих архитектурных ограничений пикселей рождается идея совместить ИИ с классической трёхмерной графикой. Проблему с неестественностью объектов может решить 3D-моделинг. Готовые смоделированные объекты не могут просто размазаться во время движения, поэтому я считаю, что если хочется создать продукт, который будет не стыдно показывать на публику, нужно соединить ИИ-инструменты и 3D. Некоторые сервисы уже существуют по отдельности:
Tripo AI — генератор 3D-моделей.
ActorCore AccuRIG — приложение для авториггинга.
AutoRemesher 1.0 — инструмент для автоматической квадро-ретопологии.
И прочие инструменты.
Если правильно комбинировать их, то, возможно, получился бы неплохой конвейер. Опять же, вопрос в том, сколько времени будет занимать генерация видео через такой конвейер. Помимо генерации самих объектов, ретопологии и авториггинга, нужно учесть, что в качественных видео очень много мелких деталей (так что если кто-то, такой же амбициозный, как я, захочет сделать что-то вроде такого конвейера, столкнётся со сложностями создания волос на голове).
Мой вердикт
Создать диффузионную модель для генерации видео, конечно, проще, но лично я бы не стал создавать крупные кинематографичные проекты с помощью неё. Сколько бы мы ни скормили нейронке примеров — она где-нибудь допустит артефакт.
Спасибо за прочтение.
ссылка на оригинал статьи https://habr.com/ru/articles/1061292/