Grom TV: первый в России бесконечный онлайновый ИИ-телевизор

от автора

Последние недели у меня в рабочих чатах через слово мелькает фраза «а давай Гэндальф сварит зелье со Скуби-Ду». Не потому что корпоратив затянулся. Просто мы в GPTunneL запустили штуку, которая заставляет весь офис вести себя как дети, которым выдали пульт от телевизора и сказали: «крути любой канал, какой захочешь – только этого канала ещё не существует, придумай сам».

Штука называется Grom TV – «Гром Телевизор». Это генеративный онлайн-ТВ, куда заходит любой желающий, пишет промпт (буквально текстом, как в чат) и через 20–25 секунд видит на экране свой собственный видеоролик, сгенерированный нейросетью прямо по этому запросу.

Причём видит не один: на канале одновременно крутятся ролики других зрителей, а под телевизором – живой чат, где все спорят, шутят и выпрашивают друг у друга идеи получше.

Попробовать можно прямо сейчас: gptunnel.ru/lab?section=tv. Регистрация простая, промпт пишется в поле справа от экрана – и дальше вы, по сути, режиссёр в прямом эфире. Собственно, вот как это выглядит вживую…

Как всем этим пользоваться

  1. Заходите на сайт;

  2. Регистрируетесь;

  3. Пишете промпт в чат от телека;

  4. Ждёте 20–25 секунд;

  5. Смотрите, как ваше творение крутится в эфире на глазах у всех.

Ввод промпта на сайте – от заявки до появления ролика в эфире проходит чуть более 20 секунд, а время генерации составляет лишь около ~8 сек.:

Что вообще происходит на экране

Несколько примеров:

Кроссовер, который сам напрашивался последние лет двадцать, просто никто не решался:

Кто-то ушёл в эстетику нуара, и нейросеть переобулась в чёрно-белую драматургию с контрастом теней:

Теория большого взрыва – концерт KISS, Шелдон Купер, Радж, Эмми играют на инструментах:

Рыбалка получилась максимально абсурдной, что для генеративного видео, кажется, комплимент.

Нейросеть уверенно обращается с диснеевской пластикой и чёрно-белым нуаром. Модели не нужно объяснять, «как выглядит Гомер Симпсон» – она уже знает. Задача пользователя – формулировать, а не рисовать.

Генеративка в прямом эфире

Обычная видеогенерация – асинхронный процесс: отправил запрос, подождал, получил файл, посмотрел когда удобно.

Прямой эфир – физика совсем другая. Тут нельзя «подождать чуть дольше»: если генерация начинает отставать от скорости просмотра хоть на полсекунды, эфир либо заикается, либо останавливается насмерть.

Сравним с конвейером, где деталь должна появляться на ленте быстрее, чем предыдущая уезжает, иначе вся линия встаёт.

Мировых примеров у формата, на самом деле, немного.

Самый известный – Nothing, Forever запущенный студией Mismatch Media в конце 2022-го на «Твитче». Это бесконечный «Сайнфелд», где фразы актёров генерировались LLM, а озвучка шла через синтез речи. Проект мгновенно обрёл популярность.

Как устроено внутри. 8 сек. видео/7,8 сек. генерации

Один видеоролик Grom TV длится восемь секунд – со звуком, а когда есть речь – нейросеть синхронизирует движения губ и реплику (липсинк).

На то, чтобы такой клип сгенерировать, у модели уходит около 7,8 секунды. Это значит, что коэффициент реального времени – 0,97. Генерация опережает эфир, хотя и с небольшим запасом. Всё это крутится не на кластере из десятков видеокарт, а через один чип Nvidia B200 (иногда подключается второй, чтобы оптимизировать скорость).

Параметр

Значение

Длина клипа

8 секунд видео + синхронный звук

Время генерации

~7,8 секунды

Частота кадров

~24 fps

Коэффициент реального времени

0,97 (генерация быстрее эфира)

Задержка «промпт зрителя → экран»

~8–25 секунд

Запас видео впереди зрителя

всегда не менее ~8 секунд

Чтобы оценить масштаб задачи: Blackwell (то самое поколение, к которому относится и топовый B200) – архитектура Nvidia, спроектированная в первую очередь под обучение и инференс больших моделей, а не под потоковую генерацию в реальном времени.

Дальше в дело идёт классика – ffmpeg, который в одном проходе (за какие-то ~0,3 секунды на CPU) успевает сделать сразу несколько вещей:

  • подогнать темп воспроизведения ровно под скорость генерации (это тот самый механизм, который не даёт эфиру догнать модель),

  • наложить фирменный «плёночный» стиль канала – зерно, виньетку, мягкую цветность,

  • и нарезать всё на двухсекундные сегменты с ключевым кадром на каждой границе, чтобы плеер стартовал за две секунды и переключался между клипами без рывков.

Схематично конвейер выглядит так:

зритель ──► очередь ──► GPU: генерация 8 с видео + звука                              │                              ▼             ffmpeg: темп, плёночный стиль, нарезка на 2-секундные сегменты                              │                              ▼              HLS-плейлист (скользящее окно, непрерывный)                              │                ┌─────────────┴─────────────┐              браузер (hls.js)          VLC / любой HLS-плеер

HLS выбрали, а потому что его понимает буквально всё: браузер, VLC, любой смарт-телевизор.

Даже один лишний кадр в хвосте ролика вызывал заметное зависание на стыке двух клипов – и такие вещи можно отловить только по факту реального эфира, когда множество зрителей смотрят одновременно.

Что происходит, когда очередь пуста

Grom TV вообще не простаивает. Если очередь пользовательских промптов пустеет, в дело вступает Grom GPT – LLM-модель нашей компании GPTunneL, которая сама придумывает сюжеты и подкидывает их в эфир, чтобы канал не молчал.

Архитектурно это построено так, что нейросеть способна генерировать порядка 10 000 уникальных клипов в сутки без единого повтора.

Кстати, похожая мысль была реализована в Nothing, Forever – там сценарии для стендапа и диалогов тоже писала языковая модель – только это была текстовая GPT-3, а не LLM + видеогенератор.

Модерация: фильтр стоит до генерации, а не после

Прямой эфир нельзя «отмотать назад» – если что-то вышло на экран, это уже произошло у всех на глазах. Именно поэтому вся система фильтрации выстроена так, чтобы отсекать неприемлемый контент ещё до того, как он доберётся до видеомодели, чтобы не разгребать последствия постфактум.

запрос зрителя ──► GromMod ──► Grom (сценарист) ──► GPU ──► эфир                    отсекает      убирает чувствительное                    явную жесть   из промпта, переписывает                                  сцену безопасно

Работает это в два независимых рубежа:

  • GromMod – собственный модератор GPTunneL, первый фильтр. Он смотрит на промпт целиком и сразу отклоняет откровенно недопустимое (насилие и т. д.). Отказ зритель получает мгновенно, и здесь в GPU даже ничего не передаётся.

  • Grom на этапе сценария – второй рубеж. Превращая короткое пожелание зрителя в сценарий для видеомодели (сцена, реплики, звук, музыка), Grom попутно вычищает из него чувствительные детали и смягчает формулировки, сохраняя при этом сам творческий замысел. До модели промпт доходит уже в безопасном виде.

Два независимых этапа страхуют друг друга. То, что случайно проскочило первый фильтр, ловит второй.

GPTunneL – площадка, где всё это работает

Grom TV – лабораторный эксперимент внутри GPTunneL, российской ИИ-платформы. Сервер физически расположен в России.

  • Это сервис, который объединяет больше сотни ИИ-инструментов для генерации текста, изображений, видео, музыки и голоса в одном окне. Начинался проект в 2023 году как внутренний инструмент для собственной команды разработчиков, а вырос к 2026 году в платформу с более чем полутора миллионами зарегистрированных пользователей.

  • Изначально прототип вообще был продуктом для видеоконференций – но появились нейросети, и всё резко закрутилось в другую сторону.

  • Grom TV в этом смысле – пример того, что происходит, когда у платформы есть собственные модели (видео, LLM-модератор, LLM-сценарист) и собственное железо: перед нами эксперимент, который показывает, куда движется технология.

  • Технически можно поднять качество генерации выше и уйти в сторону полноценных стримов с цифровыми аватарами – с более стабильной картинкой, без малейшего дрейфа между кадрами, в честном HD-разрешении.

  • Если у бизнеса есть интерес (например, B2B-сценарии, где нужен именно живой генеративный видеоканал, а не предзаписанный ролик), такое решение реализуемо на серверном чипе B200 в реальном времени. Путём большего числа проходов генерации на кадр можно убрать дрейф картинки и выдавать HD в потоке.


Тут вся суть эксперимента: чем больше людей попробует, чем разнообразнее промпты – тем интереснее общий эфир.

Как нам известно, это первый в России подобный формат генеративного общего онлайн-телевидения – открытого, куда заходит любой желающий и в реальном времени видит своё творение в общем эфире.

Grom TV для нас – это не финальный продукт, а скорее демонстрация принципа: генеративное видео можно поставить в прямой эфир на одной видеокарте, и это работающий канал, который вы можете открыть прямо сейчас. Мы продолжаем докручивать пайплайн, следить за качеством дословной речи, стабильностью склеек и модерацией.

Если хочется попробовать самому – заходите в «Гром Телевизор», пишите промпт и ждите 20–25 секунд до эфира.

ссылка на оригинал статьи https://habr.com/ru/articles/1079976/