Вы просили вернуть Suno v5, а мы сделали лучше. Встречайте Grom Zvuk

от автора

В мире генеративного ИИ всё меняется стремительно. Этим летом музыкальное ИИ-сообщество столкнулось с сюрпризом: разработчики Suno навсегда отключили полюбившиеся многим старые версии моделей (v4, v4.5, v5 и v5.5).

Пользователи нашей ИИ-платформы GPTunneL (агрегатора нейросетей) массово жаловались: пропал тот самый вайб, а новые алгоритмы стали слишком жесткими. К тому же в Suno всегда была одна фундаментальная проблема, которая бесила многих креаторов – там нельзя было просто взять и поменять текст в уже готовом, сгенерированном треке.

Мы выслушали боль нашей аудитории, посмотрели на то, чего не хватает рынку, и решили сделать свой продукт.

Сегодня, 18 сентября, мы официально запускаем Grom Zvuk – нашу собственную музыкальную ИИ-модель. Она работает на наших серверах, выдает крутое качество, делает невероятные каверы и стоит дешевле западных аналогов. Рассказываем, как она устроена и на что способна.


Что такое Grom Zvuk и как это звучит

Grom Zvuk – это первая музыкальная модель в нашем семействе «Гром». Задача амбициозная: чтобы генерация полноценного трека по вашему промпту стоила копейки, а управлять процессом было проще, чем в существующих аналогах.

Zvuk уже доступен в GPTunnel.

Попробуйте модель здесь:

Grom Zvuk

Модель генерирует треки длительностью до 5 минут (можем расширить лимит до 6 минут), с вокалом или в виде инструментала.

Вместо тысячи слов – лучше послушать, что она умеет делать прямо из коробки:

Ещё примеры

Киллер-фичи: свобода, каверы и работа с готовыми треками

Главная проблема большинства музыкальных нейросетей – вы получаете «черный ящик». С Grom Zvuk мы пошли дальше простой генерации по тексту. Модель умеет работать с уже готовыми треками. Замысел трека живет в партитуре, поэтому песню можно править частями.

  1. Создание каверов (свой текст на готовую музыку). Берём существующую песню, подставляем туда свои собственные стихи и меняем жанр. Музыка и вокальный рисунок остаются узнаваемыми, а слова – ваши.

  2. Смена жанра и стиля. Тот же трек, тот же оригинальный текст, но совершенно другой жанр. Хотите сделать из баллады Артиста кантри в стиле лап-стил или суровый хардкор? Легко.

  3. Отсутствие строгой модерации. Пока западные сервисы закручивают гайки по авторским правам (блокируя всё, что отдаленно напоминает известных артистов), мы даем создателям свободу. Строгой модерации у нас, что открывает огромный простор для экспериментов с каверами и стилизациями.

Под капотом: как устроена генерация

Мы не используем сжатые «черновики». Grom Zvuk сразу отдает результат в 48 кГц, стерео, с настоящей стереопанорамой. (Кстати, сейчас дорабатываем поддержку lossless-форматов, они появятся чуть позже.)

Генерация идет одним проходом. Модель прорабатывает все части трека одновременно. Сначала она заливает шумом всю длину будущей песни и размечает структуру: где встанут куплеты, где припев, а где бридж. Затем в несколько подходов превращает этот шум в звук. Интро, куплеты, припев и финал считаются как одна цельная композиция. Поэтому промежуточного результата не существует: трек появляется, когда досчитан целиком. Зато части не спорят друг с другом, а сведение звучит монолитно на всю длину.

Процесс превращения шума в структурированный аудиосигнал

Процесс превращения шума в структурированный аудиосигнал

Архитектурно конвейер устроен так: работают два эксперта под общим вниманием (attention). Первый пишет музыку символами, выстраивая композиционную логику, а второй разворачивает эти символы непосредственно в акустический сигнал.

Упрощенная схема: от символьной партитуры к полноценному звучанию

Упрощенная схема: от символьной партитуры к полноценному звучанию

Мультиязычность без акцента. Модель поет на любом языке (включая: русский, английский, китайский, японский, казахский, испанский, немецкий, французский, корейский, итальянский, португальский, турецкий, арабский, хинди и др.). В отличие от многих западных нейросетей, Grom Zvuk отлично понимает русские ударения и фразировку.

Синтетические тесты: бьем Suno v6

Мы провели слепое тестирование на выборке из 150 запросов. Оценивались два параметра: качество звучания (насколько аудио похоже на реальную студийную запись) и точность следования тексту (не путает ли модель слова, поет ли ровно то, что заказали). Названия моделей оценивающим не показывались.

Сравнение Grom Zvuk с другими музыкальными моделями

Сравнение Grom Zvuk с другими музыкальными моделями

По синтетическим бенчмаркам Grom Zvuk уверенно соревнуется с Suno v6 в балансе между точностью текста (85/100) и качеством звучания (83/100). По точности воспроизведения заданных текстов наша модель входит в первую тройку мирового рынка, обходя популярную Mureka.

Стоимость модели и условия для B2B

Мы сделали модель, которая работает на наших собственных мощностях.

  • Базовая стоимость генерации трека – 8 рублей, до конца сентября скидка 50%!

Для кого эта модель:

  • Музыкантам и креаторам: для создания быстрых демо, поиска аранжировок, экспериментов с жанрами и генерации фоновой музыки (например, эмбиент, лоу-фай для видео).

  • Агрегаторам и бизнесу: готовы предоставить доступ к Grom Zvuk по API. Можем масштабировать кластеры ускорителей под конкретные объемы B2B-клиентов. Для партнеров есть тестовый период.


GPTunneL – это ИИ-платформа. В одном окне без VPN и сложных регистраций мы объединяем более 100 топовых ИИ-инструментов: ChatGPT, Claude, Midjourney, Kling и другие, а также музыкальные Suno, Mureka и MiniMax. На платформе уже 1,5 млн пользователей.

Grom Zvuk пополнил наше проприетарное семейство моделей Grom, куда уже входят:

  • Grom GPT – флагманская текстовая модель (работает быстро, поддерживает русский, бесплатный в базовый вариант).

  • Grom Nova и Grom Art – генерация картинок по описанию, а также инпайнтинг, замена объектов и стили.

  • Grom TV – генерация видеороликов от 3 до 20 секунд.

  • Grom Pixel – умный апскейл до 100 мегапикселей с восстановлением фактуры.

Grom Zvuk уже доступен в разделе «Музыка» в GPTunneL рядом с Suno и Mureka. Заходите, тестируйте, ломайте жанры и делайте каверы!

Ждем ваших треков и фидбека в комментариях!

ссылка на оригинал статьи https://habr.com/ru/articles/1083802/