
Команда Qwen выкатила Qwen-Audio-3.0-TTS — облачную модель Alibaba для синтеза речи, сразу в двух версиях: Flash под низкую задержку и Plus под качество тембра. В анонсе много громких чисел: 16 языков с русским, первое место в Artificial Analysis, клонирование по шумной записи, три минуты аудио за один проход. Ниже — разбор релиза так, как его стоит читать перед внедрением: где заявленная возможность уже подтверждена документацией и API, а где это пока маркетинговая формулировка, за которой не стоит готовой инфраструктуры. Расхождений между блогом, техстраницей и API-справкой хватает, и часть из них важно поймать заранее.
TL;DR
-
Две версии одной линейки. Flash — старт выдачи ~300 мс, под ассистентов и игровых персонажей. Plus — упор на естественность и сохранение тембра, под озвучку.
-
Только облако. Доступ через Alibaba Cloud Model Studio (WebSocket, регионы Сингапур и Пекин). Весов и открытого репозитория в релизе нет — это API, а не локальная модель.
-
Русский заявлен, библиотека голосов отстаёт. Язык подтверждён техстраницей и инструкцией клонирования, но публичный список системных голосов — в основном китайский и английский.
-
86 тегов и свободные инструкции. Управление подачей обычным текстом плюс инлайн-теги вроде
[laughing],[whispers],[sighing]. Но синтаксис в примерах и в API-справке расходится — берите из актуальной доки. -
№1 в Artificial Analysis — про англоязычные голоса. Elo 1234 в Provider Voice Arena на 23 июля 2026, но отрыв от Simba 3.2 всего 4 балла, а русская речь там не тестируется.
-
Цена от $15 за миллион символов (Flash), $20 за Plus — по официальной таблице; в карточке Artificial Analysis для Plus фигурирует $27,6, расхождение не объяснено.
Flash и Plus: почему разделили линейку
Модель приехала в двух версиях из одной семьи.
Flash — заточена под интерактив-голосовые ассистенты, NPC, всё, где ответ должен начинаться почти мгновенно. Alibaba указывает задержку до первого пакета аудио порядка 300 мс. Важно читать это правильно: это серверная метрика начала выдачи (TTFB для аудио), а не сквозная задержка. Реальная пауза для пользователя ещё зависит от сети, вашего приложения и длины входного текста.
Plus — про озвучку, где ценятся естественность, стабильная интонация и точное сохранение тембра: ролики, подкастовые вставки, аудиогиды, курсы, игровые диалоги. Разделение практичное и знакомое любому, кто сравнивал low-latency и high-fidelity режимы: одна универсальная модель редко одновременно даёт минимальную задержку и максимальное качество длинной речи.
Обе версии живут в Alibaba Cloud Model Studio. В доке — потоковая работа через WebSocket, регионы Сингапур и Пекин, модели qwen-audio-3.0-tts-flash и qwen-audio-3.0-tts-plus. Ссылок на скачиваемые веса или отдельный open-source репозиторий в релизных материалах пока не нашел. Практический вывод: пока это облачный сервис, встраивать его в контур с требованием on-premise или офлайна не выйдет.
Русский есть на уровне модели, но не на уровне готовых голосов
Alibaba заявила поддержку 16 языков, семь из них добавлены в этой версии: арабский, индонезийский, португальский, тайский, вьетнамский, малайский и тагальский. Русский присутствует не одной строкой в пресс-релизе — на техстранице есть отдельный русскоязычный пример, а инструкция по клонированию перечисляет русский среди поддерживаемых языков. Для эталонной записи рекомендуют 10–20 секунд речи, максимум — 60 секунд.
Здесь и начинается первая нестыковка в документации. Релизный материал обещает набор готовых голосов для всех 16 языков и тут же сообщает, что полная поддержка ещё разворачивается. Актуальный публичный список системных голосов для Plus и Flash — преимущественно китайский и английский. Для русской озвучки, скорее всего, придётся поднимать пользовательский голос через клонирование или ждать расширения библиотеки.
То есть формулировка «поддерживает русский» корректна на уровне возможностей модели, но не гарантирует одинаковый выбор пресетов, стабильность ударений и качество во всех режимах. Перед внедрением закладывайте отдельный прогон на именах, аббревиатурах, числах, омографах («за́мок» / «замо́к») и длинных предложениях со сложной пунктуацией — это ровно те места, где русский TTS обычно и сыпется.
Инструкции обычным языком плюс 86 инлайн-тегов
Qwen-Audio-3.0-TTS принимает свободные текстовые указания о роли, эмоции, скорости, громкости, тембре, акценте и ситуации. Модель можно попросить говорить спокойно и медленно, вести себя как радиоведущая, торопиться, звучать испуганно или читать в манере сказки на ночь. Произвольные инструкции принимают и системные, и клонированные голоса обеих версий.
Это удобнее набора ползунков «темп/высота»: всю сцену описываешь одним заданием — возраст персонажа, настроение, темп, контекст реплики. Но за гибкость платишь предсказуемостью: «сдержанно» или «уютно» модель может понять не так, как звукорежиссёр, и формулировки под стабильную генерацию придётся подбирать эмпирически.
Плюс к инструкциям техстраница заявляет 86 новых встроенных тегов. Они меняют подачу на уровне фразы или слова, добавляют смех, вздохи, кашель, дыхание, эмоциональные переходы: [angry], [excited], [laughing], [giggles], [whispers], [sighing], [gasp].
И вот тут грабли, на которые стоит наступить в статье, а не в проде. В коротком анонсе Qwen мелькают варианты [whisper], [breaths], [laughs], а действующая API-справка приводит [whispers], [sighing], [laughing], [giggles]. Для поста это косметика, для рабочего запроса — потенциально молча проигнорированный тег или ошибка. Берите синтаксис из актуальной документации, а не копируйте сокращённые примеры из соцсетей.
Ещё ограничение: теги сейчас работают только в режиме однонаправленной потоковой передачи. Управляющий тег действует на последующий текст до следующего тега либо до автоматического разбиения длинной фразы. Это усложняет сценарии, где приложение шлёт текст мелкими кусками в живом диалоге — планируйте разметку с учётом того, как именно вы стримите.
Клонирование стало устойчивее к шуму, но чистый исходник всё ещё правит
Alibaba обучала систему на акустических искажениях, чтобы она давила шум и реверберацию в эталонной записи, сохраняя тембр. На техстранице показаны примеры с шумным, гулким и обрезанным по частотам аудио, и компания утверждает, что новая версия выдаёт результат чище предыдущих моделей семейства при одинаково испорченном образце. Оговорка важная: это внутреннее тестирование разработчика, независимого сравнения именно этого режима пока нет.
Рекламную устойчивость не стоит читать как разрешение кидать любой фрагмент из шумного видео. Производственная инструкция по-прежнему рекомендует 10-20 секунд, минимум пять секунд непрерывной чистой речи, без музыки, посторонних голосов и заметного фона. Запас прочности к плохому аудио — это страховка, а не замена хорошему исходнику.
И ещё нюанс для тех, кто планирует клонирование в Plus. Исследовательская страница описывает клонирование как общую способность модели, но актуальная англоязычная инструкция создания пользовательского голоса явно показывает qwen-audio-3.0-tts-flash и перечисляет в таблице именно Flash. Для Plus столь же однозначного пути через публичный API пока не описано, так что закладывать идентичное клонирование в обеих версиях преждевременно, проверяйте на своём аккаунте.
Три минуты за проход и что под капотом
Модель синтезирует до трёх минут речи за один проход, без ручного нарезания текста на куски, отдельной генерации и склейки. Это снимает классическую боль — скачки громкости, темпа и интонации на границах фрагментов. Трёх минут хватает на новостную озвучку, объясняющий ролик, аудиогид, сцену из игры или длинный ответ ассистента; полноценную главу аудиокниги всё равно придётся бить. Отдельно отмечу: публичная демонстрация длинного чтения сейчас на китайском и английском, трёхминутного русского образца разработчики не показали.
Инженерно интересна основа — аудиотокенизатор с частотой 12,5 кадра в секунду. Он представляет речь сравнительно редкой последовательностью элементов, поэтому авторегрессионной части нужно меньше шагов на генерацию. Это не значит, что звук воспроизводится на 12,5 Гц: показатель относится к внутреннему представлению, а итоговый звук формирует отдельный компонент. Обучение шло в пять этапов — раздельная подготовка языковой и акустической частей, совместное обучение и последующее обучение с подкреплением.
По форматам поток отдаёт PCM, WAV, MP3 и Opus с частотой дискретизации до 48 кГц. И снова рассинхрон в доке: релизный блог помечает выход 48 кГц как «появится позднее», а техстраница уже связывает его с апгрейдом вокодера. Похоже, документация обновляется параллельно с раскаткой сервиса, так что доступность 48 кГц проверяйте под конкретный регион и метод API.
Про «первое место в Artificial Analysis» — читаем мелкий шрифт
Alibaba приводит собственные многоязычные замеры: по её данным, семейство показало лучший WER/CER на 10 из 16 языков, средний результат Flash — 3,87, Plus — 3,96 (меньше — лучше), а в тесте сходства голоса Plus набрала в среднем 82,75, Flash — 80,44. Методику и подбор фраз контролировал разработчик, так что это цифры производителя.
Независимый рейтинг подтверждает уровень Plus, но в узком сценарии. На 23 июля 2026 года Qwen-Audio-3.0-TTS-Plus занимает первое место в Provider Voice Arena у Artificial Analysis с Elo 1234. Дальше — Simba 3.2 (1230) и Gemini 3.1 Flash TTS (1215). Для Qwen собрано 1517 сравнений на восьми голосах, доверительный интервал допускает и первое, и второе место, а отрыв от ближайшего соперника — всего четыре балла. То есть «№1» здесь — это лидерство в пределах погрешности, а не разгром.
И главное: арена гоняет слепые парные сравнения на голосах поставщика — мужских и женских, американский и британский английский, категории «ассистенты / клиентский сервис / развлечения / передача знаний». Русская речь в этом лидерстве не проверяется вообще. Значит, «№1 в Artificial Analysis» честно только для общего рейтинга англоязычных системных голосов и ничего не говорит про русские ударения, фамилии, топонимы и длинные числительные. Для русскоязычного продукта это главный непокрытый пробел релиза.

Цены и где их реально смотреть
Тарификация — по числу символов входного текста. В международном развёртывании через Сингапур: Plus — $0,2 за 10 тысяч символов, Flash — $0,15. В пересчёте на миллион — $20 и $15 соответственно. На каждую версию дают по 10 тысяч бесплатных символов на 90 дней после активации Model Studio.
Ещё одно расхождение, которое бьёт по расчёту бюджета: в карточке Artificial Analysis для Plus указана другая цена — $27,6 за миллион символов при стандартных настройках API. Причину Alibaba не раскрывает. Для оценки расходов ориентируйтесь на текущую страницу биллинга Model Studio и обязательно проверяйте регион — именно он определяет фактическое списание.
Что стоит проверить перед внедрением
Qwen-Audio-3.0-TTS выглядит серьёзным обновлением продакшн-синтеза: низкая задержка, свободные инструкции, инлайн-теги, многоязычность и длинная генерация в одном API. Но между анонсом и тем, что реально отдаёт сервис, есть зазор, и для русскоязычного проекта он больше среднего.
Практический чек-лист перед тем, как ставить модель в контур: проверить правильность ударений и омографов, чтение чисел и сокращений, сохранение тембра на длинных фрагментах, предсказуемость эмоциональных команд и тегов, а также фактическую цену и доступность 48 кГц в вашем регионе. Первое место в англоязычной арене даёт модели сильный старт, но звание лучшей русскоязычной TTS ей ещё предстоит подтвердить не в пресс-релизе, а на вашей нагрузке.
Ссылки по теме
-
Qwen3-TTS на GitHub — открытая линейка TTS-моделей от команды Qwen
-
Обзор моделей синтеза речи в Model Studio — доступ, голоса, версии и биллинг
-
API-справка Qwen-TTS — параметры запроса, теги, форматы
-
Рейтинг TTS у Artificial Analysis — независимое сравнение моделей
-
Speech Arena — слепое голосование — можно сравнить голоса самому
ссылка на оригинал статьи https://habr.com/ru/articles/1062380/