Alibaba выпустила Qwen-Audio-3.0-TTS с русским языком и 86 тегами управления голосом

Flash сокращает задержку, Plus повышает качество голоса
Qwen-Audio-3.0-TTS получила две версии из одной модельной линейки.
- Flash ориентирована на голосовых ассистентов, игровых персонажей и другие приложения, где ответ должен начинаться почти сразу. Alibaba указывает задержку до первого пакета аудио на уровне 300 мс. Это серверная метрика начала выдачи: реальная пауза для пользователя также зависит от сети, приложения и длины входного текста.
- Plus рассчитана на озвучку, где выше ценятся естественность, стабильная интонация и точное сохранение тембра. Такой вариант ближе к производству роликов, подкастовых вставок, аудиогидов, курсов и игровых диалогов. Разделение выглядит практично: универсальная модель редко одновременно показывает минимальную задержку и максимальное качество длинной речи.
Главный способ доступа к обеим версиям - Alibaba Cloud Model Studio. В документации указаны потоковая работа через WebSocket, регионы Сингапур и Пекин, а также модели qwen-audio-3.0-tts-flash и qwen-audio-3.0-tts-plus. Ссылок на загружаемые веса или отдельный открытый репозиторий в релизных материалах нет, поэтому Qwen-Audio-3.0-TTS пока следует рассматривать как облачный API, а не локальную модель.
Русский входит в 16 языков, но развёртывание ещё продолжается
Alibaba заявила поддержку многих языков. Семь новых из них добавлены в этой версии: арабский, индонезийский, португальский, тайский, вьетнамский, малайский и тагальский.
Русский присутствует не одной строкой в пресс-релизе. На технической странице опубликован отдельный русскоязычный пример, а инструкция по клонированию голоса перечисляет русский среди поддерживаемых языков Qwen-Audio-TTS. Для исходной записи рекомендуется 10–20 секунд речи; допустимый максимум составляет 60 секунд.
В документации остаётся несогласованность. Релизный материал обещает набор готовых голосов для всех 16 языков, но одновременно сообщает, что полная поддержка ещё разворачивается. Текущий публичный список системных голосов для Plus и Flash содержит в основном китайский и английский. Для русской озвучки, вероятно, потребуется совместимый пользовательский голос или дальнейшее расширение готовой библиотеки.
Поэтому формулировка «поддерживает русский» верна на уровне возможностей модели. Она пока не гарантирует одинаковый выбор готовых голосов, стабильность ударений и качество всех режимов. Перед внедрением придётся отдельно проверить имена, аббревиатуры, числа, омографы вроде «за́мок» и «замо́к», а также длинные предложения со сложной пунктуацией.
Инструкции задают манеру речи обычным языком
Qwen-Audio-3.0-TTS принимает свободные текстовые указания о роли, эмоции, скорости, громкости, тембре, акценте и ситуации. Модель можно попросить говорить спокойно и медленно, вести себя как радиоведущая, торопиться, звучать испуганно или читать текст в манере сказки на ночь. Системные и клонированные голоса обеих версий принимают произвольные инструкции.
Это полезнее набора ползунков с темпом и высотой тона. Автор может описать всю сцену одним заданием: возраст персонажа, настроение, темп, степень эмоциональности и контекст реплики. Для стабильной генерации формулировки всё равно придётся подбирать. Понятие «сдержанно» или «уютно» модель может интерпретировать иначе, чем звукорежиссёр.
Техническая страница проекта сообщает о 86 новых встроенных тегах. Они позволяют менять подачу на уровне отдельной фразы или слова, добавлять смех, вздохи, кашель, дыхание и эмоциональные переходы. В примерах встречаются [angry], [excited], [laughing], [giggles], [whispers], [sighing] и [gasp].
Здесь важна точная запись. В коротком анонсе Qwen использует варианты вроде [whisper], [breaths] и [laughs], а действующая API-справка приводит формы [whispers], [sighing], [laughing] и [giggles]. Для публикации это мелкая разница, для рабочего запроса - потенциальная ошибка. Разработчикам следует брать синтаксис из актуальной документации, а не копировать сокращённые примеры из соцсетей.
У тегов есть техническое ограничение: сейчас они работают только в режиме однонаправленной потоковой передачи. Управляющий тег действует на последующий текст до следующего тега либо до автоматического разделения длинной фразы. Это усложняет сценарии, где приложение отправляет текст небольшими частями во время живого диалога.
Клонирование устойчивее к шуму, но чистая запись всё ещё предпочтительна
Alibaba обучала систему на акустических искажениях, чтобы она подавляла шум и реверберацию в эталонной записи, сохраняя голосовой тембр. На технической странице показаны примеры с шумным, гулким и обрезанным по частотам аудио. Компания утверждает, что новая версия выдаёт более чистый результат, чем предыдущие модели семейства, при одинаково испорченном образце. Это внутреннее тестирование разработчика, отдельного независимого сравнения данного режима пока нет.
Рекламную формулировку не стоит понимать как разрешение загружать любой фрагмент из шумного видео. Производственная инструкция Alibaba по-прежнему рекомендует запись длиной 10–20 секунд, минимум пять секунд непрерывной чистой речи, отсутствие музыки, посторонних голосов и заметного фонового шума. Устойчивость к плохому аудио здесь работает как запас прочности, а хороший исходник остаётся самым надёжным способом сохранить тембр.
Есть ещё одна оговорка. Исследовательская страница рассматривает клонирование как общую способность Qwen-Audio-3.0-TTS, но актуальная англоязычная инструкция создания пользовательского голоса явно показывает qwen-audio-3.0-tts-flash и перечисляет Flash в таблице доступных моделей. Для Plus столь же однозначный путь через публичный API пока не описан. Заявлять о полностью одинаковом клонировании в обеих версиях преждевременно.
Один проход охватывает до трёх минут аудио
Qwen-Audio-3.0-TTS способна синтезировать до трёх минут речи за один проход. Системе не требуется заранее делить такой текст на короткие фрагменты, генерировать их отдельно и затем склеивать. Это снижает риск скачков громкости, темпа и интонации на границах частей.
Трёх минут достаточно для новостной озвучки, объясняющего ролика, аудиогида, сцены из игры или длинного ответа ассистента. Полноценную главу аудиокниги всё равно придётся разбивать. Публичная техническая демонстрация длинного чтения сейчас содержит китайский и английский примеры; аналогичного трёхминутного образца на русском разработчики не показали.
В основе системы находится аудиотокенизатор с частотой 12,5 кадра в секунду. Он представляет речь сравнительно редкой последовательностью элементов, поэтому авторегрессионной части требуется меньше шагов для генерации. Речь не воспроизводится с частотой 12,5 Гц: показатель относится к внутреннему представлению модели, а итоговый звук формирует отдельный компонент. Обучение проходило в пять этапов, включая раздельную подготовку языковой и акустической частей, совместное обучение и последующее обучение с подкреплением.
Документация потокового API указывает форматы PCM, WAV, MP3 и Opus с частотой дискретизации до 48 кГц. В релизном блоге выход 48 кГц всё ещё помечен как функция, которая появится позднее, тогда как техническая страница уже связывает его с повышением разрешения вокодера. Вероятнее всего, документация обновляется параллельно с развёртыванием сервиса, поэтому доступность 48 кГц стоит проверять для конкретного региона и метода API.
Первое место Artificial Analysis относится к английским голосам
Alibaba приводит собственные многоязычные измерения. По данным компании, семейство показало лучший показатель ошибок в словах или символах на 10 из 16 языков. Средний результат Flash составил 3,87, Plus - 3,96; меньшее значение считается лучшим. В тесте сходства голоса Plus набрала в среднем 82,75, Flash - 80,44. Методика и подбор тестовых фраз контролировались разработчиком, поэтому эти цифры следует воспринимать как результаты производителя.
Независимый рейтинг Artificial Analysis подтверждает высокий уровень Plus, но в более узком сценарии. На 23 июля 2026 года Qwen-Audio-3.0-TTS-Plus занимает первое место в Provider Voice Arena с рейтингом Elo 1234. За ней идут Simba 3.2 с 1230 баллами и Gemini 3.1 Flash TTS с 1215. Для Qwen собрано 1517 сравнений на восьми голосах, а доверительный интервал допускает первое или второе место. Разрыв с ближайшим соперником составляет всего четыре балла.
Artificial Analysis строит рейтинг на слепом выборе: слушатели получают две записи одного текста и отмечают более естественную. Однако Provider Voice Arena использует голоса поставщика с мужскими и женскими вариантами американского и британского английского. Категории охватывают ассистентов, клиентский сервис, развлекательный контент и передачу знаний. Русская речь в этом лидерстве не проверяется.
Следовательно, фраза «№ 1 в Artificial Analysis» корректна для текущего общего рейтинга системных англоязычных голосов. Она не доказывает, что Qwen лучше конкурентов произносит русские ударения, фамилии, географические названия и длинные числительные. Для русскоязычного рынка это пока главный пробел релиза.
Международный API стоит от $0,15 за 10 тысяч символов
Alibaba тарифицирует синтез по количеству символов во входном тексте. В международном развёртывании через Сингапур Plus стоит $0,2 за 10 тысяч символов, Flash - $0,15. В пересчёте на миллион символов получается $20 и $15 соответственно. Для каждой версии предусмотрено по 10 тысяч бесплатных символов в течение 90 дней после активации Model Studio.
На карточке Artificial Analysis для Plus указана другая стоимость - $27,6 за миллион символов при стандартных настройках API разработчика. Причина расхождения с официальной таблицей Alibaba не раскрыта. Для расчёта расходов разумнее использовать текущую страницу биллинга Model Studio и проверять регион, поскольку она определяет фактическое списание.

Qwen-Audio-3.0-TTS выглядит серьёзным обновлением производственного синтеза речи. Модель объединяет низкую задержку, свободные инструкции, локальные теги, многоязычность и длинную генерацию в одном API. Русский язык подтверждён техническими материалами и документацией клонирования, но готовая библиотека голосов, трёхминутные примеры и независимые русскоязычные тесты пока отстают от общего анонса.
Для русской версии решающими будут четыре проверки: правильность ударений, чтение чисел и сокращений, сохранение тембра на длинных фрагментах и предсказуемость эмоциональных команд. Первое место в англоязычном рейтинге даёт модели сильный старт, но звание лучшей русскоязычной TTS ещё предстоит подтвердить.
